צוף בר אור
前往频道在 Telegram
ברוכים הבאים לערוץ הטלגרם שלי! צוף, 30, לקראת סיום תואר שני בדאטה סאיינס וקודח מקצועי בטוויטר: https://twitter.com/tsoofbaror אעדכן פה בכל פעם שאעלה משהו משמעותי לטוויטר, או כל דבר מעניין אחר. בתאכלס, יותר מעניין כאן מבטוויטר שלי.
显示更多3 322
订阅者
-524 小时
+87 天
+5630 天
数据加载中...
吸引订阅者
十月 '2610月 '26
十月 '26
+28
在0个频道中
九月 '26
+86
在3个频道中
Get PRO
八月 '26
+51
在0个频道中
Get PRO
七月 '26
+50
在0个频道中
Get PRO
六月 '26
+122
在0个频道中
Get PRO
五月 '26
+314
在2个频道中
Get PRO
四月 '26
+57
在0个频道中
Get PRO
三月 '26
+41
在0个频道中
Get PRO
二月 '26
+110
在0个频道中
Get PRO
一月 '26
+34
在1个频道中
Get PRO
十二月 '25
+56
在0个频道中
Get PRO
十一月 '25
+245
在0个频道中
Get PRO
十月 '25
+80
在0个频道中
Get PRO
九月 '25
+15
在0个频道中
Get PRO
八月 '25
+34
在1个频道中
Get PRO
七月 '25
+16
在0个频道中
Get PRO
六月 '25
+64
在0个频道中
Get PRO
五月 '25
+64
在0个频道中
Get PRO
四月 '25
+68
在0个频道中
Get PRO
三月 '25
+32
在0个频道中
Get PRO
二月 '25
+55
在0个频道中
Get PRO
一月 '25
+49
在0个频道中
Get PRO
十二月 '24
+22
在0个频道中
Get PRO
十一月 '24
+30
在0个频道中
Get PRO
十月 '24
+32
在0个频道中
Get PRO
九月 '24
+65
在1个频道中
Get PRO
八月 '24
+76
在0个频道中
Get PRO
七月 '24
+52
在1个频道中
Get PRO
六月 '24
+91
在4个频道中
Get PRO
五月 '24
+452
在3个频道中
Get PRO
四月 '24
+32
在0个频道中
Get PRO
三月 '24
+103
在0个频道中
Get PRO
二月 '24
+37
在0个频道中
Get PRO
一月 '24
+1 396
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 06 十月 | +1 | |||
| 05 十月 | +1 | |||
| 04 十月 | +3 | |||
| 03 十月 | +8 | |||
| 02 十月 | +13 | |||
| 01 十月 | +2 |
频道帖子
https://www.axios.com/2026/10/04/reflection-open-weight-ai
אגב הנה עוד דוגמה למה צריך פשוט להמנע מלקרוא על AI בחדשות.
זה אקסיוס, לא תגידו אתר קיקיוני.
״set to shake up AI race״
אחלה מודל. אחלה התקדמות, שום shake ושם נעליים
| 2 | דבר אחד מעניין אותי:
האם גם הם עשו distillation או השתמשו בדאטה מג׳ונרט מג׳יפיטי וקלוד?
אם כן, יש פה כבר עניין. אף אחד לא יתבע חברות סיניות, אבל חברה אמריקאית?
מסקרן. | 531 |
| 3 | oh wow
זה מגניב. מודל אמריקאי חדש (אופן סורס!), שמגיע לרמה של הסיניים הגדולים.
קוראים לו Beam, של חברת Reflection.
הקטע? הוא רבע בגודל מהם.
הוא 503B עם 23B אקטיביים.
לשם השוואה:
קוון מקס 3.8 הוא 2.4T עם 98B אקטיביים. פי 5 בגודל.
מול glm 5.2 השיפור צנוע יותר - הוא 750b עם 40b אקטיביים. זה עדיין גדול משמעותית. | 537 |
| 4 | הדיבור הוא שאסטרה וסול הם looped transformers. עוד לא כתבתי על זה בערוץ, כי גם אני לא נכנסתי לזה עוד לעומק. אבל אם אני מבין את הרעיון נכון, יש אלמנט שמזכיר קצת RNN, במקום שהריזונינג יהיה ״בחוץ״ (יבזבז טוקנים״) הוא ״בפנים״ ובעצם לא בא לידי ביטוי בבזבוז טוקנים. במילים אחרות: כל טוקן יעיל יותר.
אני אכנס קצת למאמרים על זה, עוד לא הצלחתי להגיע לזה ואתן הסבר קצת יותר מדוייק ומפורט. אבל ממה שאני מבין, השוואת מהירות-פר-טוקן כבר הפכה להיות קצת לא הוגנת.
עוד על זה בהמשך | 617 |
| 5 | רץ בטוויטר. לא יודע לאמת.
על פניו נראה שאופוס 5.5 מהיר עדיין פי 1.5, אבל יש פה קאץ׳ | 638 |
| 6 | לא יודע מה הלחץ והאימה, אבל OpenAI הכריזו על ״28 ימים של 28 שיפורים״ או משהו כזה.
היום הם אמרו שהם העלו את מהירות המודלים ב50% (סול ואסטרה) אקרוס דה בורד. קצת מוזר לי כל הגמיפיקציה הזו של OpenAI, אבל זה אחלה community engagement.
על כל יום שלא יהיה שיפור יהיה banked reset לטוקנים, גם אחלה. | 627 |
| 7 | https://x.com/KerenKoshman/status/2106425330093404349
קרן כותבת בX:
״ביליתי כמה שעות אצל אנטרופיק בסאן פרנסיסקו (פגישות מעוררות מחשבה),ובואו נדבר על ההארנס מול המודל.
זה לא סוד שאני לאחרונה חושבת יותר ויותר שהשכבה הנכונה להשקיע בה היא ההארנס, ושהיא חשובה יותר מהמודל עצמו. מחקרים כמו זה של ברקלי שמראים ששכבת ההארנס משפיעה עד 70 אחוז יותר מהמודל על האיכות והמחיר לדוגמא מחזקים את המחשבה שלי.
אנטרופיק מצידם חושבים שהנקודה בזמן שאנחנו נמצאים בה היא כמו פרומפט אנגנירינג של לפני שנה וחצי, רק עם הארנסים וknowledge graph. לטענתם, בדיוק כמו שנוצר לרגע מקצוע של פרומפט אינגנירינג ומהר מאוד המודלים הפכו להיות אלו שכותבים את הפרומפטים הכי טוב, כך יקרה גם עם השכבות הנוספות שאנחנו כרגע מדגישים (זכרון, קונטקסט וכלים). קרי, ההארנס הולך ״להיבלע״ לתוך המודל.
מודה שהם גרמו לי לתהות מחדש, צריך לזכור שהם רואים חצי שנה קדימה לפחות, ואני מאמינה שהם רואים את ההשפעה על ההארנסים שהם בעצמם בנו (כמו קלוד קוד).
יאללה טוויטר, מה דעתכם?״
בעיני זאת אמירה קצת מוזרה.
המודל עצמו הוא text to text שלא יכול לעשות כלום. ההארנס זה האינטרפייס מול המחשב שממיר טקסט חסר חיים לפעולות.
מה הכוונה? שלא יהיה אינטרפייס? שום דבר לא ״יבלע״ במודל כי המודל הוא ג׳נרטן טקסט.
״לכתוב פרומפטים״ זה הפעולה הידנית, לא המהותית. הפעולה המהותית לנסות ניסיון את המודל המנטלי של המשימה וכיווני הפתרון שיש לנו בראש למודל.
אנחנו גם ככה כותבים למודלים כמו אנשי מערות עילגים והם מבינים מה לעשות. הכתיבה עצמה זה לא הקטע.
כבר מזמן אני מרגיש שהבלוקר האמיתי הוא לא השכל של המודל אלא היכולת שלנו להמיר מודלים מנטליים לטקסט כתוב. עד שלא יהיה שבב במוח שיעשה את זה, זה הבוטלנק. מודל טוב יכול לנחש יותר טוב למה אנחנו מתכוונים, וניחוש הוא מתכון טוב לטעויות ובניית מודל מנטלי אחר ממה שיש לנו בראש.
המודל בעצם עושה אינטרפולציה במקרה הטוב ואקסטרפולציה במקרה הרע לרעיונות שלנו, וכשזה קורה, יש שגיאות חיזוי, ומה שהמודל עושה מתנתק ממה שאנחנו מצפים שיקרה.
לא תמיד זה רע. זה רק גורם לנו לאבד מעקב.
ואז אנחנו ממשיכים עם המודל המנטלי שלנו, כשבקוד בפועל יש מודל מנטלי אחר, עד שמגיע מצב שהם כל כך לא מתאימים שאי אפשר להתקדם.
זה לא הארנס, זה לא טכנולוגיה, זה לא שכל של מודל - זאת מגבלה אנושית.
אז אם נחזור לתוכן הפוסט: אני באמת לא מבין למה אנת׳רופיק מתכוונים.
מתחבר לפוסט הקודם | 788 |
| 8 | בדקתי את פיצ׳ר שיבוט הקול המקצועי של Eleven Labs. הכנסתי את רוב הפודקאסטים שלי, ועוד כמה הקראות של דברים. כמעט שעתיים של דיבור.
תראו ת׳דבר הזה.
כמה טעויות ספרתם?
נעים להאזנה? | 759 |
| 9 | בואנה, תראו משהו מדליק. יש פה עוד אנשים שזוכרים שפעם עשיתי פודקאסט? | 738 |
| 10 | למי שביקש את הפוסט כאן, סליחה על העיכוב :) | 732 |
| 11 | הBurnout החדש, וקצת מחשבות על פיתוח עם AI
כל מי שבתחום מרגיש את זה. ״אני לא עובד, הAI עושה הכל״ ואיכשהו אני 12 שעות מול המחשב.
מפתחים עם AI? בואו לקרוא, אולי אצליח לשים את הרגשות שלכם בקצת מילים.
התוצר? אין ספק שהוא יותר יפה ממה שהייתי כותב ביד. יש פה גם פחות באגים מהסוג שאני הייתי עושה, אבל יש בו גם קצת יותר באגים מסוג שכנראה אני אף פעם לא הייתי מייצר. אני חושב הרבה על התופעה הזו ומנסה להסביר אותה לעצמי, ואני רוצה לשתף אתכם במסקנות שהגעתי אליהן עד כה.
קודם כל, נתחיל במובן מאליו: לאף אחד אין מושג מה הוא עושה. במשך כמה עשרות שנים, אנשים בנו שיטות פיתוח שמתאימות לבני אדם. אג׳ייל, קוד ריביו, PR, יו-ניים-איט. הכל שיטות שאמורות לקחת כל מיני חסרונות אנושיים ולפתור אותם.
הבעיה: אנחנו עדיין מסתכלים על AI כ״מתכנת אנושי אוטומטי״ ומכילים את כל הכללים של פיתוח אנושי עליו, וזה בעיני שגוי מהיסוד. אם יש לי מסקנה אחת מ10 החודשים האחרונים: שום קונספט פיתוח לא טוב אוטומטית. אני עוד לא יודע מה כן.
הדבר השני שעובר לי בראש הוא לנסות לאפיין את הBurnout שאני מרגיש, ודווקא אותו אני יודע לאפיין במדוייק: Overflow של קבלת החלטות.
לפני שנה עבדתי על משהו - היו כמה ימי תכנון, ואז שבועיים של מימוש. במהלך השבועיים האלה ותוך כדי המימוש המוח המשיך לעבוד. חלק אחד בו עשה את ״ההנדסה״ וחלק שני חשב כל פעם על תכנון מול ביצוע, והאם צריך לשנות משהו בהנחות היסוד.
השלב הזה נתן ״מנוחה מחשבתית״ בין החלטה להחלטה ואפשר לקבל ביטחון בהחלטות שקיבלנו. לא עוד. תהליך קבלת החלטות של חודשיים נדחס ביום עבודה אחד. כל החלטה הרת גורל, ונורא קל פשוט להגיד לAI ״תעשה מה שאתה רואה לנכון״.
לצערי, מה שהAI רואה לנכון במקרים לא מעטים (אבל גם לא רבים) שגוי. לא שגוי בקטע של ״לא עובד״, אלא שגוי בקטע של ״לא רואה את הצורך, התמונה הגדולה ואיך זה יכול להשתנות בעתיד ומצריך תכנון רובסטי״.
למה זה לא הולך להשתנות? לא כי הAI לא חכם ועוד יתחכם, אלא כי הAI לא יכול לקרוא את המחשבות שלנו, של המנהלים שלנו ולהרגיש את החיים. לנצח לא נעביר לו מידע מלא, ולכן הוא לנצח יוכל לעבוד רק עם המידע שיש לו.
סתם, מה אני אומר לנצח, מישהו יודע איפה המודלים יהיו עוד שנה? אין לי מושג.
אבל כל הדברים האלה נכונים היום עם קלוד פייבל אולטרה אקסטרה 5.1 כמו שהם היו נכונים בדצמבר 2025 עם קלוד 4 או מה שזה לא היה, ולא מרגיש שזה בדרך להשתנות עם כל מודל חדש שיוצא.
אפילו ההפך. הם בטוחים בעצמם יותר. נותנים פתרונות מורכבים יותר, וטועים לפעמים בגדול יותר. אבל זאת רק ההרגשה שלי.
כאן נכנס הBurnout.
בניסיון להיות ״מרוכז״, כשאני עובד על משהו חשוב אני מנסה לא למקבל משימות. ואז המודל חושב. אז אני פותח X וגולל. ואז הוא סיים לחשב, ואני עושה Context Switch להזכר מה שאלתי ולהבין איזה החלטה צריך לקבל. זאת דינמיקה גרועה שגם, אין לי אליה כרגע פתרון.
עוד החלטה, עוד החלטה, ועוד פעם אני מתפתה להגיד לו ״תעשה מה שאתה חושב״ כמו מהמר שמחליט שאת החלק הזה הוא לא צריך להבין עד הסוף.
וזה מוביל אותי לנקודה השלישית והאחרונה.
אין לי מושג מה אני צריך להבין ומה לא.
אנחנו מדברים על זה שעבודה עם AI זאת האבסטרקציה החדשה: הפיתוח מתרחש באנגלית (או בעברית אם אתם ממש סוטים). אבל לאיזה רמה אני צריך לרדת בתכנון?
האם אני עדיין זה שצריך להגדיר כל שדה בData Structure או לזרום עם הAI? האם יש חלקים בארכיטקטורה שלא מעניין אותי איך בנויים בכלל, או שאני צריך לדעת על כל קריאת db/cache וwhat not? איך אני יודע מה pain point שאין סיכוי שלא אדע בו כל פיפס ומה סתם שכבת display לא מעניינת?
זאת בעצם אבסטרקציה מהמרת. אני צריך להמר בכל פעם על מה אני צריך לבזבז את הזמן שלי ועל מה לא.
זה מתחבר לנקודה הראשונה: אף אחד לא יודע לפתח עם AI.
אדם א׳ יגיד לך ״עזוב, אני לא יודע כלום, הAI עושה הכל הכי טוב והכל עובד״ ואדם ב׳ יגיד שאין שום דבר בקוד שהוא לא מכיר, והוא גם קורא את הקוד שהAI כותב.
מי צודק? לא יודע.
הנקודה היא שכל הדבר הזה מ-ע-י-י-ף.
מה לדעת? מה לבדוק? לאשר? לקרוא? כמה ההחלטה הזו חשובה? אני עובד נכון?
פעם היה פשוט. עובדים על משהו אחד. לאט לאט, בונים, בודקים, מעריכים מחדש.
עכשיו? אין לי מושג.
אבל זה נורא מעייף. | 758 |
| 12 | https://x.com/tsoofbaror/status/2105947785384378471
מזמן לא כתבתי שרשור בטוויxטר, הנה זה קרה | 833 |
| 13 | https://www.vals.ai/home
אצלם מדורג ראשון. | 891 |
| 14 | אגב מרגיש לי שיש קו אחיד בPR של גוגל שאומר לכל המהנדסים שלהם לכתוב ברשתות שזה הפך להיות המודל שהם משתמשים בו ביום יום כסוג של סיגנל שזה מודל באמת טוב. | 880 |
| 15 | בכל מקרה, נמתין שנוכל לקבל אותו בכלל. כרגע לא זמין לקהל הרחב.
השאלה הגדולה פה היא האם הגרסה הזו של ארגון היא מה שתגיע אלינו. כבר ראינו מודל שנקרא Mythos שמעולם לא קיבלנו, אלא גרסה אחרת שלו בשם Fable שביצועיה שונים (פחותים) משל Mythos.
אני מקווה שזה לא יהיה המקרה כאן. | 958 |
| 16 | אני תוהה איך התכונה הזו של ארגון תשפיע על העבודה איתו כמודל אייג׳נטי בתוך הארנס. לצערי, הבנצ׳מרק הזה מאד מכוון ידע, לא עבודה, אז אני יודע ממש להשליך ממנו אל העולם האמיתי. אבל זאת נקודה מאד מעניינת לבחון בה עבודה עם ארגון כאייג׳נט. | 945 |
| 17 | הפוסט המקורי | 866 |
| 18 | חשוב להגיד שיש גם מדד שלישי, AA-Omniscience Index: Score, שהוא סוג של אינדקס משוקלל של הזיות מול הצלחה. הוא פחות מעניין אותי כי יש פה המון עניין של העדפה - יכולות וביטחון עצמי מול פחות יכולות ופקפוק עצמי. זה לא בהכרח ליניארי - זה העדפת משתמש. | 1 045 |
| 19 | ארגון (ג׳מיני 4) הוא קצת אנומליה.
מקבל 50% בהצלחה ו15% (!) בהזיות.
זה יחס חריג למודל frontier. מהשיח של החבר׳ה של גוגל ברשתות, הם אומרים שלמודל יש המון ״ביקורת עצמית״, שזאת לא תכונה כל כך מדוברת. האמירה הזו מקבלת גיבוי די רציני עם הבנצ׳מרק הזה. | 1 055 |
| 20 | המודלים הממציאים ביותר הם פייבל ואופס כמובן, עם 73% ו66% בהתאמה.
אני מזכיר:
73% אומר שב73% מהשאלות שפייבל טעה בהן - הוא המציא תשובה נכונה.
המודלים של OAI טובים יותר במובן הזה, עם אסטרה שמקבל 51% בmax, וסול 6.1 עם 54%.
יש כאן תופעה ליניארית יחסית: מודל חכם, מודל מחרטט. זאת תופעת לוואי ידועה ומורכבת של post training שאפשר לדון הרבה על למה מתרחשת, אבל היחס ההפוך הזה נשמר.
אם ניקח את גרוק 4.7 לדוגמא, שמקבל ציון 47% בהצלחה, הוא מקבל 29% בהזיות. הדפוס די נשמר.
ארגון? 15% | 844 |
