fa
Feedback
צוף בר אור

צוף בר אור

رفتن به کانال در Telegram

ברוכים הבאים לערוץ הטלגרם שלי! צוף, 30, לקראת סיום תואר שני בדאטה סאיינס וקודח מקצועי בטוויטר: https://twitter.com/tsoofbaror אעדכן פה בכל פעם שאעלה משהו משמעותי לטוויטר, או כל דבר מעניין אחר. בתאכלס, יותר מעניין כאן מבטוויטר שלי.

نمایش بیشتر
3 270
مشترکین
+124 ساعت
+47 روز
-1130 روز
آرشیو پست ها
איזה תגובה בטוויטר גרמה לי לחשוב, והנה כל המחשבות כאן. כשאנחנו מאמנים מודל AI (כל מודל, שניה נשים בצד LLMs) יש הרבה דרכים להגדיר ״למידה״. בואו ניקח דוגמה: אימון מודל שנוהג ברכב אוטונומי. חשוב להגיד: אני לא מציג כאן איזה טקסונומיה רשמית ואפשר להסתכל על זה בהרבה דרכים, אבל תהיה מסקנה בסוף. הדרך הראשונה, הכי גרועה היא זיכרון. המכונית יודעת לנסוע אך ורק בדיוק במקומות שראתה כבר בהנחה ולא השתנו בכלל. רמה אחת מעל היא מצב שבו יש רובסטיות לרעש, אבל עדיין המכונית לא מצליחה לנהוג בכבישים שלא התאמנה עליהם. כן מתמודדת עם הולכי רגל, פח שזז וכו. רמה אחת מעל היא הכללת ״אינטרפולציה״. אימנו את המכונית לנסוע בהרבה חלקים בת״א, אבל לא בכל ת״א, והיא מצליחה לנהוג בתל אביב כולה. הרמה הבאה היא התחלה של הצלחה out of distribution - לקחנו את המכונית לרמת גן, דומה אבל שונה קצת, וגם שם היא הצליחה לנהוג. עוד רמה יכולה להיות ממש Regime-shift. נניח, נהיגה בכביש עם קרח. זה לא עצם הקרח שנראה אחרת, זה עצם זה שעכשיו בלימה מתנהגת אחרת לגמרי. רמה נוספת (לא יודע אם מעל) היא למידה אקסטרפולטיבית - המכונית התאמנה על נהיגה עד 70 קמ״ש ומתמודדת טוב עם נהיגה גם ב120 קמ״ש - לא רק מחוץ להתפלגות, אלא ממש מחוץ לטווח שהיה זמין באימון. והholy grail האמיתי - zero shot learning, מצב שבו יום אחד נוסף תמרור חדש, ואיכשהו רק אומרים למכונית ״שימי לב זה תמרור שאומר שחייבים להדליק אורות״ והיא תעשה את זה על הפעם הראשונה מבלי שראתה אותו אף פעם. עכשיו - למה אני מבלבל פה במוח? כי עכשיו תנסו להכיל את הרעיונות האלה על מודלי שפה, או מודלי AI מסמלצי אינטיליגנציה. במודלים כאלה מאד מאד קשה להבין באיזה רמה אנחנו נמצאים, וזה יכול להיות מאד מתעתע. האם פתרון בעיה פתוחה במתמטיקה זה אינטרפולציה? זה out of distribution? מציאת פריצת zero day בסייבר, לאן משתייכת? ואיך בכלל אפשר לבחון את כל הרעיונות האלה על מודל שליטרלי התאמן על כל הידע האנושי, וכדי לייצר לו ״סביבת מבחן״ צריך, well, ידע אנושי שאין לו? זאת בעצם הבעיה השורשית: קשה להבין מה זה out of distribution למודלי שפה. הם יסמלצו את החוויה האנושית של התמודדות עם כל אחת מהבעיות האלה, אבל מילת המפתח היא - יסמלצו. זה יראה כמו. זה ירגיש כמו. (ירגיש כמו אדם שמנסה להחליט איזה מניה לקנות, ירגיש כמו אדם שמנסה לקבל החלטה מקצועית, ירגיש כמו אדם שמנסה לפתור בעיה הנדסית) שאלה נוספת שנשאלת - למה זה בכלל משנה? מה שמשנה זה שימושיות. זה עובד? מעולה. זה משנה בעיני כי עד שלא נבין או נפתח שיטות אמיתיות לבחון את הדברים האלה, לא נדע אם הקונספט של Scale + RL הוא הדרך שלנו לייצר אינטיליגנציה בקופסה שבאמת תצעיד את האנושות קדימה. אם תשאלו אותי, המבחן היחיד שיש לי בראש הוא אם מודל שפה ימציא כלים חדשים במתמטיקה שיהיו בעלי ערך לפתרון בעיות פתוחות. אחד הדברים שאומרים כשמדברים לדוגמה על השערת רימן (aka, אחת הבעיות הפתוחות הכי גדולות במתמטיקה) היא שכדי לפתור אותה צריך להמציא מתמטיקה שעוד לא קיימת. בקיצור, מחשבות מחשבות בזמן שהסוכנים עובדים.

https://innovationisrael.org.il/event/aiinthefuture/ יש פה בארשבעים שמגיעים?

האם גם אתם מבלים את רוב הנוירונים במוח שלכם לנסות להבין לאן כל האירוע הזה של האייג׳נטים הולך? אני מרגיש שהמון מהעיסוק שלי הוא לרפד ולהזיז מכשולים מהדרך לרובוט בלי עיניים. סקילים, MCP, לופים, כל מיני דברים שמנסים לקחת מכונה שלא יודעת לעשות כלום באמת ולתת לה לעשות דברים. מצד אחד, זה מאד עובד. זה מביא תוצאות. מצד שני, עוד כמה נוכל לחזק מודלי בסיס ולייצר פלסטרים מפוארים? האם להשקיע באורקסטרציה היא השקעה עם ROI טוב לחברה בטווח הקצר (עזבו בינוני וארוך. קצר. שנה-שנתיים).

הפרק בגיקונומי איתו הרבה יותר טוב. לכו חפשו, אבל בנושא אחר:

בדרך כלל אני רוצה לשבור את המסך כשאני רואה את התקשורת מדברת על AI אבל - רעיון מופלא עם בחור שעוד נשמע עליו הרבה שמזקק המון דברים שכבר נכתבו פה בערוץ :) אפשר להאזין כפודקאסט בנסיעה. ממליץ מאד https://youtu.be/51W3D_J9FBU?si=DEWQDek-lIfmOMi0

ג׳מיני פלאש 3.7 בחוץ ו3.5 פרו עוד לא ראה אוויר עולם מה קורה גוגל מה קורה

פלאש 3.7 בחוץ, ועוד אין זכר ל3.5 פרו (גוגל) מה קורה לגוגל

2$/6$ מעניין מאד מאד. גרוק 4.6
2$/6$ מעניין מאד מאד. גרוק 4.6

בינה מלאכותית התקרבה לראשונה לאחת משתי השאלות הפתוחות המפורסמות במתמטיקה (השנייה היא P עפ NP).
התקרב. לא פתר. הסיפור בקצרה. ב-1859 רימן ניחש ניחוש: לפונקציה מסוימת יש אינסוף נקודות מיוחדות, וכולן לדעתו יושבות על קו ישר אחד. 167 שנה אף אחד לא הצליח להוכיח את זה. הניחוש הזה שווה מיליון דולר. כשלא מצליחים להוכיח "כולן", מוכיחים "לפחות אחוז מסוים מהן". האחוז הזה תקוע שנים על 41.66%. קלוד, גרסת מחקר שעדיין לא שוחררה, הביא אותו ל-67.25%. להשוואה: בני אדם הצליחו להזיז אותו 0.8 נקודות ב-37 שנה. זו קפיצה אמיתית. אבל היא לא "שני שליש מהדרך", ומשתי סיבות: סיבה ראשונה: האחוז מודד אותנו, לא את המתמטיקה. 67% לא אומר ששני שליש מהנקודות על הקו והשאר מחוצה לו. בפועל בדקו כבר 20 טריליון נקודות ואף אחת לא חרגה. כולם משוכנעים שהתשובה היא כל הנקודות. פשוט אין הוכחה. סיבה שנייה: אפילו 100% לא היה מוכיח את הניחוש. נשמע מוזר, אז דוגמה. קחו את כל המספרים, ומתוכם רק את 10, 100, 1000, 10000... יש אינסוף כאלה. ובכל זאת, אם תספרו כמה אחוז הם מכל המספרים, תקבלו כמעט אפס. הם דלילים מדי מכדי להירשם. עכשיו החזרה לענייננו: גם אם נוכיח "100% מהנקודות על הקו", עדיין יכולים להסתובב שם אינסוף חריגים. פשוט דלילים מדי מכדי להוריד את האחוז. לכן הפער בין 67% למיליון דולר הוא לא 33 נקודות אחוז. זו שאלה אחרת לגמרי. אנטרופיק אומרים את זה בעצמם: הם לא מצפים שהשיטה תגיע להוכחה. ומה כן קרה כאן, בעיניי: קלוד לא המציא מתמטיקה. הוא לקח מאמר מ-2000 וחיבר אותו לעבודה עדכנית של ארבעה חוקרים. מישהו כבר הגיע ל-67% קודם אבל רק בהנחה נוספת. כאן ההנחה ירדה. שני החלקים ישבו על המדף שנים, בשני חדרים שונים, ואף אחד לא הכניס אותם לאותו חדר. כלומר: מה שחסר לא היה גאונות. מה שחסר היה מישהו שקרא הכל. מה עוד לא סגור: אין ביקורת עמיתים רגילה, ואי אפשר לשחזר את הריצה כי המודל לא שוחרר. מצד שני ההוכחה נכתבה בצורה שמחשב יכול לבדוק, ושני מומחים חיצוניים עברו עליה. על התהליך אפשר להתווכח. על ההוכחה עצמה פחות. ולסיום, הפרט האהוב עליי: הניסיון הראשון נכשל אחרי 650 רעיונות. סוף סוף AI שחווה דוקטורט אמיתי.   https://www.anthropic.com/research/riemann-zeta

המלצת קריאה

(לא ממומן) וובינר לצוותי R&D על subagents & parallel agents יום חמישי, 13 באוגוסט, מבית Latent AI למי הוובינר מיועד? •⁠ ⁠מפתח
(לא ממומן) וובינר לצוותי R&D על subagents & parallel agents יום חמישי, 13 באוגוסט, מבית Latent AI למי הוובינר מיועד? •⁠ ⁠מפתחים וצוותי פיתוח שעובדים עם קלוד (או רוצים לעבוד עם קלוד) •⁠ ⁠למי שמפעיל אייג'נט אחד בכל פעם (ולא כמה במקביל) •⁠ ⁠למי שרוצה לעבוד עם worktrees ולא לשבור את הקודבייס •⁠ ⁠למי שרוצה לעבוד עם סאב-אייג'נטים כדי לשמור על ה-context window הזדמנות מיוחדת לקבל הצצה לקורס המלא של Latent AI לצוותי פיתוח להרשמה ופרטים נוספים >> https://bit.ly/4gmoIIb על המרצה: יונתן ירקוני, מנכ"ל ו-co-founder של Latent AI, לשעבר בצוות ה-AI של גוגל, מפתח וראש צוות

אחרי שהיינו במתמטיקה, הסייבר חזר שוב לאופנה. אופןAI שלנו מדווחת עוד ועוד על כמה שהמודל שלהם Astra פיצח את האטום בעולם הסייבר, פורץ, נושך. אם אתם עוקבים אחרי כבר תקופה, אתם בטח יודעים שלחברות יש סוג של ״רמות סיווג״ למודלים, שמעריכים את המסוכנות שלהם במגוון תחומים - נשק כימי וביולוגי, סייבר וכו. אז OAI מגדירים את Astra ברמת ״critical״ בסיווג שלהם. מה זה אומר? יותר אבטחה על המשקולות שלו, יותר כלי ניתור וניהול.. בסדר. אחלה. השאלה המתבקשת היא למה כל הPR הזה. המודל עוד לא שוחרר. בספר של פיטר תיל, Zero to One, הוא כותב: ״מונופולים משקרים כדי להגן על עצמם, מפריזים בכוח של התחרות שלהם שלא באמת קיימת. לא-מונופולים עושים ההפך, אומרים שהם בליגה משלהם״. אני מרגיש, באיזשהו מקום, שחברות הAI חיות בcycle. יום אחד AI זה קומודיטי, הסינים עושים אותו דבר, אין שום יחודיות, כולם אותו דבר. יום אחרי זה - אנחנו מיוחדים, צריך עלינו רגולציה, אנחנו מייצרים מפלצת חסרת מעצורים. אני רגע אתן פה טיעון, שאולי אפשר להתווכח איתו, אבל חשוב שיכתב ונמשיך הלאה. אין ספק שיש פה מפלצת כשהAI הרצחני רק בצד התוקף. בסייבר, כמו בעצם בעולם המלחמה הסטנדרטי, ברגע שיש לצד אחד יתרון יחסי עוצמתי הוא אכן החזק, וככל שעובר הזמן ההגנה משתפרת - ומגיעים לאקוויליבריום. אם הסטנדרט בתקיפה הוא מודלים גאונים שמתקיפים, לא חוכמה להראות שיש פה סכנה לאנושות כשאין בצד השני מודלים גאונים שמגינים. האזהרה על היציאה מאיזון חשובה, אבל כאמור, אני מרגיש שיש כאן בניית נרטיב הרבה יותר מאשר ניסיון להגיד את האמת. יש פה באמת מלכוד: 1. חברות הAI מבינים שהם מפתחות כלים שיש בהם סיכון בטווח הקצר. 2. המשקיעים כבר רוצים לראות רווחים, עבר הרבה זמן, וצריך להיות הכי טובים. 3. הסינים בזנב, רחוקים בעיני 8-10 חודשים (למרות שאני יודע שחלק מכם יגידו פחוות), אבל רודפים. 4. החברות ישמחו לרגולציה שתעכב את המתחרים שלהם ותיתן להן עוד קצת זמן ומרחב נשימה לעבוד, ושתרגיע גם את המשקיעים - שבסדר שדברים לוקחים קצת יותר זמן, יש רגולציה. הבעיה שכל הדברים האלה לא מתכנסים. אי אפשר גם לרוץ קדימה, גם לנסות לרצות את המשקיעים בהצגת יכולות מפחידות בסדר גודל מהסינים (אולי?) ולהגיד ״אנחנו הכי טובים״, גם להגיד ״צריך רגולציה, כי כולם פה אותו דבר וצריך רגע להאט את הקצב״ ובסוף המעגל - לגייס עוד כסף כי צריך עוד דאטה סנטרים. בקיצור, אני מרגיש שיש פה מעגל בלבול רציני מאד בעולם חברות הAI. התחלנו מבליץ סייבר (Mythos), המשכנו לבליץ רגולציה (המכתב של דמיס הסביס, הפוסט של סאטיה ועוד ועוד), המשכנו לבליץ "Open Source ישלוט״ (כתבתי פה לא מזמן, המכתב של ג׳נסן, אלכס קארפ) ועכשיו אנחנו שוב ב״סייבר מפחיד סייבר״. בקיצור, החברות צריכות להחליט - הן מונופול? הן קומודיטי? תלוי ביום בשבוע?

Muse Spark 1.2 המודל של Meta. כמובן שיהיה "Muse Code״. מערכת אייג׳נטית: ״Muse Code runs specialized background agents that st
Muse Spark 1.2 המודל של Meta. כמובן שיהיה "Muse Code״. מערכת אייג׳נטית: ״Muse Code runs specialized background agents that stay active your whole session, so they build up context over time instead of starting from scratch on every task.״ קיצר, הנה מארק: https://x.com/finkd/status/2085080750034940201/photo/1

https://x.com/tsoofbaror/status/2085335292400296331 והנה זה קורה: אני מחפש מישהו לעבוד איתי. גיוס ראשון. אם אתם מהתחום ואני נראה לכם מגניב, יש פה הזדמנות. אשמח לשיתופים, תגובות וכל השבאנג שיעזרו לי למצוא את האחד (או האחת).

הממ, רגע משהו על ARC AGI 3 - נראה שהם השיגוע תוצאה כזו על הpublic data set, ולא על סט הבחינה הפנימי. יש מצב שזו אזעקת שוא, הרבה כבר הצליחו

שני אירועים חדשותיים לא בלתי-מעניינים: 1. דמיס הסביס מפסיק להיות מנכ״ל דיפמיינד - והופך להיות ה... unit chairman? זה בא ביחד עם העזיבה של ג׳ף דין, המדען הראשי המיתולוגי של גוגל, שהולך להקים חברת AI משלו. הסביס הולך להיות גם הchief scientist של גוגל, ולהמשיך להוביל את Isomorphic Labs - חברת הAI של גוגל שעוסקת בפיתוח תרופות. איזה ג׳וב. 2. חברה בשם Prime Intellect יצרו Harness שלטענתם פותר את ARC-AGI 3, בציון 95%+-. המבחן ARC AGI 3 הוא סוג של מבחן ״משחקים״ שמצריכים תכנון לטווח ארוך (יחסית). הממוצע היום עומד על 10-30 אחוז בקרב המודלים החזקים השונים. למיטב הבנתי זה עוד לא אומת סופית ע״י ARC AGI עצמם.

החגיגה של מחירי היצף מסין נגמרת?
החגיגה של מחירי היצף מסין נגמרת?

ובנושא אחר, החבר׳ה של קודקס מדברים על ״שלב חדש באבולוציה של שימוש בAI״ עוד חודשיים שלושה. בטוויטר מדברים על זה שיהיה מעבר מ״ק
ובנושא אחר, החבר׳ה של קודקס מדברים על ״שלב חדש באבולוציה של שימוש בAI״ עוד חודשיים שלושה. בטוויטר מדברים על זה שיהיה מעבר מ״קודקס (או קלוד קוד) על המחשב שלי״ ל״קודקס בענן״. רק שכבר יש קודקס בענן. ככה שצריכה להיות פה סוג של פריצת דרך פרודקטית. אולי קודקס יגיע עם סוג של מחשב על הענן על-מלא? זה בעיה. כי מה הם יתנו, לינוקס? ואם אני צריך ווינדוס או מק? בכל מקרה, מסקרן.

מודל עסקי מעניין. מציעים פלטפורמה אייג׳נטית ״ללא לימיטים״ - ואיך? בעצם כל סוכן שרץ במקביל, משלמים עליו קבוע כמו על חברת סלולא
מודל עסקי מעניין. מציעים פלטפורמה אייג׳נטית ״ללא לימיטים״ - ואיך? בעצם כל סוכן שרץ במקביל, משלמים עליו קבוע כמו על חברת סלולאר. כמו ״קו״. בסוף אפשר לחשב בדיוק כמה טוקנים סוכן שעובד 24.7 לוקח ולתמחר בצורה כלשהי (?) וזה רעיון די חמוד בעיני. מוריד את הלחץ של לראות את הפס יורד - פשוט לשלם ״פר SIM״.

אפשר לברך על זה שנגמר ה״תהליך״, אחרי אי אילו עיכובים טפשיים. MSc.
אפשר לברך על זה שנגמר ה״תהליך״, אחרי אי אילו עיכובים טפשיים. MSc.