צוף בר אור
Відкрити в Telegram
ברוכים הבאים לערוץ הטלגרם שלי! צוף, 30, לקראת סיום תואר שני בדאטה סאיינס וקודח מקצועי בטוויטר: https://twitter.com/tsoofbaror אעדכן פה בכל פעם שאעלה משהו משמעותי לטוויטר, או כל דבר מעניין אחר. בתאכלס, יותר מעניין כאן מבטוויטר שלי.
Показати більше3 270
Підписники
+124 години
+47 днів
-1130 день
Архів дописів
3 267
איזה תגובה בטוויטר גרמה לי לחשוב, והנה כל המחשבות כאן.
כשאנחנו מאמנים מודל AI (כל מודל, שניה נשים בצד LLMs) יש הרבה דרכים להגדיר ״למידה״.
בואו ניקח דוגמה: אימון מודל שנוהג ברכב אוטונומי.
חשוב להגיד: אני לא מציג כאן איזה טקסונומיה רשמית ואפשר להסתכל על זה בהרבה דרכים, אבל תהיה מסקנה בסוף.
הדרך הראשונה, הכי גרועה היא זיכרון. המכונית יודעת לנסוע אך ורק בדיוק במקומות שראתה כבר בהנחה ולא השתנו בכלל.
רמה אחת מעל היא מצב שבו יש רובסטיות לרעש, אבל עדיין המכונית לא מצליחה לנהוג בכבישים שלא התאמנה עליהם. כן מתמודדת עם הולכי רגל, פח שזז וכו.
רמה אחת מעל היא הכללת ״אינטרפולציה״. אימנו את המכונית לנסוע בהרבה חלקים בת״א, אבל לא בכל ת״א, והיא מצליחה לנהוג בתל אביב כולה.
הרמה הבאה היא התחלה של הצלחה out of distribution - לקחנו את המכונית לרמת גן, דומה אבל שונה קצת, וגם שם היא הצליחה לנהוג.
עוד רמה יכולה להיות ממש Regime-shift. נניח, נהיגה בכביש עם קרח. זה לא עצם הקרח שנראה אחרת, זה עצם זה שעכשיו בלימה מתנהגת אחרת לגמרי.
רמה נוספת (לא יודע אם מעל) היא למידה אקסטרפולטיבית - המכונית התאמנה על נהיגה עד 70 קמ״ש ומתמודדת טוב עם נהיגה גם ב120 קמ״ש - לא רק מחוץ להתפלגות, אלא ממש מחוץ לטווח שהיה זמין באימון.
והholy grail האמיתי - zero shot learning, מצב שבו יום אחד נוסף תמרור חדש, ואיכשהו רק אומרים למכונית ״שימי לב זה תמרור שאומר שחייבים להדליק אורות״ והיא תעשה את זה על הפעם הראשונה מבלי שראתה אותו אף פעם.
עכשיו - למה אני מבלבל פה במוח?
כי עכשיו תנסו להכיל את הרעיונות האלה על מודלי שפה, או מודלי AI מסמלצי אינטיליגנציה.
במודלים כאלה מאד מאד קשה להבין באיזה רמה אנחנו נמצאים, וזה יכול להיות מאד מתעתע. האם פתרון בעיה פתוחה במתמטיקה זה אינטרפולציה? זה out of distribution?
מציאת פריצת zero day בסייבר, לאן משתייכת?
ואיך בכלל אפשר לבחון את כל הרעיונות האלה על מודל שליטרלי התאמן על כל הידע האנושי, וכדי לייצר לו ״סביבת מבחן״ צריך, well, ידע אנושי שאין לו?
זאת בעצם הבעיה השורשית: קשה להבין מה זה out of distribution למודלי שפה. הם יסמלצו את החוויה האנושית של התמודדות עם כל אחת מהבעיות האלה, אבל מילת המפתח היא - יסמלצו. זה יראה כמו. זה ירגיש כמו.
(ירגיש כמו אדם שמנסה להחליט איזה מניה לקנות, ירגיש כמו אדם שמנסה לקבל החלטה מקצועית, ירגיש כמו אדם שמנסה לפתור בעיה הנדסית)
שאלה נוספת שנשאלת - למה זה בכלל משנה? מה שמשנה זה שימושיות. זה עובד? מעולה.
זה משנה בעיני כי עד שלא נבין או נפתח שיטות אמיתיות לבחון את הדברים האלה, לא נדע אם הקונספט של Scale + RL הוא הדרך שלנו לייצר אינטיליגנציה בקופסה שבאמת תצעיד את האנושות קדימה.
אם תשאלו אותי, המבחן היחיד שיש לי בראש הוא אם מודל שפה ימציא כלים חדשים במתמטיקה שיהיו בעלי ערך לפתרון בעיות פתוחות. אחד הדברים שאומרים כשמדברים לדוגמה על השערת רימן (aka, אחת הבעיות הפתוחות הכי גדולות במתמטיקה) היא שכדי לפתור אותה צריך להמציא מתמטיקה שעוד לא קיימת.
בקיצור, מחשבות מחשבות בזמן שהסוכנים עובדים.
3 267
האם גם אתם מבלים את רוב הנוירונים במוח שלכם לנסות להבין לאן כל האירוע הזה של האייג׳נטים הולך?
אני מרגיש שהמון מהעיסוק שלי הוא לרפד ולהזיז מכשולים מהדרך לרובוט בלי עיניים. סקילים, MCP, לופים, כל מיני דברים שמנסים לקחת מכונה שלא יודעת לעשות כלום באמת ולתת לה לעשות דברים.
מצד אחד, זה מאד עובד. זה מביא תוצאות.
מצד שני, עוד כמה נוכל לחזק מודלי בסיס ולייצר פלסטרים מפוארים?
האם להשקיע באורקסטרציה היא השקעה עם ROI טוב לחברה בטווח הקצר (עזבו בינוני וארוך. קצר. שנה-שנתיים).
3 267
בדרך כלל אני רוצה לשבור את המסך כשאני רואה את התקשורת מדברת על AI
אבל - רעיון מופלא עם בחור שעוד נשמע עליו הרבה שמזקק המון דברים שכבר נכתבו פה בערוץ :)
אפשר להאזין כפודקאסט בנסיעה. ממליץ מאד
https://youtu.be/51W3D_J9FBU?si=DEWQDek-lIfmOMi0
3 267
Repost from Science and AI with Mike
בינה מלאכותית התקרבה לראשונה לאחת משתי השאלות הפתוחות המפורסמות במתמטיקה (השנייה היא P עפ NP).התקרב. לא פתר. הסיפור בקצרה. ב-1859 רימן ניחש ניחוש: לפונקציה מסוימת יש אינסוף נקודות מיוחדות, וכולן לדעתו יושבות על קו ישר אחד. 167 שנה אף אחד לא הצליח להוכיח את זה. הניחוש הזה שווה מיליון דולר. כשלא מצליחים להוכיח "כולן", מוכיחים "לפחות אחוז מסוים מהן". האחוז הזה תקוע שנים על 41.66%. קלוד, גרסת מחקר שעדיין לא שוחררה, הביא אותו ל-67.25%. להשוואה: בני אדם הצליחו להזיז אותו 0.8 נקודות ב-37 שנה. זו קפיצה אמיתית. אבל היא לא "שני שליש מהדרך", ומשתי סיבות: סיבה ראשונה: האחוז מודד אותנו, לא את המתמטיקה. 67% לא אומר ששני שליש מהנקודות על הקו והשאר מחוצה לו. בפועל בדקו כבר 20 טריליון נקודות ואף אחת לא חרגה. כולם משוכנעים שהתשובה היא כל הנקודות. פשוט אין הוכחה. סיבה שנייה: אפילו 100% לא היה מוכיח את הניחוש. נשמע מוזר, אז דוגמה. קחו את כל המספרים, ומתוכם רק את 10, 100, 1000, 10000... יש אינסוף כאלה. ובכל זאת, אם תספרו כמה אחוז הם מכל המספרים, תקבלו כמעט אפס. הם דלילים מדי מכדי להירשם. עכשיו החזרה לענייננו: גם אם נוכיח "100% מהנקודות על הקו", עדיין יכולים להסתובב שם אינסוף חריגים. פשוט דלילים מדי מכדי להוריד את האחוז. לכן הפער בין 67% למיליון דולר הוא לא 33 נקודות אחוז. זו שאלה אחרת לגמרי. אנטרופיק אומרים את זה בעצמם: הם לא מצפים שהשיטה תגיע להוכחה. ומה כן קרה כאן, בעיניי: קלוד לא המציא מתמטיקה. הוא לקח מאמר מ-2000 וחיבר אותו לעבודה עדכנית של ארבעה חוקרים. מישהו כבר הגיע ל-67% קודם אבל רק בהנחה נוספת. כאן ההנחה ירדה. שני החלקים ישבו על המדף שנים, בשני חדרים שונים, ואף אחד לא הכניס אותם לאותו חדר. כלומר: מה שחסר לא היה גאונות. מה שחסר היה מישהו שקרא הכל. מה עוד לא סגור: אין ביקורת עמיתים רגילה, ואי אפשר לשחזר את הריצה כי המודל לא שוחרר. מצד שני ההוכחה נכתבה בצורה שמחשב יכול לבדוק, ושני מומחים חיצוניים עברו עליה. על התהליך אפשר להתווכח. על ההוכחה עצמה פחות. ולסיום, הפרט האהוב עליי: הניסיון הראשון נכשל אחרי 650 רעיונות. סוף סוף AI שחווה דוקטורט אמיתי. https://www.anthropic.com/research/riemann-zeta
3 267
(לא ממומן)
וובינר לצוותי R&D על subagents & parallel agents
יום חמישי, 13 באוגוסט, מבית Latent AI
למי הוובינר מיועד?
• מפתחים וצוותי פיתוח שעובדים עם קלוד (או רוצים לעבוד עם קלוד)
• למי שמפעיל אייג'נט אחד בכל פעם (ולא כמה במקביל)
• למי שרוצה לעבוד עם worktrees ולא לשבור את הקודבייס
• למי שרוצה לעבוד עם סאב-אייג'נטים כדי לשמור על ה-context window
הזדמנות מיוחדת לקבל הצצה לקורס המלא של Latent AI לצוותי פיתוח
להרשמה ופרטים נוספים >> https://bit.ly/4gmoIIb
על המרצה: יונתן ירקוני, מנכ"ל ו-co-founder של Latent AI, לשעבר בצוות ה-AI של גוגל, מפתח וראש צוות
3 267
אחרי שהיינו במתמטיקה, הסייבר חזר שוב לאופנה.
אופןAI שלנו מדווחת עוד ועוד על כמה שהמודל שלהם Astra פיצח את האטום בעולם הסייבר, פורץ, נושך. אם אתם עוקבים אחרי כבר תקופה, אתם בטח יודעים שלחברות יש סוג של ״רמות סיווג״ למודלים, שמעריכים את המסוכנות שלהם במגוון תחומים - נשק כימי וביולוגי, סייבר וכו.
אז OAI מגדירים את Astra ברמת ״critical״ בסיווג שלהם. מה זה אומר? יותר אבטחה על המשקולות שלו, יותר כלי ניתור וניהול.. בסדר. אחלה.
השאלה המתבקשת היא למה כל הPR הזה. המודל עוד לא שוחרר.
בספר של פיטר תיל, Zero to One, הוא כותב:
״מונופולים משקרים כדי להגן על עצמם, מפריזים בכוח של התחרות שלהם שלא באמת קיימת. לא-מונופולים עושים ההפך, אומרים שהם בליגה משלהם״.
אני מרגיש, באיזשהו מקום, שחברות הAI חיות בcycle.
יום אחד AI זה קומודיטי, הסינים עושים אותו דבר, אין שום יחודיות, כולם אותו דבר. יום אחרי זה - אנחנו מיוחדים, צריך עלינו רגולציה, אנחנו מייצרים מפלצת חסרת מעצורים.
אני רגע אתן פה טיעון, שאולי אפשר להתווכח איתו, אבל חשוב שיכתב ונמשיך הלאה. אין ספק שיש פה מפלצת כשהAI הרצחני רק בצד התוקף. בסייבר, כמו בעצם בעולם המלחמה הסטנדרטי, ברגע שיש לצד אחד יתרון יחסי עוצמתי הוא אכן החזק, וככל שעובר הזמן ההגנה משתפרת - ומגיעים לאקוויליבריום.
אם הסטנדרט בתקיפה הוא מודלים גאונים שמתקיפים, לא חוכמה להראות שיש פה סכנה לאנושות כשאין בצד השני מודלים גאונים שמגינים. האזהרה על היציאה מאיזון חשובה, אבל כאמור, אני מרגיש שיש כאן בניית נרטיב הרבה יותר מאשר ניסיון להגיד את האמת.
יש פה באמת מלכוד:
1. חברות הAI מבינים שהם מפתחות כלים שיש בהם סיכון בטווח הקצר.
2. המשקיעים כבר רוצים לראות רווחים, עבר הרבה זמן, וצריך להיות הכי טובים.
3. הסינים בזנב, רחוקים בעיני 8-10 חודשים (למרות שאני יודע שחלק מכם יגידו פחוות), אבל רודפים.
4. החברות ישמחו לרגולציה שתעכב את המתחרים שלהם ותיתן להן עוד קצת זמן ומרחב נשימה לעבוד, ושתרגיע גם את המשקיעים - שבסדר שדברים לוקחים קצת יותר זמן, יש רגולציה.
הבעיה שכל הדברים האלה לא מתכנסים. אי אפשר גם לרוץ קדימה, גם לנסות לרצות את המשקיעים בהצגת יכולות מפחידות בסדר גודל מהסינים (אולי?) ולהגיד ״אנחנו הכי טובים״, גם להגיד ״צריך רגולציה, כי כולם פה אותו דבר וצריך רגע להאט את הקצב״ ובסוף המעגל - לגייס עוד כסף כי צריך עוד דאטה סנטרים.
בקיצור, אני מרגיש שיש פה מעגל בלבול רציני מאד בעולם חברות הAI. התחלנו מבליץ סייבר (Mythos), המשכנו לבליץ רגולציה (המכתב של דמיס הסביס, הפוסט של סאטיה ועוד ועוד), המשכנו לבליץ "Open Source ישלוט״ (כתבתי פה לא מזמן, המכתב של ג׳נסן, אלכס קארפ) ועכשיו אנחנו שוב ב״סייבר מפחיד סייבר״.
בקיצור, החברות צריכות להחליט - הן מונופול? הן קומודיטי? תלוי ביום בשבוע?
3 267
Muse Spark 1.2
המודל של Meta.
כמובן שיהיה "Muse Code״.
מערכת אייג׳נטית:
״Muse Code runs specialized background agents that stay active your whole session, so they build up context over time instead of starting from scratch on every task.״
קיצר, הנה מארק:
https://x.com/finkd/status/2085080750034940201/photo/1
3 267
https://x.com/tsoofbaror/status/2085335292400296331
והנה זה קורה:
אני מחפש מישהו לעבוד איתי. גיוס ראשון.
אם אתם מהתחום ואני נראה לכם מגניב, יש פה הזדמנות.
אשמח לשיתופים, תגובות וכל השבאנג שיעזרו לי למצוא את האחד (או האחת).
3 267
הממ, רגע משהו על ARC AGI 3 - נראה שהם השיגוע תוצאה כזו על הpublic data set, ולא על סט הבחינה הפנימי. יש מצב שזו אזעקת שוא, הרבה כבר הצליחו
3 267
שני אירועים חדשותיים לא בלתי-מעניינים:
1. דמיס הסביס מפסיק להיות מנכ״ל דיפמיינד - והופך להיות ה... unit chairman? זה בא ביחד עם העזיבה של ג׳ף דין, המדען הראשי המיתולוגי של גוגל, שהולך להקים חברת AI משלו. הסביס הולך להיות גם הchief scientist של גוגל, ולהמשיך להוביל את Isomorphic Labs - חברת הAI של גוגל שעוסקת בפיתוח תרופות. איזה ג׳וב.
2. חברה בשם Prime Intellect יצרו Harness שלטענתם פותר את ARC-AGI 3, בציון 95%+-. המבחן ARC AGI 3 הוא סוג של מבחן ״משחקים״ שמצריכים תכנון לטווח ארוך (יחסית). הממוצע היום עומד על 10-30 אחוז בקרב המודלים החזקים השונים. למיטב הבנתי זה עוד לא אומת סופית ע״י ARC AGI עצמם.
3 267
ובנושא אחר, החבר׳ה של קודקס מדברים על ״שלב חדש באבולוציה של שימוש בAI״ עוד חודשיים שלושה.
בטוויטר מדברים על זה שיהיה מעבר מ״קודקס (או קלוד קוד) על המחשב שלי״ ל״קודקס בענן״.
רק שכבר יש קודקס בענן. ככה שצריכה להיות פה סוג של פריצת דרך פרודקטית. אולי קודקס יגיע עם סוג של מחשב על הענן על-מלא?
זה בעיה. כי מה הם יתנו, לינוקס? ואם אני צריך ווינדוס או מק?
בכל מקרה, מסקרן.
3 267
מודל עסקי מעניין.
מציעים פלטפורמה אייג׳נטית ״ללא לימיטים״ - ואיך?
בעצם כל סוכן שרץ במקביל, משלמים עליו קבוע כמו על חברת סלולאר. כמו ״קו״.
בסוף אפשר לחשב בדיוק כמה טוקנים סוכן שעובד 24.7 לוקח ולתמחר בצורה כלשהי (?) וזה רעיון די חמוד בעיני. מוריד את הלחץ של לראות את הפס יורד - פשוט לשלם ״פר SIM״.
