YUV.AI - בינה מלאכותית בעברית
رفتن به کانال در Telegram
2 577
مشترکین
+124 ساعت
+297 روز
+4930 روز
آرشیو پست ها
ריבוי סוכנים בעולם האמיתי: הסטודיו החדש שלי שועט קדימה ותראו את ההבדל שבין לעבוד עם קריאות API רגילות + סוכן שאחראי על הקומפוזיציה, לבין אותו הדבר אבל עם סוכן נוסף שאחראי גם על אחידות בלבוש שתתאים לתמונת הרפרנס בדיוק של 99.9%!
כמו שאתם בטח רואים, אני רץ עם הסטודיו שלי בקצב מסחרר והלילה (הלבן) הוליד ריבוי סוכנים מאוד מעניינים:
1. יכולת לייצר טקסט עם אפקטים מרהיבים במגוון סגנונות (זוכרים את ההולי ש*ט של קלוד אתמול?!)
2. יכולת לעשות את הנ״ל אבל גם להוסיף דמות מתמונת רפרנס
3. יכולת לעשות את הנ״ל וגם לשלוט בקומפוזיציה של התמונה ולוודא מיקום אלמנטים היכן שרצינו
4. יכולת לעשות את הנ״ל וגם לשלוט בעקביות הלבוש של הדמות שאנחנו מג׳נרטים
5. וגולת הכותרת: יכולת לעשות את כל הנ״ל - על ריבוי דמויות מפרומפט אחד ומבלי לאמן מודל! 🤩
הדרך להגיע לזה מלאה חתחתים ועולה בתשלום על שימוש במספר כלים במקביל, מה שמאט את הזמן לקבלת התמונה, ומייקר את העלות לתמונה בודדת. מנגד, כמה זמן זה חוסך? כמה ג׳ינרוטים אנחנו מבזבזים רק כדי להגיע למה שיש לנו בראש?
לא השתמשתי פה ב-framework קיים של סוכנים. מה שעשיתי הוא שבחרתי מראש באיזה מודלים של אימג׳ או LLMs אני רוצה להשתמש ומתי, והתחלתי לבנות עם קלוד קוד את כל החיווט הזה ואת כל התשתית. אני משתמש ב-Fal כדי להתחבר לשירותים שונים, וב-API ל-LLMs אחרים כדי לבצע פעולות אחרות.
היופי פה הוא שאפשר לזלזל ולהגיד ״אה זה כולה כמה חיבורי API, שטויות״, אבל אז בחיים לא תתקבל התוצאה הזו. כי עשיתי פה עוד כל כך הרבה חיבורים נוספים על בסיס הידע והניסיון שלי, והקסם האמיתי פה זה ההינדוס של התשתית והחיבור בין הסוכנים והתקשורת והאינטרקציה ביניהם. או במילים פשוטות: היצירתיות. כי זה לא משנה שיש כל כך הרבה כלים זמינים, מה שמשנה הוא לאן היצירתיות לוקחת אותנו. לכבישים חרושים או לסלילת שבילים משלנו?
זה כמו קנבס עם לוח ריק ומלא צבעים. לכולם יש את זה מולם. אבל כל אחד מייצר יצירה אחרת. ויש גם מי שמעתיק יצירות של אחרים. שזה בסדר. אבל אפשר יותר. וכך גם אף פעם לא באמת יוצרים. זה בסדר גמור להתחלה ללמידה אבל מתישהו צריך לפרוש כנפי דימיון ולעוף גבוה.
זה מזכיר לי שוב את המוח האנושי. יש דיונים קדחתניים מהי ההכרה שלנו. כשאדם מאבד את ההכרה הוא לא פה. כשההכרה שלו קיימת הוא פה. כשאדם מורדם הוא לא פה. כשהוא ער הוא פה. אז מה זו ההכרה הזו? לפי חוקרי מוח, ההכרה היא פעולת התקשורת הנוירו-כימית וחשמלית בין הנוירונים במוח. עצם העברה המידע עצמה. היא היא ההכרה. התקשורת בין הנוירונים ברשת הנוירונים במוח. הסיפור הוא לא להכיר את הנוירונים אלא לדעת ליצור את ההכרה האנושית, זו החכמה האלוקית של לגרום לתקשורת הזו במוח. ולהבדיל כך גם ב-AI. החכמה הגדולה זה לא הכלים - אלא זה איך אנחנו מהנדסים את העבודה עם הכלים במוצרים שלנו.
הרגע הזה שאני מראה לקלוד תמונה מהסטודיו החדש שלי והוא אומר הולי ש*ט! 🤣🤣🤣
האם AI בעיקר מבזבז כסף לארגונים או גם הופך לרווחי? התשובה לא כזו פשוטה.
לפני כמה ימים פרסמתי על החברה הסקוטית ששכרה את שירותי לפתח MVP במקום בית תוכנה. אותה חברה סקוטית מתעסקת במחקרים שעוזרים לארגונים לאמץ טכנולוגיות. סיפור מעניין שקשור לזה הוא חברה שפיתחה טכנולוגיה מטורפת עם AI, הכל שם AI, השקיעו, ראו לפי כל המספרים שאם יאמצו את ה-AI ישפרו סביב 80% מהתפוקה והדילוור. הביאו את טובי המוחות לעצב את המערכת, מבחינת מוצר, UX UI ומה שתרצו. אלא מאי?
בפועל, שיעור האימוץ בקרב המשתמשים עמד על 12% בלבד. מוצר מטורף שהושקע בו ערך מטורף שגם הוכח כמייעל את העבודה - פשוט לא הצליח לחדור מבעד לחומות האימוץ של העובדים. מה שגרם ל״פרארי״ הזו לחנות החניה במקום לדהור במסלולי מירוץ.
סקרים של מקינזי הוכיחו שמפתחים שמאמצים את ה-AI מרגישים יותר סיפוק משמעות ואפילו שמחה. 90% ומעלה דיווחו שהם רצים מהר יותר שמחים ומאושרים יותר. 90%! אז למה לא מצליחים לקחת את זה לשלב הבא?
מסתבר שיש היבטים פסיכולוגיים שהם לא פחות חשובים. המוח האנושי יודע להסתגל לשינויים. הוכח שהוא נוירופלסטי. יכול להתאים את עצמו מחדש. אבל לנו, כגורם אנושי, קשה עם שינויים. אולי אנחנו מפחדים, אולי אין לנו זמן, אולי אנחנו מרגישים שלא בא לנו ללמוד משהו חדש עכשיו כשאנחנו שולטים בקיים.
לצד ההשקעה של הארגונים על פיתוחים - חשוב לא פחות להבין גם את הגורם האנושי. את הפסיכולוגיה שמאחורי אימוץ שינויים בכלל - וטכנולוגיות AI בפרט. דגש על הצד הזה - ישפר פלאים את האימוץ.
מסתבר שכאשר לצד פיתוח מואץ דואגים להראות כל הזמן את הערך שמתקבל, מדברים על נקודות כאב אמיתיות שהטכנולוגיה הזו פותרת - תוך כדי הדגמת מקרי בוחן מעשיים - למשל, להראות איך אפשר להשתמש בחבילות פיתוח פנימיות בפרויקטים, איך להגדיר חוקי AI שמשקפים את ה-Best Practice הארגוני? כמו commits במבנה מסוים, הרצת פקודות של בדיקות לאחר פיתוח באופן אוטומטי וכדומה.
כאשר משתמשים מבינים - הם מרגישים בנוח - ומאמצים. אי אפשר לבוא עם פטיש על הראש. אפשר לתת המון ערך - ואז זה עובד כמו קסם! כמו ניגון שחודר לנפש - כך ה-AI יכול לנגן על המיתרים שלנו.
והנה זה פה: האג׳נדה לכנס שלי ב-15.9 זמינה עכשיו בכתובת 159.yuv.ai
איזה מרגש! עוד קצת וזה קורה. בתקווה שהפעם לא יהיו איראנים ותימנים בדרך!
הראיון המלא שקיימתי עם נירו, סמנכ"ל בגיטהאב, על קופיילוט, MCP, וייב קודינג ועוד - זמין עכשיו ביוטיוב שלי! מוזמנים לצפות >>>
https://www.youtube.com/watch?v=LNMhtvX819I
שבוע טוב!
תזכורת קטנה שהקורס שלי של קלוד קוד וייב קודינג במחיר השקה עד סוף החודש 🙏
ומחר בע״ה אפרסם את הראיון המלא עם נירו מגיטהאב, סמנכ״ל GTM שאחראי על גיטהאב קופיילוט. פגשתי את נירו בלונדון וראיינתי אותו, סשן של שעה, על וייב קודינג ועוד נושאים סופר מעניינים. שווה לצפות (באנגלית, גרסה עם תרגום בע״ה תעלה בהמשך בלי נדר). ולשואלים ולתוהים לצערי בגלל שהמצב בלונדון לא מזהיר ליהודים נאלצתי לערוך את הראיון ללא כיפה, אבל לכל המוטרדים - אל תהיו, לא יצאתי בשאלה 🤣 (כותב זאת כדי לקיים ״והייתם נקיים מה׳ ומישראל״)
ולגבי הקורסים שלי - הכל פה https://academy.yuv.ai
שיהיה לנו שבוע טוב ובשורות טובות בע״ה 🫶
העליתי המון תמונות בבלוג שלי, בואו לראות: https://blog.yuv.ai/yuvai-studio/
הסוד נמצא בפרטים.
פיתחתי סטודיו AI ליצירת דמויות עקביות ובו אני משתמש דרך Fal בכל מיני סוגים של API כדי לחבר הכל ביחד. משתמש בוחר תמונה, כדי לזהות את הלבוש במדויק אני משתמש ב-API של Flux Kontext. אח״כ אני מבצע קריאת API ל-Ideogram Edit כדי לדאוג שהפנים והגוף יקבלו את אותו דיוק מהתמונה המקורית. חיבור של שני מודלים בקלות יתירה דרך Fal תוך שימוש בקלוד קוד לפיתוח. ל-Fal אפילו יש הנחיות ל-LLM עבור כל API מה שהופך הכל לקל יותר.
זה סטנדרט שהתעשייה מאמצת שנקרא llm.txt, כל שירות API יתחיל ליישם קובץ כזה בשירות שלו שמסביר ל-LLMs איך להתחבר אליו בקלות. זה הכרחי.
אבל, במה שעשיתי אין חידוש גדול. כל אחד יכול. הסוד נמצא לא בזה שחיברתי 2 מודלים. הסוד נעוץ במה שעשיתי בין לבין ותוך כדי. מלבד שני המודלים האלה, הוספתי עוד מספר שכבות כדי להגיע לדיוק מקסימלי. השכבות האלה פועלות באמצעות AI Agent שאחראי לקבל את הפרומפט ולוודא דרך כמה טכניקות שונות שהתוצר יתאים למה שביקשנו. גם בתווי הפנים וגם בפריטי הלבוש.
לא רק זה. אלא יכולת לג׳נרט מספר דמויות בתמונה אחת, מפרומפט בודד, וכל זה בלי לאמן מודל. כל מה שצריך לעשות זה להעלות תמונת רפרנס אחת בלבד, וגם מקבלים דיוק מקסימלי, אבל גם אפשר לשלב כמה דמויות שרוצים בתמונה, וסוכן ה-AI המתקדם שלי דואג לבצע את כל הקסם ואת כל התזמורת עם כל המודלים והטכניקות שהגדרתי עם קלוד קוד מתחת למכסה המנוע.
שני המודלים שחיברתי הם אחלה והם לגמרי עושים את העבודה מצוין מתמונת רפרנס אחת. אבל זה לא מספיק וגם לא מחדש. בעיניי, היצירתיות מסתתרת בדרכים שאינן השביל הראשי. היות וזה מוצר שאני אעלה לאוויר, אני לא מפרסם את הפרטים ככה בריש גלי של מה שקורה בין לבין, אבל כן אגיד שזה לא רק שימוש ב-2 מודלים, אלא שילוב של לפחות עוד 4 תהליכים שונים ובניית תשתית אג׳נטית שמבטיחה תוצאות טובות יותר. יש פה AI Agent מתקדם שאחראי על הכל והוא קבלן הביצוע. גם אם כולם בונים עם מלט ובטון וחצץ וחול (המודלים בדוגמא שלנו), הוא אחראי על הארכיטקטורה של הכל ועל ביצוע בפועל.
אם יש לכם תמונות רפרנס שתרצו שאריץ סטודיו שלי אתם מוזמנים להדביק בתגובות עם פרומפט ואני אשתדל להעלות לסטודיו ולהדביק לכם חזרה את התוצאות כדי שתוכלו להתרשם. עד שאפתח למשתמשים. יאללה תאתגרו את הסוכן 🤩
ואני מזכיר שמחיר ההשקה של הקורס שלי (וייב קודינג עם קלוד קוד) יהיה זמין רק עד סוף אוגוסט, ממליץ לנצל ולהצטרף לכל מי שכבר עלה על הרכבת, כל הפרטים באקדמיה שלי.
+1
הצלחתי לפצח את זה בסטודיו שלי!!!! מעלה תמונת רפרנס *אחת!*, *בלי לאמן מודל!*, מזין פרומפט, בוחר בסוכן ה-AI שיצרתי שמבצע כמה דברים מאוד מעניינים - *ומקבל תוצר עם דיוק של כ-99% בתווי הפנים ובלבוש*!!!!!!!
אין רגע מרגש כזה! קבלו למשל את הרבי מניח תפילין, מצאתי תמונה מאוד קטנה באיכות לא משהו (בצילום המסך עשיתי זום בכוונה), הזנתי פרומפט שאני רוצה את הרבי בניו יורק, וסוכן ה-AI שלי יצר הכל לבד! ז"א, אני רק יצרתי דמות של הרבי מתמונת רפרנס אחת, ועכשיו אני יכול לקבל אותו במדויק בפנים ובלבוש איך שאני רוצה!
כנ"ל, להבדיל, לגבי "חכם חנוכה". מתמונה אחת לא משהו, עכשיו אני מקבל אותו במדויק, לרבות הלבוש!!!!! כמה שזה מרגש. סוכן AI שמייצר תמונות ברמת דיוק של 99%!! בע"ה מקווה שבקרוב אוכל להשיק את הסטודיו. סופר מרגש!
מבחינה טכנית: יש פה אפליקציית Full Stack שפיתחתי עם קלוד קוד לפי הטכניקות שאני מראה בקורס שלי, שיש עליו הנחה ומחיר השקה עד סוף החודש בלבד. יש כאן טכניקות, חיבורי מודלים, בסיסי נתונים ועוד. אפילו השמיים הם לא הגבול. טירוף!
+7
האימון של המודל שלי הסתיים והמוח שלי נטרף וזה בדרך לסטודיו החדש שלי!
וזהו להיום. מסקנות ששוות זהב והן תולדה של פיתוח הסטודיו שאני עובד עליו. יהיה ממש מגניב.
איך אפשר לאמן מודל על אנשים או סגנונות אופנה (כמו האשליה בתמונה המצורפת) - בא נעשה סדר בבלאגן המונחים בעולם אימון מודלים לתמונות של אנשים (כמו מה שרואים את ביבי עם טראמפ וכדומה) או מותגים (כמו קוטג׳ של תנובה או ביסלי של אוסם וכדומה):
יצירת תמונות עם AI זה לא דבר חדש. לאמן מודלים שעוזרים לקבל דיוק זה גם לא דבר חדש. זה היה זמין עוד ב-Stable Diffusion בצורה מייגעת מאוד. עד שהגיעו Flux וטרפו את הקלפים.
חברת Black Forest Lab פרסמה בחינם המון מודלים מדהימים. הבולטים הם Flux Dev וגם Flux Kontext. את שניהם אפשר לקחת ועל בסיסם לאמן מודל קטן, LoRA, על דאטה סט יחסית קטן של תמונות ואז לג׳נרט תמונות עם המודל שיצרנו.
מתי מאמנים לורה?
כאשר אנחנו רוצים לייצר תמונות, ומה שהמודל מכיר לא מספיק טוב, או שהוא לא מכיר בכלל. למשל, אם אני רוצה אותי, והוא לא מכיר אותי, או שאני רוצה לוגו של מותג, או פרזנטור, והוא לא מכיר.
מה עושים במצב כזה?
גורמים לו להכיר. איך? לוקחים אוסף של תמונות. מוסיפים תיאור של כל תמונה. משתמשים בתוכנה שטוענת את קובץ הבסיס של המודל שלא מכיר אותנו, ואז אנחנו מתחילים לאמן מודל קטן שלוקח את התמונות שלנו, ובהתבסס על המודל הגדול, יודע ליצור מודל שמייצג את המידע החדש שהוא לא מכיר.
ואז מה?
מייצרים תמונות כאשר משתמשים בקובץ הבסיס ומצרפים את קובץ הלורה, שהוא המודל החדש שיצרנו. כך נוכל להשתמש במודל הבסיס המשובח ולצרף אליו את המידע על מה או מי שאימנו ונקבל את התוצרים שלנו.
איך אפשר לאמן מודל לורה?
או באתרי אינטרנט שונים כמו Fal, אסטריה וכדומה. או מקומית על מחשב חזק (כרטיס מסך של Nvidia 3090 מינימום) באמצעות תוכנות חינמיות כמו Flux Gym או ai-toolkit (זה מה שאני משתמש).
כל זה טוב ויפה לעולמות אימון המודלים, וכך זה עבד כבר מזמן עם Flux Dev. אז מה החידוש ב-Flux Kontext?
הוא מודל אחר שיודע לקחת תמונה כאינפוט, לשמור על כל המאפיינים של הדמות שרואים בתמונה, ועל בסיסה לייצר תמונה חדשה לגמרי עם תיקוני עריכה. למשל, אם יש תמונה שלי, אוכל לבקש לקבל את עצמי אבל עם לבוש אחר. או את הבית שלי - עם ריהוט אחר. וכך הלאה. וכל זה מבלי לאמן מודל על עצמי כי הוא מקבל בקלט תמונות.
אז למה לאמן מודל בכלל על Flux Kontext?
כי הוא מודל עריכה. אם אנחנו רוצים לערוך תמונות, להחליף שיער, בגדים, תספורות, אפילו לראות איך יוצאים אחרי בוטוקס, או להפוך לבובות לבובו וכדומה. או אם אנחנו רוצים עקביות ואחידות של דמויות ברמת הלבוש של הדמות (כי מודל יצירת תמונות מייצר כל פעם בגד אחר ולא אחיד). במקרים כאלה, לא יעזור להשתמש סתם ב-Flux Dev עם לורה. אפשר להשתמש ב-Flux Kontext. והחידוש הגדול הוא שגם אם אנחנו משתמשים בו אבל לא מרוצים מתוצרי העריכה, נוכל לאמן מודל קונטקסט בעצמנו ואז לטעון תמונה כלשהי כקלט, למשל אני בלבוש מסוים, להשתמש במודל שאימנתי על עריכה מסוימת, למשל בובות לבובו, ואז אקבל את עצמי בתור לבובו, אבל לא סתם כתוצר רנדומלי כלשהו, אלא ברמה מאוד גבוהה. ומדויקת.
ומה העתיד של אימון מודלים לתמונות אם ראינו מקרים שמספיקה תמונה אחת?
זו שאלה גדולה. Flux Kontext באמת עובד יפה מתמונה אחת. גם Ideogram Character וגם Higgsfield או Midjourney. אבל נראה שבשביל ליצור עקביות אמיתית בדמות, אין מנוס מלשלב בין שימוש במודל הבסיס של Flux Kontext (שיתן לי את הלבוש שלי במדויק) יחד עם LoRA שלי כדי לקבל את המראה שלי במדויק מבחינת תווי פנים, ואפילו עם Kontext LoRA כדי להשפיע גם על סגנון העריכה הסופי. זה למי שרוצה דיוק מקסימלי.
למי שמספיק דיוק בתווי הפנים - Ideogram Character מספיק, ומי שרוצה דיוק בלבוש וקצת פחות בתווי הפנים - Flux Kontext שזמין אפילו בניסיונות חינמיים ב-Playground של Black Forest Lab לגמרי יכול לבצע את העבודה טוב. אל תשאלו מה הקישור, תחפשו, כי לא יכול להדביק בפוסט אז לא להתעצל 😬
וחזרה למה שהתחלנו איתו - אם אאמן מודל לורה בדרך ״הישנה״ על הבגד הזה, אוכל לשלב אותו ביצירת התמונות וזה יתן אחידות כי תמיד הדמות תלבש את החולצה הזו. מנגד, אם אשתמש ב-Flux Kontext, גם בלי לאמן מודל - הוא ישמור על הבגד הזה. אבל אם אני רוצה לשלב דמות שתלבש את הבגד הזה - אצטרך לרשום בפרומפט את הדמות, ואם מודל הבסיס לא מכיר אותה - אז לאמן לורה על הדמות ולשלב אותה בתהליך יצירת התמונה. לחילופין, אפשר גם פוטושופ קלאסי, או inpaint וכדומה, אבל אם רוצים ״פשטות״ (יחסית): אז Flux Kontext + Flux Dev LoRA. ולבסוף, אם היינו רוצים סגנון מסוים, אפשר לאמן גם מודל על Flux Kontext.
הדוגמא הכי טובה זה ספר שיש לו קטלוג תספורות או קוסמטיקאית שמורחת לק בסגנון מסוים. אם נאמן מודל Kontext על תספורות או סגנונות הלק, נוכל לטעון תמונה של דמות ב-Flux Kontext ולקבל אותו עם התספורת / לק (או כאמור אפילו בוטוקס)!
אימנתי כבר כמות אדירה של מודלים ועדיין נשימתי נעתקת כשאני רואה איך ה-AI "מבין" לאט לאט איך המודל שלנו נראה. כמו המוח האנושי, להבדיל. בהתחלה לא מבינים מה רואים. אחרי זה יש חזרתיות שגורמת לרשת הנוירונים שלנו במוח להתעצב בצורה מסוימת עד שהמוח כבר מבין מה אנחנו רואים.
להבדיל, ה-AI בהתחלה לא מבין מה הוא רואה. ואז מתבצעת חזרתיות שוב ושוב, יחד עם תיאור טקסטואלי של מה הוא רואה, והוא עובר על הדאטה שוב ושוב, עד שהוא מבין ומייצר הכל כמו שצריך.
אתם רואים פה תוצאות של שני פרומפטים זהים, הראשון: בובת לבובו חובשת כובע עם קפה לצידה ומחזיקה שלט עם כיתוב. השני: בובת לבובו בסגנון וולברין בלונדון.
תראו איך בהתחלה ה-AI הבין שיש פה בובה, אז יצר על בסיס הידע הקיים שלו. וככל שהאימון התקדם והוא הבין מה זה לבובו - הוא כבר התחיל לדייק. וכאן זה רק אמצע האימון. התמונות הראשון הן של צעד 200, התמונות היותר מדויקות הן של צעד 3000 באימון. מטורף!
קלוד קוד אחד ביום: השתמשתי בו כדי לתאר תמונות באופן אוטומטי כשלב מקדים לאימון מודל לאבובו! 🤯
כשרוצים לאמן מודל LoRA, על דמות או סגנון, צריך לאסוף תמונות. לאחר מכן, צריך ליצור קובץ טקסט שזהה לשם התמונה ומכיל תיאור של אותה תמונה. זה סיוט שאין לתאר. כדי לבצע זאת אוטומטית, ומבלי להשתמש בקומפיכס UI, ביקשתי מקלוד קוד להשתמש במודל פלורנס-2 של מייקרוסופט, מודל ויז'ן שיודע לתאר תמונות ולרוץ לוקאלית על המחשב. תוך מספר בודד של פרומפטינג, הסקריפט היה מוכן, רץ בהצלחה, וקיבלתי את כל הקבצים וחסכתי המון זמן על העבודה הנוראית הזו.
החלטתי לעשות מעשה ולפרסם לכולם את הקוד ובחינם, אז תוכלו למצוא אותו בגיטהאב שלי, שם המשתמש שלי בגיטהאב הוא hoodini ושם הפרויקט הוא AutoCap מלשון Auto Image Captioning. תהנו ותזכרו: קלוד קוד אחד ביום - הוא חבר שהוא חלום!! 🤯
חידוד חשוב לגבי הסטודיו שפיתחתי. הרבה הגיבו שהפיצ'ר כבר קיים באסטריה, אבל! מה שאני עשיתי פה זה יכולת ליצור תמונה עם אנשים שונים *מתמונת רפרנס אחת בלבד ומבלי לאמן אף לורה!*
ז"א, מעלים תמונה אחת טובה של כל דמות, ומאותו הרגע אפשר לכתוב פרומפט שמשלב את הדמויות איך שבא לכם. וזהו! בלי לורות. בלי שטיקים. בלי טריקים!
