» «
מנועים ליצירת ספרים
איך יוצרים ספרים ב-AI?



יצירה של ספר ילדים (Storybook) באמצעות AI היא דבר מדהים ומרגש. היכולת של ה-AI לקבל פרומפט קצר או מפורט של הסיפור, לראות כמה תמונות שאם נרצה נעלה אליו ולעשות את השאר בשבילנו - היכולת הזו היא מדהימה ומרגשת.

אלה השלבים ליצירת סיפור כזה:

1. החליטו מה ברצונכם שהספר יספר.

2. כתבו את הפרומפט, כלומר את ההנחייה שלכם. נדב, למשל, כתב את הפרומפט הבא:

Zoe, a mixed Labrador and Canaan dog, and how she came with her owner Nadav to the dog beach in Tel Aviv and met lots of dogs of different breeds. Each one has a different character and traits, and there are several dozen dogs here. At one point, one of the dogs complains that Zoe brought a person to the dog beach and worries that it is not a place for people, because they do not know how to behave. Many of the dogs join her and her concerns. So Zoe calmly answers them that Nadav is a good guy and does not make a mess or make noise and he behaves well. And because she is completely calm, they accept what she says and since then to this day, good people also come to the dog beach and everyone is happy that they do not discriminate against people, just because they are people.

אגב, אפשר גם בעברית, אם כי ייתכנו מעט הזיות אז עדיף לטרנסלט לאנגלית.

3. להשלמת הדמויות (אלא אם רוצים שהבינה תמציא את המראה שלהן) הוסיפו תמונות - באמצעות כפתור + שבצד שדה הפרומפט ובחירת images.

4. לוחצים על כפתור ה-Generate וממתינים 2-3 דקות לספר החדש שכתבתם.

5. למעלה יש כפתורי הדפסה ושיתוף עם אחרים.

בהצלחה!


הנה סיפור AI מודרך:

https://youtu.be/py2yXfgzQiQ


כך יוצרים סיפור AI:

https://youtu.be/rxGjFpDPsf8


מדריך מפורט ליצירת ספרים באמצעות AI:

https://youtu.be/3_oY8XQy2Qc? long=yes


ויצירת ספרים בבינה מלאכותית, כלומר ב-AI:

https://youtu.be/DH3FDF3sR8k?long=yes
מולטי מודאליות
מהי מולטי מודאליות בעולם ה-AI?



זה אחד הפיתוחים המרגשים של עידן הבינה החדש ומה שמרגיש לא פעם כמו סרטי מד"ב מהיותר מתוחכמים. קוראים לזה מולטי-מודאליות (Multimodality) והוא בעצם היכולת של כלי AI לעבוד עם סוגי נתונים שונים, כמו טקסט, אודיו, קוד, וידאו ותמונות - גם כקלט וגם כפלט.

במקום להתמקד בסוג אחד בלבד של נתונים, מערכת רב-מודאלית מקבלת ומנתחת מידע ממקורות מגוונים, בכדי לקבל הבנה מעמיקה יותר של העולם הסובב אותה. מדובר בכלי ממוחשב שבדיוק כמו שבני אדם חווים את העולם דרך כל החושים והחוויות, לא רק מבין טקסט, אלא גם רואה תמונות וסרטים, מעבד ומנתח וידאו, מגלה הבנה מרחבית, שומע קולות וצלילים, מפענח קוד של תוכנה ומסוגל גם ליצור תכנים ותוצרים בכל המדיות הללו.

בדומה למוח האנושי, המשלב בטבעיות מידע מכל החושים, העולם של המערכות המולטי מודאליות ב-generative AI מציג יכולת שהיא עוד רכיב במהפכה הגדולה של מערכות בינה מלאכותית, מהפכונת שמאפשרת לעבד ולשלב כמה סוגי מדיה במקביל.

המערכות החדשות הללו מצוידות בשכבות מורכבות של פענוח ומפענחות את העולם פחות או יותר כמו מחשב-על. דוגמאות לא חסר. למשל עם צ'טבוט שבזכות ההבנה המרחבית המשופרת שלו מסוגל לזהות ולהוסיף כיתוב מדויק לעצמים שונים בתמונות עמוסות פריטים. או צ'טבוט שמנתח תמונות ומאפשר למשתמש לנהל עליהן דיון, או סוקר אינפוגרפיקה ונותן לה פרשנות קולית רלוונטית, בהתאם לרמת ההבנה של המשתמש או קהל היעד המבוקש. לכלי כזה יש גם כלי וידאו שמקבלים תמונה והנחייה כתובה (פרומפט) ומנפישים את התמונה לקליפ וידאו שכמו צולם בידי צוות צילום הוליוודי.

דוגמה נוספת היא כלי אינטראקציה רב-מודאלי כמו NotebookLM. הוא מאפשר למשתמשים לשתף איתו את המסך או המצלמה שלהם בזמן אמת. כך ניתן לקיים שיחות קוליות דמויות אדם, תוך כדי שמאפשרים ל-AI לצפות במסך ולעזור, תוך כדי מודעות להקשר ולתוכן.

אפילו תכונת זיהוי הפנים בסמארטפון שלכם היא תכונה שמשלבת היטב ראייה ממוחשבת, מיפוי תלת-ממדי ועיבוד נתונים מתקדם. ומאלה היא יוצרת פיצ'ר מדהים, בצד חווית משתמש פשטותה כמו מבט של שומר אנושי.

שילוב של צורות נתונים מרובות, כמו טקסט, תמונות ואודיו לתוך מערכת מאוחדת ורב-מודאלית היא שמאפשרת למודלים כמו Claude או GPT-4 לכתוב קוד כשמזינים לתוכו דיאגרמה ולמודלים שונים ליצור תמונות או סרטוני וידאו עם תיאורים.

את המהפכה המולטימודאלית אפשר לזהות בקלות בפלטפורמות כמו טיקטוק (TikTok) ואינסטגרם (Instagram), בהן משלבים סוגי מדיה מגוונים ומעבדים במגוון כלים, המשנים את הדרך בה אנו מספרים את הסיפור שלנו לעולם.


הנה הסבר היכולת המולטי-מודאלית:

https://youtu.be/97n1u66Shgg


כך עובדים מערכות מולטי מודאליות:

https://youtu.be/WkoytlA3MoQ


וההיפר מודאליות החדשה של גוגל מארינר:

https://youtu.be/KeUMm1xF3o0?long=yes
ראיית מכונה
מהי ראיית מכונה?



ראיית מכונה (Machine vision) היא יישום של ראייה ממוחשבת לבקרת מכונות, רובוטים ותהליכים שונים. ראיית המכונה היא חלק מתחום הלמידה הממוחשבת, ענף בתחום הבינה המלאכותית שמאפשר למחשבים יכולת לזהות תבניות בנתונים חזותיים, ויזואליים. הם עושים זאת על סמך נתונים קודמים ותוך התבססות על חוקים שנוצרו מקבוצות נתונים שבהם נתקלו מחשבים בעבר.

הדוגמה הכי בולטת שבה אולי נתקלתם, של ראיית מכונה (Machine vision), היא הטכנולוגיה שמאפשרת לדפי פייסבוק לזהות פרצופים בתמונות בעצמם. כך גם פועלים מנועי חיפוש תמונות, שיודעים לאתר תמונות לפי התוכן שבתוכן, כמו תמונות עם בית, תמונות בצבעי אדום-ירוק וכדומה.

בהרבה מקרים ראיית מכונה משתמשת בדימוּת, כלומר היא לא משתמשת דווקא במידע שהתקבל ממקורות אופטיים לצורך הניתוח, אלא במידע אחר.

השימושים של ראיית המכונה הם מגוונים כבר היום ונעים מהנחייה ובקרה של רובוטים, דרך אמצעי ראייה לכבדי ראייה ועיוורים ועד ליישומים כבדים כמו פיקוח תעשייתי על תהליכי ייצור במפעלים, צפיית בעיות בריאות באמצעות חיישנים רפואיים אישיים, פיתוח של מנועי חיפוש ויזואליים מתקדמים, המשתמשים בראיית מכונה וכאמור גם זיהוי פנים בתמונות וסרטים.

העתיד מבטיח יישומים מרגשים בהרבה. דמיינו את הסמארטפונים של העתיד, שיצויידו בבינה מלאכותית ויוכלו לעשות פעולות חכמות במיוחד עם המידע הויזואלי שהצטבר בתמונה שצילמתם במצלמת הטלפון.

דמיינו רחפנים שמזהים ונמנעים ממכשולים כדי להביא משלוחים ללקוחות מבלי להישדד בדרך, או מערכות רמזורים והכוונת תנועה שחוזות פקקי תנועה ומשחררות אותם לבד, רובוטים מאבטחים ש"רואים" בני אדם ומזהים מיידית מבוקשים, חשודים וכדומה.

אלה רק דוגמאות קטנות שלמעשה מתקיימת המהפכה התעשייתית הרביעית כבר עתה עם ראיית מכונות.

אז אם ראיית המכונה מאפשרת למחשבים לראות את העולם, היא תאפשר למחשבים למצוא בו דפוסים ותבניות שיוצרים הגיון ולפעול כדי להפוך אותו למקום טוב ובטוח יותר.


הנה הדגמת ראיית המכונה והשימוש בה בטלפון החכם (מתורגם):

https://youtu.be/g-G12agmEoI


איך מחשבים יכולים לראות ולהבין תמונה (מתורגם):

https://youtu.be/2hXG8v8p0KM


שימושים בטכנולוגיה של ראיית המכונה:

https://youtu.be/luuLcY30fQQ


ראיית מכונה היא הכרחית למכוניות העתיד האוטונומיות ללא נהג:

https://youtu.be/0DS9PY6iaxE


השפעת הראיית המכונה על התעשייה החדשה - זו שכבר נקראת תעשייה 4.0:

https://youtu.be/9FyPV59Q7-Q


אפליקציה לזיהוי ומידע על מוצרים בראיית מכונה:

https://youtu.be/uNy6Nt4F13o


זרוע רובוטית עם ראיית מכונה:

https://youtu.be/H01QG_EAMyw


סרטון תיעודי על ראיית מחשב (Computer Vision):

https://youtu.be/eQLcDmfmGB0?long=yes


ויכולות ראיית המכונה והעיבוד של גוגל ג'מיני:

https://youtu.be/wkTTkT7YCLw?long=yes
Flow
איך עושים סרטים ב-Flow AI?



פלואו (Flow) הוא כלי יצירת וידאו נהדר ואינטגרטיבי, מבוסס בינה מלאכותית גנרטיבית. מדובר בפלטפורמה המשלבת כלים שונים ליצירת מעין "אולפני צילום סרטים" שיש בהם הכל, רק שהם עובדים מהמחשב שלנו ומאפשרים יצירתיות אינסופית.

מדובר בשילוב של מודל תמונות נהדר (נאנו בננה שמייצר לוקיישנים, קאסטינג, דמויות, פרופס וכו'), עם מודל וידאו מעולה (Veo שהוא הבמאי והצלם) והצ'טבוט (ג'מיני של גוגל) כמודל שפה שמפעיל הכל (לצורך העניין הוא הצוות).


#תמונות
את התמונות נרצה לייצר כדי להנפיש אותן לווידאו בהמשך. בתיבת הפרומפטים בחרו "Create image". בין כלי התמונות בחרו את "נאנו בננה" שמאפשר ליצור תמונה.

בהמשך אפשר לערוך את התמונה בדרכים פשוטות. כדי להסיר ממנה דברים יש לבחור אובייקט שרוצים להסיר מהתמונה (מסמנים אותו בכלי ה"לאסו" או בתיבת סימון) ואז לכתוב פרומפט שבו מבקשים להסיר את המסומן.

אפשר להוסיף עצמים לתמונה, באמצעות סימון אזור בתוכה (גם באמצעות לאסו או תיבת סימון) ואז לבקש בפרומפט להוסיף ולמקם בו עצמים או כל דבר (כותבים בתיבת הפרומפטים "add @" (add ואז שטרודל) ומשלימים בכתיבה מתמונות אחרות שהעלית או יצרת כבר.

לא מרוצים מהתוצאה? - לחצו על "Reuse prompt" והוא יעשה נסיונות נוספים על אותה הנחייה.

לשנות את סגנון התמונה (ריאליסטי, מצויר, אנימציה וכו'. אחרי בחירה הוא נותן המון תת-סגנונות לבחירה) אפשר גם באמצעות פרומפט.


#סרטונים
ליצירת הסרטון התחילו בלחיצה על New project. ואז:

#1. Text to video
כאן הוא יאפשר ליצור בפשטות סרטון מפרומפט, הנחייה טקסטואלית. כאן לא חייבים להכין תמונה או תמונות לפני כן. המדהים הוא שאם תעברו עוד מעט ל"בונה הסצנות" (Scene builder), הוא ישמור על העקביות של הדמויות שתקבלו כאן.

#2. Frames to video
כאן יש ללחוץ על הכפתור הסמוך לחץ ההפעלה המשמש לג'ינרוט ובתפריט שצץ בוחרים Frames, עוד אפשר לבחור אם נשתמש בתמונות או בסרטונים, באיזה Aspect Ratio נרצה ליצור וכמה דוגמאות הוא יג'נרט בכל לחיצה (שימו לב שיורדים טוקנים ככל שמרבים בדוגמאות. אבל מה שחשוב בבחירה ב-Frames הוא שהיא תציג בתיבת הכתיבה את כפתורי ה"התחלה" וה"סיום". אליהם נגרור תמונת התחלה של שוט ותמונת סיום שלו - לדוגמה: איש מטפס על הר כתמונת פתיחה ואותו איש (העקביות תבוצע אוטומטית) מניף ידיים באושר על הפסגה - כתמונת סיום.

אז עכשיו נייצר בפרומפט (או נייבא) תמונת פתיחה שמתאימה לחזון שלנו. היתרון הגדול הוא שאם ניכנס לתמונה נקבל אותה בגודל מלא ואז נוכל לכתוב את הפרומפט לתמונת הסיום של השוט והוא ייצר אותה. בצד ימין ניתן לבחור בתמוניות בין כל הווריאציות וכרגע אלה תמונת הפתיחה ותמונת הסיום. שימו לב שהוא שומר על עקביות (Consistency) בדמויות (ב-Nano Banana Pro בוודאות), שזו תכונה חשובה מאוד בהפקה של סרטים באמצעות AI (הרי לא תרצו שינוי בבגדים או ברקע...). כדי לחזור למסך העבודה נלחץ על "Exit".

במסך העבודה נלחץ על כפתורי "Add to the prompt" של התמונות כדי לבחור את תמונת ההתחלה (אפשר לבחור גם פריים בסרטון כהתחלה) ותמונת הסיום. עכשיו נכתוב פרומפט של השוט או הסצנה כולה, כולל דיבורים או סאונדים שנרצה בסצנה (אם אינכם רוצים Subtitles או מוסיקה עליכם לציין זאת בפרומפט), נלחץ על כפתור ה-Generation ונקבל את השוט. אם הוא דוחף דברים (למשל שירה...) פשוט לחצו על Reuse prompt ובקשו להימנע ממה שהוא דחף (למשל No singing).

#3. Ingredients to video
כאן יש בחירת תמונות וגרירה ל-Ingredients שיתגלה כשתגררו אותם אל מעל שדה הכתיבה של הפרומפטים. כאן ניתן לייבא אליו תמונות (או להשתמש באלה שכבר בחרנו מהחומרים) ולחבר ביניהן. כשצריכים (ולא פעם תרצו... אינטראקציה היא הגדולה של הכלי), אפשר ליצור ולהשלים בתמונות מטורפות - באמצעות פרומפט מילולי.

באמצעות פרומפט (אנחנו העורך) ניתן לייצר בהמשך סצנה מכמה תמונות שהעלינו ועבאמצעות הנחייה מילולית פשוטה או מתוחכמת, נתאר את הסצנה ומה מתרחש בה.


#עריכת סצנות
העריכה של הסצנות פשוטה ואפקטיבית מתמיד:

סצנה חדשה יוצרים בלחיצה על כפתור +.

כל סצנה ניתן לקצר (גוררים את אחת מדפנותיה, התחלה או סוף, פנימה). כך ניתן לשנות לה את ההמשך או להאריך אותה אחרת (Extend) וכך לספר את הסיפור שאני רוצה ולא מה שיצא.

באמצעות פרומפטים מתאימים אפשר לבחור זוויות צילום ותנועת מצלמה.


הנה הדגמה של פלואו (מסך מלא):

https://youtu.be/mim7EzmiCZ8


כך התקדם וידאו AI תוך 3 שנים (הגדילו למסך מלא):

https://youtu.be/geMVJLSFXHI


כך יוצרים סרט מדבר באמצעות Flow האינטגרטור מדהים:

https://youtu.be/9nVEfjmDlVk


הכלי שעושה סרט שלם מפרומפט קטן:

https://youtu.be/BGuxsk79sYY


כך עובדים עם Frames to Video:

https://youtu.be/KQu6X0VFsxc


וסיפור הפיתוח של הכלי היצירתי כל כך:

https://youtu.be/xjXhJcWZkDE?long=yes

Gemini

טפשת הרשת
מהי טפשת ה-AI שתפגע באיכות התוכן והקוד?



אחת התופעות שמתחילות להתגלות בשנים האחרונות, מאז הפריצה של הבינה המלאכותית הגנרטיבית, היא של טפשת שגורמת הבינה הגנרטיבית למידע ולתוכן באינטרנט.

ברור שהשימוש הכל כך קל ב-Generative AI מקל על המשתמשים, אבל ידוע לכל שיש לבדוק את המידע שהיא יוצרת לפני שמחזירים אותו לציבור כמידע שיצרו בני אדם. מסתבר שרבים לא מבינים את החולשות והפגמים שעדיין מלאים בהם מודלי השפה, אותם מודלים גדולים (LLMs) שעושים היום את הידע. אם אלה תכנים שהתקבלו מקלוד או ChatGPT, רכיבי AI שנועדו לייצר קוד בתכנות, וידאו או תמונות גנרטיביות שיוצרים מנועים שונים ועוד.

התופעה הזו כבר פוגעת באיכות המידע באינטרנט, לפי בדיקות אובייקטיביות שעורכים באופן תקופתי לאיכות הרשת. מסתבר שלא זו בלבד שבני אדם מסתמכים על מידע שחלקו לא מדויק בלשון המעטה, אלא שהקרולרים עצמם, אותן תוכנות שאוספות את המידע מהרשת לצורך אימון, הזנת ועדכון מודלי השפה הגדולים - מסתבר שהם עצמם מסתמכים על המידע הגרוע הזה. ובדיוק כך, הוא חוזר למודל השפה ונכנס לתוכן שמקוטלג לטוקנים (Tokens) ובחזרה לדאטה שעליו הם מסתמכים. התוצאה היא שיותר ויותר מידע לא בדוק ולא אחראי, שהגיע מלכתחילה לרשת ממודלי שפה לא בשלים מספיק, חוזר ומפרה את המודלים הבוגרים, שאמורים לקבל מידע אנושי ואיכותי ולא תמיד יודעים לאתר את השגיאות שבו.

גם בעולם העסקים והארגונים יש כבר החמרה. הירידה באיכות התוכן שבאינטרנט נובעת מהשימוש הגובר והולך בחומר בינוני, שהגיע מהבינה המלאכותית הגנרטיבית, אך לא בוגרת, של הדור הראשון. כבר עם ההשקה של ChatGPT ב-2022, גילו מנהלים את הצ'טבוט שמאפשר להם ליצור חומרים באמצעות בינה מלאכותית יוצרת (generative AI) וחיפשו דרכים להשתמש בהם, במקום בעבודה של עובדים או חברות מיקור החוץ שבהם השתמשו בעבר. מעט מאותם מאמצים התגלו כיעילים ומרביתם נשארו בפוטנציאל יותר מאשר החליפו עובדים.

אך בתחום התכנות זה כן קרה. מסתבר שמודלים כמו CoPilot, Claude ואחרים מייצרים קוד במהירות ומחליפים את הג'וניורים, המתכנתים הצעירים בתעשייה. לפי סקרים שמתפרסמים בעולם נראה שקצב האימוץ של המנועים הללו הוא גבוה, במיוחד ביחס לזמן הקצר שבו הם פועלים. אלא שבסוף 2024 מתחיל להסתבר שכ-40% מהמתכנתים בעולם משתמשים בכלים כאלה ומשגרים קוד שלפחות בחלקו הוא פחות מוצלח. קוד זה חוזר ו"נלמד" על ידי המודלים ומוריד את איכות התכנות שלהם באופן מתמשך, שעלול אף להחמיר.


אֵאוּרִיקַה - האנציקלופדיה של הסקרנות!

העולם הוא צבעוני ומופלא, אאוריקה כאן בשביל שתגלו אותו...

אלפי נושאים, תמונות וסרטונים, מפתיעים, מסקרנים וממוקדים.

ניתן לנווט בין הפריטים במגע, בעכבר, בגלגלת, או במקשי המקלדת

בואו לגלות, לחקור, ולקבל השראה!

אֵאוּרִיקַה - האנציקלופדיה של הסקרנות!

שלום,
נראה שכבר הכרתם את אאוריקה. בטח כבר גיליתם כאן דברים מדהימים, אולי כבר שאלתם שאלות וקיבלתם תשובות טובות.
נשמח לראות משהו מכם בספר האורחים שלנו: איזו מילה טובה, חוות דעת, עצה חכמה לשיפור או כל מה שיש לכם לספר לנו על אאוריקה, כפי שאתם חווים אותה.