CADABRA AI

מה באמת קורה כשלוחצים Generate? הסיפור מאחורי מנועי הוידאו של AI

רציתם תמיד לדעת איך בדיוק Kling או Seedance יודעים להפוך משפט לסרטון? הסבר אנושי, בלי מילים גדולות, עם הרבה רגעי "וואו".

מוטי שאל אותי שאלה מעניינת בזמן שחיכינו לסרטון להיווצר ב-Kling: "מייטל, מה בעצם קורה שם בפנים? איך המחשב יודע להפוך את המשפט שלי לסרט?" ובכן, אחרי שחקרנו את הנושא לעומק, יש לנו תשובה. והיא מדהימה.

שלב 1: המחשב קורא את הפרומפט שלכם

כשאתם כותבים "חתול רוקד על גג בשקיעה", המנוע לא מבין מילים כמונו. הוא משתמש במשהו שנקרא Transformer, אותה טכנולוגיה שמריצה את ChatGPT. ה-Transformer ממיר כל מילה למספרים, מספרים שמייצגים משמעות. "חתול" הופך לווקטור מספרי, "רוקד" לווקטור אחר, ו"שקיעה" לעוד אחד. אבל הקסם האמיתי? הוא מבין את הקשר ביניהם. הוא יודע שחתול רוקד זה לא אותו דבר כמו חתול ישן.

שלב 2: Vision. המנוע רואה תמונות

וזה החלק שבאמת שינה הכל ב-2026. כשאתם מעלים תמונה ומשתמשים ב-@image_1, המנוע לא סתם שם את התמונה בצד. הוא סורק אותה, מזהה פנים, מבין מבנה גוף, צבע עור, סגנון לבוש, תאורה, ורקע. כמו שצלם מקצועי מסתכל על תמונה ומבין את כל מה שקורה בה תוך שנייה, ככה המנוע עובד. רק שהוא עושה את זה עם מיליוני פרמטרים של רשת נוירונים.

שווה לדעת: לכן תמונות רפרנס חזיתיות עם תאורה טובה נותנות תוצאות הכי טובות. המנוע צריך לראות את הפנים כמה שיותר ברור כדי לשחזר אותן בסרטון.

שלב 3: Diffusion. מרעש לסרט

עכשיו מגיע החלק הכי מגניב. המנוע מתחיל מרעש. ממש רעש. כמו טלוויזיה ישנה שאין לה קליטה, מסך מלא בנקודות אקראיות. ואז, צעד אחרי צעד, הוא מסיר את הרעש. בכל צעד, התמונה נהיית קצת יותר ברורה. קצת יותר חדה. עד שאחרי כמה עשרות צעדים, מופיע סרטון שלם. זה נקרא Diffusion Model, וזה אחד הפיתוחים הכי מהפכניים בהיסטוריה של בינה מלאכותית.

תחשבו על זה כמו פסל שמסיר שכבות מאבן עד שמופיעה יצירת אמנות. הסרטון כבר שם, בתוך הרעש, והמנוע פשוט חושף אותו.

שלב 4: פריים אחרי פריים

סרטון זה לא תמונה אחת. זה 24-60 תמונות בשנייה. והמנוע צריך לוודא שכל תמונה הגיונית ביחס לקודמת. שהחתול באמת זזע בצורה טבעית, שהשמש באמת שוקעת, שהרוח באמת מזיזה את הפרווה. המנועים החדשים כמו Kling 3.0 ו-Seedance 2.0 משתמשים ברשתות Temporal שמבינות זמן. הן לא מייצרות כל פריים בנפרד, אלא מייצרות רצף שלם עם תנועה חלקה וטבעית.

למה כל מנוע שונה?

  • Kling 3.0 מתמחה ב-Omni, יכולת להכניס דמויות מרובות עם @image ולשמור על עקביות פנים מושלמת
  • Seedance 2.0 מתמחה בסאונד, הוא מייצר אודיו שמסונכרן לווידאו כי הוא מאמן על וידאו ואודיו ביחד
  • Hailuo 2.3 מתמחה בהבעות פנים, הרשת שלו אומנה על מיליוני ביטויי פנים אנושיים

מה זה אומר עבורכם?

אתם לא צריכים להבין את כל המתמטיקה. אבל כשאתם מבינים את הלוגיקה, אתם כותבים פרומפטים טובים יותר. אתם מבינים למה תמונת רפרנס ברורה חשובה. למה פרומפט מפורט נותן תוצאות טובות יותר. ולמה כל מנוע טוב במשהו אחר.

הבינה המלאכותית לא מחליפה את היצירתיות שלכם. היא מחזקת אותה. ככל שתבינו איך היא עובדת, ככה התוצאות שלכם יהיו מדהימות יותר. וזה בדיוק מה שאנחנו מלמדים בקורס ובסדנאות.


עמוד הבית · בלוג · וידאו AI · תמונות AI · קול AI · כל המנועים · קרדיטים ולא מנוי · AI בעברית · קורס מתחילים · מדריכים