הכיוון שהוצג
ב־4 באוגוסט פרסמה NVIDIA הסבר על World Action Models, או WAMs. הגישה משתמשת במודל עולם המבוסס על וידאו כבסיס למדיניות רובוטית. במקום להסתפק בקישור בין תיאור מילולי לתמונה, המודל לומד דפוסים של שינוי בזמן ומותאם להפקת פעולות. הפרסום מציג את Cosmos 3 כתשתית אפשרית לתהליך ומפנה למחקר ולמשקלים.
הקשר למשימה פיזית
כאשר תפסן סוגר על חפץ, חשוב לדעת גם כיצד החפץ צפוי לנוע ומה יופיע במצלמה בהמשך. מדיניות שמנבאת תנועה ותצפיות עתידיות יחד יכולה להשתמש בידע על אינטראקציות שנלמד לפני האימון למשימה המסוימת. זו מוטיבציה מחקרית להפחתת התלות בהדגמות כמעט זהות ולשיפור התנהגות מול שינוי בחפצים, ברקע או במבנה הרובוט.
מה עדיין צריך להוכיח
המאמר מציג את יתרונות הכיוון מנקודת מבטה של NVIDIA. אין להסיק ממנו שכל מודל WAM עדיף על כל VLA, או שחיזוי וידאו אמין תמיד מבחינה פיזיקלית. השוואה שימושית צריכה לשמור על תנאי אימון והערכה ברורים. גם הפקת סרטון עתידי משכנע אינה לבדה ראיה שהפעולה המוצעת בטוחה או ניתנת לביצוע בחומרה.
המשמעות לרובוטיקה
פרשנות: המשמעות היא שינוי בשאלה מהו הידע המוקדם שמועיל לרובוט: הבנת מילים וחפצים, לצד הבנת השינוי שהפעולה גורמת. כדאי לבחון האם הגישה משפרת התאמה לסביבות חדשות ובאיזו עלות חישובית. זהו דיון על ארכיטקטורת למידה, ולא הכרזה על החלפה מיידית של כל מערכות השליטה הקיימות במפעלים ובבתים.
המקורות שלנו
המקור, סוג העדות ותאריך הבדיקה זמינים כדי שתוכלו לבדוק בעצמכם.
- NVIDIA | פרסום המקורמקור רשמי · נבדק 16 בספטמבר 2026
מצאתם טעות או מידע שהתעדכן? שלחו תיקון. תיקונים מהותיים יתועדו כאן.