יו קאיצ׳נג עבר ממחקר ב AutoML ומיזוג חיישני LiDAR ומצלמות לחקר מודלים של עולם עבור נהיגה אוטונומית ורובוטיקה. הצוות שלו זנח בסוף 2024 את הגישה שמייצרת פיקסלים, ובחר במרחב לטנטי שמייצג מושגים פיזיים הניתנים לפירוק ולהרכבה.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
המעבר של יו קאיצ׳נג לא היה דחייה של ראייה ממוחשבת או של כוח חישוב ונתונים בהיקפים גדולים. המסקנה שלו הייתה ממוקדת יותר: ברגע שמערכת מסוגלת לייצר תצפיות שנראות מציאותיות, יצירת כל פיקסל עלולה להפוך ליעד ביניים יקר ולא יעיל עבור שליטה וקבלת החלטות. במקום זאת, הוא מציע שהמצב החזוי עצמו יהיה מובנה — אוסף של מושגים פיזיים, עצמים, מצבים, יחסים, פעולות ושינויים סיבתיים — כדי שסוכן יוכל להרכיב תרחישים ולתכנן במרחב חבוי, בלי לרנדר שוב ושוב וידאו מלא. 1
10
יו קאיצ׳נג (于开丞) התחיל את דרכו במחקר של למידת מכונה אוטומטית, או AutoML — שיטות שמאפשרות למערכות לבחור ולשפר בעצמן אלגוריתמים ותצורות למידה. בהמשך הצטרף לאקדמיית DAMO של עליבאבא במסגרת תוכנית Alibaba Star, ועבר לעסוק בראייה ממוחשבת ובתפיסה עבור כלי רכב אוטונומיים.
אחת מעבודותיו המזוהות עמו היא BEVFusion, שאיחדה מידע ממצלמות ומחיישני LiDAR לייצוג משותף במבט-על — Bird’s-Eye View — של המרחב הפיזי. העבודה תוארה בהמשך כתרומה שזכתה לציטוטים רבים בתחום מיזוג חיישנים. 10
ב-2023 הצטרף יו לאוניברסיטת ווסטלייק והקים את מעבדת AutoLab. בתחילה התמקד הצוות במודלים גנרטיביים של עולם עבור נהיגה אוטונומית. לפי הדיווחים, בהמשך זכה הצוות במקום הראשון במסלול הנהיגה האוטונומית של ECCV ב-2024 והוביל את דירוג Fail2Drive ב-2026. 10
אלא שההתקדמות הזו הובילה אותו לשאלה הפוכה: אם המודל כבר מסוגל לייצר נתונים חזותיים משכנעים, האם באמת צריך להשקיע את רוב החישוב בשחזור כל פרט ויזואלי? כאשר השאלה החשובה היא “מה יקרה אם אבצע פעולה מסוימת?”, יצירה מחדש של כל התמונה עלולה להיות מעקף יקר בדרך להבנת המצב הרלוונטי והסיבתיות שלו. 1
10
בסוף 2024, לפי הדיווחים, הצוות עבר מחיזוי ויצירת פיקסלים למרחב לטנטי מתמטי שנלמד מקצה לקצה. המטרה היא לפרק סצנה למספר סופי של מושגים פיזיים ויחסים הניתנים לשימוש חוזר, ואז להרכיב אותם כדי לחזות את המצב הבא — גם כאשר הצירוף המסוים הזה לא הופיע במלואו בנתוני האימון. 1
המילה “מרומז” או “חבוי” אינה אומרת שהייצוג חסר מבנה. הטענה של Awomo היא שהמצב הלטנטי צריך להכיל מושגים כמו ישויות, יחסים מרחביים, מצבי עצמים, פעולות ומעברים סיבתיים — ולא להיות רק גרסה דחוסה של תמונה. 1
11
ההבטחה המרכזית היא הכללה קומפוזיציונית: מערכת שלמדה בנפרד את המושגים “כוס”, “נפילה”, “דלת” ו“סגירה”, למשל, עשויה להסיק כיצד להתמודד עם צירוף חדש שלהם בלי להזדקק לדוגמה נפרדת לכל תרחיש אפשרי. מכאן מגיעה הביקורת של יו על ההנחה שהוספת עוד נתוני VLA — מודלים המשלבים ראייה, שפה ופעולה — ועוד הדגמות תפתור לבדה את בעיית האינטליגנציה הפיזית. לטענתו, בשלב מסוים התשואה של הוספת דוגמאות הולכת ופוחתת. 1
הגישה שייכת לאותה משפחה רחבה של חיזוי במרחב לטנטי כמו JEPA של יאן לקון: במקום לשחזר פיקסלים, המודל חוזה ייצוג מופשט של המצב. 1
ההבדל ש-Awomo מבקשת להדגיש הוא סמנטי וארכיטקטוני. לפי יו, JEPA משאירה פתוחה את השאלה מה בדיוק אמורים המשתנים הלטנטיים לייצג; הצעת “מודל העולם המושגי” מנסה לענות עליה באמצעות אוצר מילים ניתן להרכבה של מושגים פיזיים. חשוב להדגיש: מדובר בהשערת מחקר ובטענה של החברה, לא ביתרון שהוכח עד כה באופן בלתי תלוי. 1
Awomo דיווחה על ניסויים פנימיים מ-2025 שבהם פירוק וקישור בין מושגים שיפרו את שיעורי ההצלחה במשימות מורכבות לעומת קווי בסיס של למידת חיקוי ולמידת חיזוק, ובמקביל הפחיתו את עלות החיזוי. 1
עם זאת, בדיווחים הציבוריים הזמינים כאן אין פרוטוקול ניסוי מלא, פירוט של גודל המודלים, התפלגות המשימות, שיעורי הצלחה מספריים, רווחי סמך, ניסויי הסרה (ablations), קוד או שחזור בידי גורם בלתי תלוי. לכן, עוצמת היתרון המדווח עדיין אינה מבוססת דיה בפומבי. 1
הדוגמה של תפיסת כוס נופלת בזמן סגירת דלת ממחישה את המטרה: לייצג כמה שינויים המתרחשים במקביל ואת המגבלות הסיבתיות ביניהם, במקום לבחור פעולה מתוך דפוסים שנראו בעבר במאגר הדגמות. בשלב זה יש לקרוא אותה כדוגמה המניעה את החזון של יו — לא כתוצאה מאומתת של מבחן ביצועים. 1
המחקר הועבר למסחור במסגרת Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., תחת המותג Awomo. החברה נרשמה במחוז שיהולונג בעיר האנגג׳ואו ב-8 בינואר 2026. לפי הצהרתה, היא מפתחת תשתיות ל-Physical AI — בינה מלאכותית הפועלת בעולם הפיזי — עבור נהיגה אוטונומית, רובוטיקה, ציוד תעשייתי, חומרה חכמה ויצירת נתוני סימולציה. 11
לפי הדיווחים, הגרעין הראשוני כלל את יו ואת המדען הראשי Tong, ובהמשך התרחב מתוך צוות AutoLab באוניברסיטת ווסטלייק. התיאור של חברי הצוות כ“גאונים שהוכיחו את עצמם שוב ושוב” הוא ניסוח שיווקי, ולא מדד כוח אדם שניתן לאמת באופן עצמאי. 1
Awomo הודיעה על גיוס מצטבר של יותר מ-100 מיליון יואן בסבבי סיד ואנג׳ל. בין המשקיעים שנמנו: InnoFund, קרן Dongfang Jiafu, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund ו-Jinma Investment. 13
הסיקור מאוגוסט 2026 הציג את Awomo-v0.1 כגרסה הציבורית הראשונה של מאמץ מודל העולם המושגי, והתייחס להערכה על RoboTwin 2.0 — מסגרת סימולציה ומבחן ביצועים ליצירת נתונים ולמניפולציה רובוטית דו-ידנית עמידה. 1
3
הופעה זו מספקת נקודת הערכה ציבורית מוקדמת, אך אינה מוכיחה כשלעצמה הכללה לרובוטים אמיתיים, בטיחות או עדיפות על פני חלופות מובילות. כדי לבסס טענה כזו יידרשו ציוני מבחנים מפורטים, קווי בסיס סטנדרטיים ותוצאות העברה מהסימולציה לעולם האמיתי.
במילים אחרות, יו קאיצ׳נג אינו טוען בהכרח שהנתונים אינם חשובים. הוא מנסה לשנות את מה שהמודל עושה עם הנתונים: לא רק לצייר עולם שנראה אמיתי, אלא לבנות ייצוג פנימי של עצמים, מצבים, פעולות והחוקים שמחברים ביניהם. ההצלחה של הרעיון תימדד לא באיכות הסרטון שהמודל יודע לייצר, אלא ביכולתו לחזות תוצאות, לתכנן פעולות ולהתמודד עם מצבים חדשים — באופן שניתן למדידה ולשחזור.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
יו קאיצ׳נג עבר ממחקר ב AutoML ומיזוג חיישני LiDAR ומצלמות לחקר מודלים של עולם עבור נהיגה אוטונומית ורובוטיקה.
יו קאיצ׳נג עבר ממחקר ב AutoML ומיזוג חיישני LiDAR ומצלמות לחקר מודלים של עולם עבור נהיגה אוטונומית ורובוטיקה. הצוות שלו זנח בסוף 2024 את הגישה שמייצרת פיקסלים, ובחר במרחב לטנטי שמייצג מושגים פיזיים הניתנים לפירוק ולהרכבה.
החזון של Awomo דומה ברוחו ל JEPA של יאן לקון, אך מבקש להגדיר במפורש מה נמצא במרחב החבוי: עצמים, מצבים, יחסים, פעולות ומעברים סיבתיים.