อวี๋ ไคเฉิงไม่ได้ปฏิเสธการรับรู้ภาพหรือการใช้ข้อมูลขนาดใหญ่ แต่เห็นว่าการสร้างภาพระดับพิกเซลอาจเป็นเป้าหมายขั้นกลางที่สิ้นเปลืองเกินไปสำหรับการควบคุม เมื่อโมเดลสร้างภาพที่ดูสมจริงได้แล้ว แนวทางของ Awomo คือสร้างสถานะภายในที่ประกอบด้วยแนวคิดทางกายภาพ เช่น วัตถุ สถานะ ความสัมพันธ์ การกระทำ และการเปลี่ยนแปลงเชิงเหตุผล...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
จุดเปลี่ยนของอวี๋ ไคเฉิงไม่ได้เกิดจากการปฏิเสธงานด้านการรับรู้ภาพหรือพลังของข้อมูลขนาดใหญ่ แต่เกิดจากข้อสรุปว่า เมื่อ AI สามารถสร้างภาพที่ดูสมจริงได้แล้ว การพยากรณ์ระดับพิกเซลอาจไม่ใช่ตัวแทนปัญหาที่เหมาะสมที่สุดสำหรับการควบคุมและการตัดสินใจ
ทางเลือกของเขาคือทำให้ “สถานะที่ใช้พยากรณ์” เป็นโครงสร้างที่บรรจุแนวคิดทางกายภาพอย่างเป็นระบบ ไม่ว่าจะเป็นวัตถุ สถานะ ความสัมพันธ์ การกระทำ และการเปลี่ยนแปลงเชิงเหตุผล จากนั้นให้เอเจนต์นำแนวคิดเหล่านี้มาประกอบใหม่และวางแผนในพื้นที่แฝง แทนที่จะต้องเรนเดอร์วิดีโอขึ้นมาใหม่อย่างต่อเนื่อง 1
10
ประสบการณ์ดังกล่าวนำไปสู่บทเรียนสำคัญในมุมมองของอวี๋ นั่นคือ การสร้างวิดีโอช่วยให้ภาพดูสมจริงขึ้น แต่ไม่ได้แปลว่าการสร้างรายละเอียดทุกพิกเซลคือสิ่งที่ระบบควรใช้คำนวณเพื่อพยากรณ์และตัดสินใจเสมอไป หากคำถามที่สำคัญคือ “ถ้าลงมือทำแล้วจะเกิดอะไรขึ้น” การสร้างภาพทั้งหมดขึ้นมาใหม่อาจเป็นทางอ้อมที่มีต้นทุนสูง และทำให้ระบบห่างจากสถานะที่เกี่ยวข้องกับงานและเหตุปัจจัยมากขึ้น 1
10
ช่วงปลายปี 2024 ทีมจึงเปลี่ยนจากแนวทางที่เน้นการสร้างพิกเซลไปสู่พื้นที่แฝงทางคณิตศาสตร์ที่เรียนรู้แบบ end-to-end แนวคิดนี้พยายามแยกฉากหนึ่งออกเป็นแนวคิดและความสัมพันธ์ทางกายภาพจำนวนจำกัด ซึ่งสามารถนำกลับมาใช้ซ้ำและประกอบเข้าด้วยกันเพื่อคาดการณ์สถานะถัดไป รวมถึงการผสมผสานที่ไม่เคยปรากฏเป็นฉากสมบูรณ์ในข้อมูลฝึกมาก่อน 1
คำว่า “implicit” หรือ “โดยนัย” ในที่นี้จึงไม่ได้หมายความว่าเป็นตัวแทนที่ไร้โครงสร้าง ข้อเสนอของ Awomo คือสถานะแฝงควรเข้ารหัสแนวคิดอย่างเอนทิตี ความสัมพันธ์เชิงพื้นที่ สถานะของวัตถุ การกระทำ และการเปลี่ยนแปลงเชิงเหตุผล ไม่ใช่เป็นเพียงเวกเตอร์ภาพที่ถูกบีบอัดให้เล็กลงเท่านั้น 1
11
ผลลัพธ์ที่ทีมคาดหวังคือการทำให้โมเดล “เหมารวมเชิงองค์ประกอบ” ได้ดีขึ้น กล่าวคือ หาก AI เรียนรู้แนวคิดที่เกี่ยวข้องแยกกันแล้ว ก็ควรนำแนวคิดเหล่านั้นไปใช้กับการรวมกันรูปแบบใหม่ได้ โดยไม่จำเป็นต้องมีตัวอย่างของทุกสถานการณ์แบบครบชุด นี่เป็นเหตุผลที่อวี๋มองว่าการเพิ่มข้อมูล VLA หรือเพิ่มตัวอย่างสาธิตเพียงอย่างเดียวอาจให้ผลตอบแทนลดลงเมื่อโจทย์ขยับไปสู่ความฉลาดทางกายภาพ 1
แนวทางนี้อยู่ในตระกูลเดียวกับการพยากรณ์ในพื้นที่แฝงของ Yann LeCun และแนวคิด JEPA ในภาพกว้าง นั่นคือพยากรณ์ตัวแทนของสถานะ แทนการสร้างภาพระดับพิกเซลกลับคืนมา 1
ความแตกต่างที่ Awomo เสนออยู่ที่ความหมายและสถาปัตยกรรม อวี๋มองว่า JEPA ยังไม่ได้ระบุอย่างชัดเจนว่าตัวแปรในพื้นที่แฝงควรประกอบด้วยอะไร ขณะที่ Concept World Model ตั้งเป้าสร้างคลังแนวคิดทางกายภาพที่นำมาประกอบใหม่ได้ อย่างไรก็ตาม นี่เป็นสมมติฐานด้านการวิจัยของ Awomo และยังไม่ใช่ข้อได้เปรียบที่ได้รับการยืนยันโดยอิสระ 1
Awomo เปิดเผยผลทดลองภายในปี 2025 ว่า เมื่อเพิ่มกลไกการแยกและเชื่อมโยงแนวคิด โมเดลทำงานซับซ้อนได้สำเร็จมากขึ้นเมื่อเทียบกับฐานเปรียบเทียบจาก imitation learning และ reinforcement learning อีกทั้งใช้ต้นทุนการพยากรณ์ต่ำลง 1
แต่รายงานสาธารณะที่มีอยู่ในชุดข้อมูลนี้ยังไม่ได้เปิดเผยรายละเอียดสำคัญ เช่น วิธีทดลองฉบับเต็ม ขนาดโมเดล การกระจายของงาน อัตราความสำเร็จเชิงตัวเลข ช่วงความเชื่อมั่น การทดลองตัดองค์ประกอบ หรือโค้ดสำหรับการทำซ้ำ ดังนั้น ขนาดของข้อได้เปรียบที่อ้างจึงยังมีหลักฐานสาธารณะไม่เพียงพอ 1
ตัวอย่างที่อวี๋ยกขึ้นมา—การรับแก้วที่กำลังตกพร้อมกับปิดประตู—สะท้อนประโยชน์ที่แนวคิดนี้ต้องการให้เกิดขึ้น ระบบควรแทนการเปลี่ยนแปลงหลายอย่างที่เกิดขึ้นพร้อมกัน รวมถึงข้อจำกัดด้านเหตุและผลของแต่ละการกระทำไว้ร่วมกัน แทนการเลือกคำตอบจากรูปแบบที่เคยเห็นในคลังตัวอย่างสาธิต อย่างไรก็ดี ตัวอย่างนี้ควรอ่านในฐานะข้อเสนอเพื่ออธิบายแนวคิด ไม่ใช่ผลการทดสอบมาตรฐานที่ได้รับการยืนยันแล้ว 1
งานวิจัยดังกล่าวถูกนำไปพัฒนาเชิงพาณิชย์ในชื่อ Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd. หรือแบรนด์ Awomo บริษัทจดทะเบียนในเขตซีหู เมืองหางโจว เมื่อวันที่ 8 มกราคม 2026 และระบุว่ามุ่งสร้างเทคโนโลยี Physical AI สำหรับรถยนต์ไร้คนขับ หุ่นยนต์ อุปกรณ์อุตสาหกรรม ฮาร์ดแวร์อัจฉริยะ และการสร้างข้อมูลจำลอง 11
รายงานระบุว่าแกนเริ่มต้นของบริษัทประกอบด้วยอวี๋และ Tong หัวหน้านักวิทยาศาสตร์ ก่อนขยายทีมจาก AutoLab ของมหาวิทยาลัยเวสต์เลก คำบรรยายสมาชิกทีมว่าเป็น “อัจฉริยะรุ่นเล็กที่พิสูจน์ตัวเองมาอย่างต่อเนื่อง” เป็นภาษาส่งเสริมการตลาด ไม่ใช่ตัวชี้วัดบุคลากรที่ตรวจสอบได้โดยอิสระ 1
Awomo ประกาศว่าระดมทุนรอบ Seed และ Angel รวมกันมากกว่า 100 ล้านหยวน นักลงทุนที่ระบุชื่อ ได้แก่ InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund และ Jinma Investment 13
รายงานในเดือนสิงหาคม 2026 นำเสนอ Awomo-v0.1 ในฐานะเวอร์ชันสาธารณะครั้งแรกของความพยายามพัฒนา Concept World Model และกล่าวถึงการประเมินบน RoboTwin 2.0 ซึ่งเป็นกรอบงานและชุดข้อมูลจำลองสำหรับการสร้างข้อมูลและทดสอบการควบคุมหุ่นยนต์สองแขนที่มีความทนทาน 1
3
การปรากฏตัวบน RoboTwin 2.0 ทำให้ Awomo มีเวทีประเมินผลต่อสาธารณะในระยะเริ่มต้น แต่ยังไม่เพียงพอที่จะยืนยันว่าโมเดลสามารถถ่ายโอนไปใช้กับหุ่นยนต์จริงได้ทั่วไป มีความปลอดภัย หรือเหนือกว่าทางเลือกชั้นนำ การตรวจสอบที่แข็งแรงกว่านี้จำเป็นต้องมีคะแนนทดสอบที่เปิดเผย ฐานเปรียบเทียบที่เป็นมาตรฐาน และผลการถ่ายโอนจากสภาพจำลองสู่โลกจริง
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
อวี๋ ไคเฉิงไม่ได้ปฏิเสธการรับรู้ภาพหรือการใช้ข้อมูลขนาดใหญ่ แต่เห็นว่าการสร้างภาพระดับพิกเซลอาจเป็นเป้าหมายขั้นกลางที่สิ้นเปลืองเกินไปสำหรับการควบคุม เมื่อโมเดลสร้างภาพที่ดูสมจริงได้แล้ว
อวี๋ ไคเฉิงไม่ได้ปฏิเสธการรับรู้ภาพหรือการใช้ข้อมูลขนาดใหญ่ แต่เห็นว่าการสร้างภาพระดับพิกเซลอาจเป็นเป้าหมายขั้นกลางที่สิ้นเปลืองเกินไปสำหรับการควบคุม เมื่อโมเดลสร้างภาพที่ดูสมจริงได้แล้ว แนวทางของ Awomo คือสร้างสถานะภายในที่ประกอบด้วยแนวคิดทางกายภาพ เช่น วัตถุ สถานะ ความสัมพันธ์ การกระทำ และการเปลี่ยนแปลงเชิงเหตุผล เพื่อให้ AI นำองค์ประกอบเหล่านี้มาประกอบใหม่และวางแผนในพื้นที่แฝง
ทีมเริ่มเปลี่ยนจากการสร้างพิกเซลไปสู่ Concept World Model ในช่วงปลายปี 2024 โดยหวังให้โมเดลรับมือกับการผสมผสานของสถานการณ์ที่ไม่เคยปรากฏครบชุดในข้อมูลฝึก