于开丞の転換は、認識技術や大規模データを否定したものではなく、制御に必要な状態予測のために全画素を生成するのは非効率だという判断に基づく。 Awomoは、物体・状態・空間関係・行動・因果変化を、再利用可能で組み合わせ可能な物理概念として潜在空間に表現する「概念世界モデル」を掲げる。
研究の答え

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
于开丞(Yu Kaicheng)の歩みは、AI業界で主流だった「データを増やし、モデルを大きくする」発想を単純に否定する物語ではない。むしろ、認識とデータ規模の拡大を実際に進めてきた研究者が、物理世界で行動するAIにとって、映像のリアルさと意思決定に必要な理解は同じではないと判断した結果だ。
彼がAwomoで提案するのは、未来の映像を画素単位で描き続けるのではなく、予測の対象そのものを、物体、状態、関係、行動、因果変化からなる構造化された状態として扱う方法である。AIが潜在空間の中でそれらを組み替え、行動の結果を予測し、計画できるようにする狙いだ。1
10
于开丞は自動機械学習(AutoML)を研究した後、アリババの人材プログラム「阿里星」を通じてDAMO Academyに加わり、自動運転の視覚認識へと研究領域を広げた。代表的な研究の一つであるBEVFusionは、カメラとLiDARの情報を共通の鳥瞰図(BEV)表現に統合し、複数センサーによる認識を一つの物理空間で扱う枠組みだった。10
2023年、于开丞は西湖大学に移り、自主知能研究室(AutoLab)を立ち上げた。当初は生成型の自動運転世界モデルに取り組み、2024年にはECCVの自動運転部門、2026年にはFail2Driveのランキングで首位になったと報じられている。10
それでも、成果を積み上げた先でチームは立ち止まった。生成モデルが現実らしい映像を作れるようになっても、AIが行動の結果を考えるために、毎回すべての画素をレンダリングする必要があるのか――。本当に知りたいのが「この行動を取ったら、世界はどう変わるか」なら、画像の細部を逐一再構成することは、タスクに必要な状態や因果関係から離れた高コストな迂回路になり得る。1
10
2024年末、チームは画素生成から、エンドツーエンドで学習する数学的な潜在空間へと方針を転換したと報じられている。構想では、複雑なシーンを有限個の再利用可能な物理概念と関係に分解し、それらを組み合わせて次の状態を予測する。学習データに完成形として登場していない概念の組み合わせにも対応することが目標だ。1
ここでいう「暗黙的(implicit)」は、単に中身の分からない圧縮表現を意味しない。Awomoが主張するのは、潜在状態の中に、エンティティ、空間的な関係、物体の状態、行動、因果的な遷移といった物理概念を持たせることだ。画像を小さくしただけの埋め込みとは異なり、概念を分離して扱い、必要に応じて再構成することを目指している。1
11
この方式の見返りとして想定されるのが、組み合わせによる汎化だ。たとえば「物体をつかむ」「扉を閉める」「落下を予測する」といった概念を個別に学んでいれば、それらが同時に起きる新しい状況を、シナリオ全体の実演を丸ごと見なくても推論できる可能性がある。于开丞が、VLAモデルへのデータ追加や実演の積み増しだけでは、物理知能の向上にいずれ限界が来ると考える理由もここにある。1
このアプローチは、ヤン・ルカンが提唱するJEPAと同じく、画素を再構成するのではなく表現を予測する広い意味での潜在予測の系譜に位置づけられる。1
Awomoが示す違いは、潜在空間に何を入れるのかを明示する点にある。于开丞の説明では、JEPAは潜在変数の具体的な内容を開いたままにしている。一方、概念世界モデルは、物理概念を組み合わせ可能な語彙として潜在空間に組み込もうとする。ただし、これは現時点では研究上の仮説であり、独立した検証によって優位性が確立されたわけではない。1
Awomo側の報告によれば、2025年の社内実験では、概念の分解と関連付けを導入したモデルが、模倣学習と強化学習のベースラインに比べて複雑なタスクの成功率を高め、予測コストも抑えたという。1
ただし、現時点で参照できる公開報道には、完全な実験プロトコル、モデル規模、タスク分布、具体的な成功率、信頼区間、アブレーション、コード、第三者による再現結果は示されていない。そのため、どの程度の優位性があるのかは、公開情報だけでは十分に裏付けられていない。1
「ドアを閉めながら、落ちてくるカップをつかむ」という例は、このモデルが狙う能力を説明するものだ。単一の実演データに似たパターンを選ぶのではなく、複数の状態変化と、それらの因果的な制約を同時に表現する。しかし、これは于开丞が示す動機付けの例であり、検証済みのベンチマーク結果として読むべきではない。1
研究成果は、杭州西湖数智科技有限公司(英語ブランド名:Awomo)として事業化された。同社は2026年1月8日に杭州市西湖区で設立され、対象分野として自動運転、ロボット、産業機器、スマートハードウェア、シミュレーションデータ生成などを挙げている。11
報道によれば、立ち上げ時の中核は于开丞と最高科学責任者のTongの2人で、その後、西湖大学AutoLabのチームを基盤に拡大した。メンバーを「継続的に自分の実力を証明してきた天才たち」と表現する言葉は、チームの魅力を伝える宣伝的な表現であり、独立して検証できる人材評価の指標ではない。1
Awomoは、種子ラウンドとエンジェルラウンドを合わせた累計調達額が1億元(約20億円、1元=20円換算の概算)を超えたと発表している。投資家として、InnoFund、Dongfang Jiafu Fund、Zhengxuan Investment、Tianqi Capital、Westlake Innovation Fund、Jinma Investmentの名を挙げている。13
2026年8月の報道では、Awomo-v0.1が概念世界モデルの取り組みとして初めて公開されたバージョンとして紹介され、堅牢な両腕ロボット操作を扱うシミュレーション型ベンチマーク・データ生成フレームワーク、RoboTwin 2.0での評価にも言及された。1
3
これは、同社の構想が外部の評価環境に姿を見せたという意味では重要な一歩だ。しかし、それだけで実機への汎化、安全性、あるいは既存の有力手法に対する優位性が証明されるわけではない。今後その主張を評価するには、ベンチマークの具体的なスコア、標準化された比較対象、実世界への転移結果を含む、より透明性の高い検証が必要になる。
于开丞の現在の立場を、データや視覚認識への反対と捉えるのは正確ではない。彼自身が進めてきたのは、センサー情報を統合し、データを活用して認識性能を高める研究だった。転換の核心は、物理世界で行動するAIにとって、見た目を再現することと、行動による状態変化を理解することは別の課題だという認識にある。
Awomoの概念世界モデルは、まだ初期段階の研究仮説であり、公開された証拠も限定的だ。それでも、世界モデルを「次の映像を描く仕組み」から「行動後の世界の変化を、概念と因果関係の組み合わせとして予測する仕組み」へと捉え直す試みとして、于开丞のキャリア転換は、物理AIがどこに計算資源を使うべきかという議論を浮かび上がらせている。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
于开丞の転換は、認識技術や大規模データを否定したものではなく、制御に必要な状態予測のために全画素を生成するのは非効率だという判断に基づく。
于开丞の転換は、認識技術や大規模データを否定したものではなく、制御に必要な状態予測のために全画素を生成するのは非効率だという判断に基づく。 Awomoは、物体・状態・空間関係・行動・因果変化を、再利用可能で組み合わせ可能な物理概念として潜在空間に表現する「概念世界モデル」を掲げる。
2025年の社内実験では従来の模倣学習・強化学習ベースラインに対する改善が報告されたが、公開された実験の詳細は限られ、優位性の規模はまだ十分に検証されていない。