Yu Kaicheng từng nghiên cứu AutoML, gia nhập Alibaba DAMO Academy qua chương trình Alibaba Star và tham gia phát triển BEVFusion, phương pháp hợp nhất dữ liệu camera và LiDAR trong cùng một biểu diễn góc nhìn từ trên... Sau khi xây dựng AutoLab tại Đại học Tây Hồ năm 2023 và thử nghiệm mô hình thế giới sinh ảnh, ông...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How did Westlake University researcher and Awomo founder Yu Kaicheng evolve from an Alibaba DAMO Academy AutoML PhD and Alibaba Star—whose B. Article summary: Yu’s shift was not a rejection of perception or large scale data; it was a conclusion that pixel level generation is an inefficient intermediate target for control once a system can already synthesize plausible observati. Topic tags: general web, chatgpt, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Điểm ngoặt của Yu Kaicheng không phải là phủ nhận vai trò của cảm nhận, dữ liệu lớn hay quy luật mở rộng quy mô. Lập luận của ông cụ thể hơn: một khi mô hình đã có thể tạo ra những quan sát nhìn đủ chân thực, việc tiếp tục tái tạo toàn bộ hình ảnh có thể không còn là mục tiêu tính toán hiệu quả nhất cho điều khiển.
Thay vào đó, Yu muốn mô hình dự đoán trực tiếp một trạng thái có cấu trúc gồm vật thể, thuộc tính, quan hệ, hành động và các biến đổi nhân quả. Khi đó, tác nhân có thể kết hợp những thành phần đã học để suy luận và lập kế hoạch trong không gian tiềm ẩn, thay vì liên tục dựng lại video của tương lai. 1
10
Yu Kaicheng (于开丞) bắt đầu với nghiên cứu tự động học máy, hay AutoML. Sau khi hoàn thành tiến sĩ, ông gia nhập Alibaba DAMO Academy thông qua chương trình Alibaba Star và chuyển sang bài toán cảm nhận cho xe tự hành. Hồ sơ của Đại học Tây Hồ cho biết ông từng nghiên cứu các hướng như thị giác 3D, lái xe tự động và AutoML trước khi đưa kết quả nghiên cứu vào các ứng dụng công nghiệp.
Một trong những công trình nổi bật của ông là BEVFusion. Phương pháp này hợp nhất thông tin từ camera và LiDAR trong một không gian biểu diễn bird’s-eye view, tức góc nhìn từ trên cao, nhằm giữ lại cả thông tin hình học lẫn ngữ nghĩa cho các tác vụ cảm nhận 3D. 10
Năm 2023, Yu rời DAMO Academy để gia nhập Đại học Tây Hồ và thành lập Phòng thí nghiệm Tự chủ thông minh AutoLab. Ban đầu, nhóm tiếp tục theo đuổi các mô hình thế giới sinh ảnh cho xe tự hành. Các hồ sơ và bài viết đương thời cho biết nhóm sau đó giành vị trí dẫn đầu ở một hạng mục lái xe tự hành tại ECCV năm 2024 và đứng đầu bảng xếp hạng Fail2Drive năm 2026. 10
Những thành tích này khiến bước chuyển tiếp theo của Yu càng đáng chú ý: ông bắt đầu đặt câu hỏi về chính hướng tiếp cận mà mình từng góp phần thúc đẩy.
Mô hình thế giới thường được kỳ vọng xây dựng một mô hình nội tại về môi trường: nếu tác nhân thực hiện một hành động, trạng thái tiếp theo sẽ thay đổi ra sao. Nói cách khác, câu hỏi quan trọng không chỉ là “khung hình tiếp theo trông như thế nào?”, mà còn là “nếu tôi làm điều này, điều gì sẽ xảy ra?”. 3
10
Theo cách Yu mô tả, mô hình sinh video có thể tạo ra hình ảnh thuyết phục nhưng chưa chắc đã nắm được trạng thái liên quan đến nhiệm vụ hay quan hệ nhân quả giữa hành động và kết quả. Nếu mục tiêu là lập kế hoạch, việc tái tạo mọi chi tiết hình ảnh có thể tiêu tốn nhiều tính toán mà không trực tiếp giúp tác nhân quyết định tốt hơn. 1
10
Đây là lý do nhóm chuyển từ mục tiêu sinh pixel sang dự đoán trạng thái trong không gian tiềm ẩn. Lập luận không phải “AI không cần thị giác”, mà là biểu diễn dự đoán nên tập trung hơn vào những gì chi phối hành động trong thế giới vật lý.
Cuối năm 2024, nhóm được cho là đã chuyển sang một hướng tiềm ẩn, học từ đầu đến cuối trong một không gian toán học. Mục tiêu là phân rã cảnh thành một tập hữu hạn các khái niệm và quan hệ vật lý có thể tái sử dụng, sau đó kết hợp chúng để dự đoán trạng thái tiếp theo. Về lý thuyết, mô hình có thể xử lý cả những tổ hợp chưa từng xuất hiện trọn vẹn trong dữ liệu huấn luyện. 1
“Tiềm ẩn” ở đây không có nghĩa là không có cấu trúc. Awomo cho biết không gian này cần mã hóa những thành phần như:
Cách tiếp cận này hướng tới khả năng tổng quát hóa theo tổ hợp. Nếu mô hình đã học riêng về một chiếc cốc, chuyển động rơi, cánh cửa và hành động đóng cửa, nó có thể tìm cách suy luận một tình huống kết hợp các yếu tố đó mà không cần được xem đúng một ví dụ hoàn chỉnh trước đó.
Đó cũng là cơ sở cho nhận định của Yu rằng việc chỉ tiếp tục tăng dữ liệu VLA hoặc số lượng bản trình diễn có thể đem lại lợi ích giảm dần trong các bài toán trí tuệ vật lý. Dữ liệu vẫn cần thiết, nhưng cách biểu diễn những gì học được có thể quan trọng không kém quy mô dữ liệu.
Về định hướng rộng, mô hình của Awomo thuộc cùng gia đình với JEPA của Yann LeCun: dự đoán một biểu diễn trong không gian tiềm ẩn thay vì cố gắng tái tạo từng pixel của quan sát. 1
Điểm khác biệt mà Awomo tự nhận nằm ở câu hỏi: “Trong không gian tiềm ẩn có những gì?”. Theo Yu, JEPA để ngỏ phần này, còn mô hình thế giới khái niệm chủ động tìm cách xây dựng một “từ vựng” gồm các khái niệm vật lý có thể kết hợp với nhau. 1
9
Tuy nhiên, đây vẫn là một giả thuyết nghiên cứu và tuyên bố kiến trúc của Awomo, chưa phải lợi thế đã được xác lập độc lập qua các đánh giá công khai.
Awomo cho biết các thử nghiệm nội bộ trong năm 2025 cho thấy cơ chế phân rã và liên kết khái niệm giúp cải thiện tỷ lệ thành công ở các nhiệm vụ phức tạp so với các đường cơ sở dựa trên học bắt chước và học tăng cường, đồng thời giảm chi phí dự đoán. 1
Nhưng các thông tin công khai hiện có chưa cung cấp đầy đủ:
Vì vậy, quy mô chính xác của lợi thế mà Awomo tuyên bố hiện chưa được bằng chứng công khai chứng minh đầy đủ. 1
Ví dụ thường được dùng để giải thích trực giác của hướng tiếp cận này là một tác nhân vừa phải bắt chiếc cốc đang rơi vừa đóng cửa. Theo lập luận của Yu, bài toán không chỉ là nhận dạng một mẫu hành động quen thuộc, mà phải đồng thời theo dõi nhiều thay đổi trạng thái và các ràng buộc nhân quả giữa chúng. Đây là ví dụ minh họa cho mục tiêu nghiên cứu, không phải kết quả benchmark đã được xác minh. 1
Nghiên cứu được thương mại hóa dưới tên Westlake Digital Intelligence Technology (Hangzhou) Co., Ltd., thương hiệu Awomo. Công ty được đăng ký tại quận Tây Hồ, Hàng Châu, ngày 8 tháng 1 năm 2026. Awomo cho biết họ tập trung vào Physical AI, hay trí tuệ nhân tạo cho thế giới vật lý, với các lĩnh vực gồm xe tự hành, robot, thiết bị công nghiệp, phần cứng thông minh và tạo dữ liệu mô phỏng. 5
11
Hạt nhân ban đầu được mô tả gồm Yu và giám đốc khoa học Tong, sau đó mở rộng từ đội ngũ AutoLab tại Đại học Tây Hồ. Cụm từ mô tả các thành viên là những “thiên tài nhỏ liên tục tự chứng minh năng lực” mang tính quảng bá, không phải một thước đo nhân sự có thể kiểm chứng độc lập. 1
9
Awomo đã công bố tổng số vốn huy động qua các vòng hạt giống và thiên thần vượt 100 triệu nhân dân tệ. Các nhà đầu tư được nêu tên gồm InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund và Jinma Investment. 6
13
Các bài viết tháng 8 năm 2026 giới thiệu Awomo-v0.1 như phiên bản công khai đầu tiên của hướng mô hình thế giới khái niệm, đồng thời đề cập việc đánh giá trên RoboTwin 2.0. Đây là một khung mô phỏng và benchmark phục vụ tạo dữ liệu cũng như đánh giá thao tác robot hai tay trong nhiều điều kiện khác nhau. 1
3
Việc xuất hiện trên một benchmark công khai giúp hướng nghiên cứu có địa điểm để được kiểm tra, nhưng tự nó chưa chứng minh khả năng tổng quát trên robot thật, mức độ an toàn hay ưu thế trước các phương pháp hàng đầu. Để đánh giá chắc chắn hơn, cần có điểm số benchmark được công bố, các đường cơ sở chuẩn hóa, mô tả thí nghiệm đầy đủ và kết quả chuyển giao từ mô phỏng sang thế giới thực.
Hành trình của Yu vì thế không đơn giản là từ bỏ dữ liệu để chọn lý thuyết. Từ AutoML, cảm nhận đa cảm biến và các hệ thống lái xe tự hành, ông đi đến câu hỏi nền tảng hơn: AI cần dự đoán điều gì để có thể hành động đáng tin cậy trong thế giới vật lý?
Câu trả lời đang được Awomo thử nghiệm là không dự đoán toàn bộ hình ảnh, mà xây dựng một không gian các khái niệm vật lý có thể phân rã, kết hợp và dùng để suy luận về hậu quả của hành động. Ý tưởng này có thể giúp giảm chi phí dự đoán và tăng khả năng xử lý những tổ hợp chưa từng thấy, nhưng bằng chứng công khai vẫn còn ở giai đoạn đầu. Thành công cuối cùng sẽ phụ thuộc vào việc mô hình có thể vượt qua khoảng cách từ biểu diễn tiềm ẩn và mô phỏng sang robot, phương tiện và thiết bị hoạt động trong thế giới thật hay không.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Yu Kaicheng từng nghiên cứu AutoML, gia nhập Alibaba DAMO Academy qua chương trình Alibaba Star và tham gia phát triển BEVFusion, phương pháp hợp nhất dữ liệu camera và LiDAR trong cùng một biểu diễn góc nhìn từ trên...
Yu Kaicheng từng nghiên cứu AutoML, gia nhập Alibaba DAMO Academy qua chương trình Alibaba Star và tham gia phát triển BEVFusion, phương pháp hợp nhất dữ liệu camera và LiDAR trong cùng một biểu diễn góc nhìn từ trên... Sau khi xây dựng AutoLab tại Đại học Tây Hồ năm 2023 và thử nghiệm mô hình thế giới sinh ảnh, ông cho rằng việc dựng lại từng pixel có thể là một khâu trung gian tốn kém nếu mục tiêu cuối cùng là dự đoán hậu quả của h...
Cuối năm 2024, nhóm chuyển sang mô hình thế giới khái niệm: một không gian tiềm ẩn có cấu trúc, biểu diễn vật thể, trạng thái, quan hệ không gian, hành động và thay đổi nhân quả.