Moonshot AI lập luận tiến bộ AI tiền tuyến cần mở rộng song song dung lượng mô hình trước triển khai và lượng tính toán dùng sau triển khai cho suy luận dài, gọi công cụ và tác vụ tác tử. Kimi K3 là mô hình MoE đa phương thức gốc với 2,78 nghìn tỷ tham số tổng cộng, nhưng chỉ kích hoạt 104,2 tỷ tham số cho mỗi token...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI đặt luận điểm trung tâm của Kimi K3 vào hai nguồn lực phải được mở rộng cùng lúc: dung lượng của mô hình trước khi triển khai và lượng tính toán tiêu thụ khi mô hình đang vận hành. Vế thứ hai bao gồm suy luận nhiều bước, lập kế hoạch, duyệt web, viết mã, gọi công cụ và tự sửa sai trong các lượt chạy kiểu tác tử.
Theo cách diễn giải này, chỉ huấn luyện một mô hình lớn hơn vẫn chưa đủ. Mô hình còn phải có kiến trúc và hạ tầng đủ hiệu quả để có thể khai thác năng lực đó trong những chuỗi tác vụ dài sau khi được đưa vào sử dụng. 1
Kimi K3 được báo cáo là mô hình Mixture-of-Experts (MoE) đa phương thức gốc, có 2,78 nghìn tỷ tham số tổng cộng nhưng chỉ kích hoạt 104,2 tỷ tham số trên mỗi token, với cửa sổ ngữ cảnh tới 1 triệu token. 1
Điểm then chốt của MoE là không phải toàn bộ tham số đều chạy cho mọi token. Vì vậy, K3 hướng tới việc lưu trữ năng lực ở quy mô rất lớn mà không phải trả chi phí suy luận tương ứng với một mô hình đặc 2,78 nghìn tỷ tham số cho từng token. Đây là nửa đầu của lập luận “mở rộng trước triển khai”. 1
Báo cáo nói K3 có thể ngoại suy tự nhiên tới 1 triệu token, thay vì 100.000 token. Mô hình ban đầu được huấn luyện ở độ dài 8K token, sau đó là 64K token. 1
Moonshot AI không sử dụng embedding vị trí tường minh; thay vào đó, họ lập luận rằng các cổng hồi quy và cơ chế suy giảm trong Kimi Delta Attention (KDA) đã mang đủ thông tin vị trí để mở rộng chiều dài ngữ cảnh mà không cần điều chỉnh RoPE. 1
KDA thay phần lớn attention bậc hai bằng một trạng thái hồi quy có kích thước cố định. Về nguyên tắc, điều này giúp trạng thái trên mỗi token và chi phí giải mã không tăng theo lượng ngữ cảnh quá khứ như một bộ nhớ đệm KV đầy đủ.
Kiến trúc của K3 xen kẽ ba lớp KDA với một lớp Gated MLA. KDA đảm nhiệm xử lý chuỗi bền bỉ với chi phí thấp, còn Gated MLA bổ sung khả năng truy xuất chọn lọc trên phạm vi toàn cục. 1
Giới hạn dưới áp lên tốc độ suy giảm của KDA không chỉ là một điều chỉnh về mô hình hóa. Báo cáo mô tả đây là biện pháp triển khai để tránh các giá trị suy giảm quá nhỏ gây vấn đề số học, đồng thời cho phép cách tính theo khối thân thiện hơn với tensor core. 1
K3 dùng Attention Residuals (AttnRes) để tránh việc một mạng rất sâu, vốn phần lớn dựa trên attention tuyến tính, bị cô lập thông tin giữa các tầng. Cơ chế này cho phép các lớp ở phía sau truy xuất biểu diễn đã được nén từ các khối độ sâu trước đó.
Nói cách khác, trong mạng 93 lớp, mọi thông tin hữu ích không bắt buộc phải đi tuần tự từng lớp một. Moonshot AI cho rằng đường truy xuất theo chiều sâu này giúp duy trì chất lượng trong khi thay phần lớn attention toàn cục đắt đỏ bằng KDA. 1
Thiết kế MoE của K3 có 896 expert và chọn top-16 expert cho mỗi token. Cách này tăng dung lượng có điều kiện: những phần khác nhau của đầu vào có thể được chuyển đến các expert khác nhau. 1
Phương pháp cân bằng theo phân vị của Stable LatentMoE xem việc định tuyến như một bài toán gán cân bằng và đưa ra nghiệm tối ưu chính xác dưới các giả định ở cấp lô dữ liệu. Tuy vậy, khi triển khai, bộ định tuyến dùng các độ lệch expert cố định cùng lựa chọn top-k thông thường, chứ không chạy bộ giải cân bằng ở thời điểm suy luận. 1
Vì thế, kết quả về “cân bằng hoàn hảo” nên được hiểu là kết quả trong bài toán tối ưu định tuyến đã nêu, không phải bảo đảm rằng mọi lô yêu cầu thực tế sẽ luôn cân bằng hoàn hảo.
MoonEP xử lý mặt vận hành của vấn đề. Một MoE lớn chỉ thật sự kinh tế nếu các token đã được định tuyến có thể đến expert được chọn mà không để độ trễ mạng hoặc các điểm nghẽn do nhu cầu expert không đều chi phối thời gian phản hồi. Vai trò của MoonEP là cân bằng truyền thông all-to-all đó để kiến trúc 896 expert có thể huấn luyện và phục vụ ở quy mô lớn. 1
Lập luận về “mở rộng sau triển khai” không chỉ nói đến việc bật chế độ suy luận lâu hơn. Báo cáo mô tả một cụm sandbox máy ảo nhẹ, cho phép tạo nhiều quỹ đạo học tăng cường (RL) dài hạn có thể kiểm chứng, cũng như phân nhánh hay tiếp tục tác vụ từ snapshot với chi phí thấp. 1
Đó là nền tảng huấn luyện cho các hành vi có thể tận dụng nhiều bước hơn ở thời điểm kiểm tra: lập kế hoạch, duyệt web, lập trình, dùng công cụ và tự hiệu chỉnh. Báo cáo cũng đề cập việc chưng cất nhiều mô hình giáo viên theo miền kiến thức và suy luận vào một hệ thống duy nhất, nhằm chuyển giao hành vi chuyên biệt mà không phải phục vụ đồng thời chín mô hình riêng rẽ. 1
Đây là điểm khác biệt quan trọng trong thông điệp của K3: năng lực không chỉ nằm cố định trong trọng số sau tiền huấn luyện, mà còn được “mở khóa” bằng lượng công việc mô hình có thể thực hiện khi giải một yêu cầu cụ thể.
Một bảng xếp hạng bên thứ ba ghi Kimi K3 đạt 91,2% trên BrowseComp, bài đánh giá hướng tới hành vi nghiên cứu web và tìm kiếm thông tin dài hạn; theo bảng này, GPT-5.6 Sol đạt 92,2% và Claude Opus 5 đạt 90,8%. 4
Nếu tái lập được, kết quả này sẽ ủng hộ nhận định rằng K3 mạnh ở các tác vụ tác tử tìm kiếm thông tin kéo dài. Tuy nhiên, một điểm benchmark đầu-cuối không thể tách riêng phần đóng góp của KDA, AttnRes, định tuyến MoE, môi trường RL, chưng cất hay lượng tính toán ở thời điểm suy luận. 4
Không có cơ sở được xác minh từ báo cáo kỹ thuật hoặc một nguồn độc lập có thẩm quyền cao cho các khẳng định chính xác như K3 “rẻ bằng một nửa GPT-5.6 Sol”, hay rẻ hơn theo một tỷ lệ cố định trong so sánh với các mô hình khác.
Một nguồn dẫn ước tính chi phí cho mỗi tác vụ hoàn thành vào khoảng 0,94 USD với K3 và 1,04 USD với GPT-5.6 Sol — chênh lệch này không gần mức 50%. 8 Giá và chi phí thực tế phụ thuộc cấu hình, prompt, lượng token, mức suy luận, ngày niêm yết giá và cách hạch toán hạ tầng. Các so sánh chỉ nên được coi là đáng tin khi công bố đầy đủ harness đánh giá cùng phương pháp tính chi phí.
Tóm lại, chiến lược Moonshot AI trình bày mang tính kiến trúc và hệ thống hơn là chỉ cạnh tranh giá. Kimi K3 lập luận rằng để vượt ngưỡng nghìn tỷ tham số và biến ngữ cảnh dài cùng suy luận tác tử thành năng lực sử dụng được, các mô hình mở cần đồng thời đổi mới ở thiết kế mô hình, cơ chế attention, định tuyến expert, truyền thông hệ thống và hạ tầng RL. 1
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Moonshot AI lập luận tiến bộ AI tiền tuyến cần mở rộng song song dung lượng mô hình trước triển khai và lượng tính toán dùng sau triển khai cho suy luận dài, gọi công cụ và tác vụ tác tử.
Moonshot AI lập luận tiến bộ AI tiền tuyến cần mở rộng song song dung lượng mô hình trước triển khai và lượng tính toán dùng sau triển khai cho suy luận dài, gọi công cụ và tác vụ tác tử. Kimi K3 là mô hình MoE đa phương thức gốc với 2,78 nghìn tỷ tham số tổng cộng, nhưng chỉ kích hoạt 104,2 tỷ tham số cho mỗi token; nhờ đó tăng dung lượng mà không phải chịu chi phí suy luận của mô hình đặc 2,78 nghìn...
Báo cáo nêu khả năng mở rộng ngữ cảnh tự nhiên đến 1 triệu token, với kiến trúc lai KDA và Gated MLA nhằm giảm chi phí xử lý chuỗi dài nhưng vẫn giữ khả năng truy xuất thông tin toàn cục.