競爭格局相當細膩,且有多個獨立來源的一致證據支持。
K3 勝過 GPT-5.5 與 Claude Opus 4.8。 在綜合基準測試中,Kimi K3 得分約為 80.96,遠高於 GPT-5.5 的約 73.51,在 9 個基準類別中贏得 7 個 。南華早報(SCMP)與 CNBC 皆報導 K3「持續優於」GPT-5.5
。此外,K3 也在多項基準測試中擊敗了 Anthropic 的中階旗艦模型 Claude Opus 4.8
。
K3 仍落後於真正的頂尖模型。 在整體綜合智慧指數上,K3 仍落後於 Anthropic 的 Claude Fable 5 與 OpenAI 的 GPT-5.6 Sol。根據 Artificial Analysis Intelligence Index,Claude Fable 5 得分 60,GPT-5.6 Sol 得分 59,而 Kimi K3 得分為 57.1 。Moonshot 官方也承認了這個差距
。
K3 在代理式編碼基準上表現卓越。 這是 K3 真正發光發熱的領域。它在 6 個真實世界的代理式編碼基準測試中,直接奪下 5 個冠軍,並在前端編碼的 Arena 基準測試中,以優於 Fable 5 的成績拿下第一 。在 Design Arena 中,K3 獲得 1,679 分,高於 Fable 5 的 1,631 分與 GPT-5.6 Sol 的 1,618 分
。
K3 價格遠低於對手。 每項任務的推論成本,比 GPT-5.5 或 Claude Opus 4.8 低了約 50% 至 65%,這使得 K3 對於執行代理任務的開發者來說,堪稱「2026 年的性價比之王」。
2026 年 2 月,Anthropic 正式指控 DeepSeek、Moonshot AI 與 MiniMax 使用「蒸餾」(distillation)技術,非法從其 Claude 模型中提取能力 。根據 Anthropic 的說法,這三家中國實驗室涉嫌設立超過 24,000 個詐欺帳戶,並與 Claude 進行了超過 1,600 萬次的對話,以竊取訓練資料
。其中,Moonshot AI 單獨進行了超過 340 萬次的對話,專門針對 Claude 的代理推理、工具使用和編碼能力
。
2026 年 6 月,Anthropic 又另外指控 Moonshot 的投資者之一——阿里巴巴,進行了類似的「明目張膽」且「非法」的提取行動,並在致美國參議院銀行委員會的信中,稱其涉及 25,000 個假帳戶與 2,880 萬次對話 。
Moonshot AI 目前尚未公開承認有任何不當行為;這些指控仍有待釐清。
Moonshot AI 的財務成長軌跡令人咋舌。2024 年 12 月,該公司估值約為 43 億美元 。到了 2026 年 5 月,它在一輪由美團旗下創投公司領投的融資中,籌集了約 20 億美元,使公司估值超過 200 億美元
。緊接著在 2026 年 6 月,它又開始尋求新一輪以 300 億美元估值的融資
。就在 Kimi K3 發布後短短幾週,彭博社報導 Moonshot 正準備於 8 月開始討論最後一輪的 IPO 前融資,估值高達 500 億美元
。香港 IPO 正在積極考慮中;該公司早在 2026 年 3 月就已與中金公司和高盛進行過相關討論
。由於需求極其強勁,Moonshot 甚至因容量不足而暫時暫停新的 Kimi 訂閱服務
。
現有的搜尋結果中,並未發現有任何經核實的報導,能支持 Moonshot AI 宣稱 K3 在「極少人為監督」下運作的說法。這似乎是一個未經證實的元素——在現有資料中,沒有足夠證據可對此類說法進行確認或描述。
此外,雖然有關川普政府對中國 AI 實施出口管制的大背景在公開報導中已相當明確,但本次搜尋結果中,並未發現有最新的來源能證實,川普政府目前是否正積極考慮將特定的中國 AI 實驗室(包括 Moonshot)加入實體清單。