研究人員發現嘅漏洞係:呢啲加密區塊唔係綁定喺某個特定 session、用戶或者模型。成個供應商嘅系統用嘅係同一把全球加密金鑰 。所以,由一個對話 capture 返嚟嘅區塊,可以喺另一個對話入面重播。關鍵一步:將一個由安全措施好嚴緊嘅旗艦模型產生嘅區塊,餵俾同一供應商嘅一個弱雞兄弟模型(例如 Claude Haiku),呢個弱雞模型因為冇咁多拒絕機制,就會乖乖仔咁將區塊嘅內容照單全收咁輸出
。
呢個攻擊唔單止揭露咗旗艦模型嘅推理過程,仲為一個持續爭議提供咗新證據:究竟中國 AI 公司 Moonshot AI 嘅 Kimi K3 模型係咪透過「蒸餾」(即係抄襲)美國模型嘅推理步驟嚟訓練出嚟?
研究人員提取咗 Claude Opus 4.8 同 GPT-5.6 Sol 嘅推理步驟之後,同 Kimi K3 呢類開放權重模型嘅輸出做比對。結果發現,Kimi K3 嘅輸出顯示出一啲「異常機率現象」,同 Claude 同 GPT 嘅推理步驟模式高度吻合 。
呢個證據係間接嘅,唔係決定性嘅。獨立研究人員話,呢啲發現「提供咗一啲證據——雖然唔係確鑿證據——證明某啲中國模型可能係透過蒸餾美國模型嘅推理資訊嚟訓練」 。另一個引人遐想嘅發現:當 Kimi K3 被要求自我介紹嗰陣,佢最初話自己係 Anthropic 嘅「Claude」
。
Kimi K3 係 Moonshot AI 喺 2026 年 7 月 16 日發布嘅一個 2.8 萬億參數開放權重模型。佢喺幾個 benchmarks 上超越咗 Claude Opus 4.8,但唔係毫無爭議嘅領導者。根據獨立嘅「人工智能分析智能指數」(Artificial Analysis Intelligence Index),K3 得分係 57,比 Claude Fable 5 嘅 60 分同 GPT-5.6 Sol 嘅 59 分都要低。Moonshot 自己都坦承,K3 整體上仍然落後於 GPT-5.6 Sol 同 Claude Fable 5 。
蒸餾指控並唔係新鮮事——Anthropic 同 OpenAI 都曾經指控中國公司系統性地蒸餾佢哋嘅模型。一份對中國學術論文同專利嘅審查發現,中國軍事研究人員有使用 OpenAI 同 Anthropic 模型嘅輸出嚟訓練國內 AI 系統,用於國防用途 。
Kimi K3 嘅發布即刻引起爭議。喺 7 月 16 日發布後幾小時內,Anthropic 就指控 Moonshot 透過蒸餾 Claude 嚟建造 K3,呢個指控仲傳到去白宮,引發咗制裁嘅可能性 。
不過,批評蒸餾指控嘅人指出咗一個時間問題。Claude Opus 4.8 只係喺 Kimi K3 發布前好短時間先推出。獨立研究人員話,呢個時間線令直接抄襲「難以置信」,因為根本冇足夠時間用一個啱啱先發布嘅模型嚟蒸餾出一個 2.8 萬億參數嘅模型 。Moonshot 就話 K3 係建基於獨立研究
。
同一架構缺陷仲暴露咗一個實際嘅安全漏洞。因為旗艦模型有時會將憑證同個人資料納入佢哋嘅推理過程,所以開發人員公開分享嘅加密推理區塊——例如喺智能體 session 日誌入面——其實包含咗敏感資訊,任何知道呢個技巧嘅人都可以讀到。
研究人員掃描咗大約 7,000 個喺 2026 年 8 月之前發布嘅公開智能體 session 日誌,喺加密區塊入面發現咗 62 個有效 API Key、33 個密碼同其他敏感用戶資料——總共 704 項私隱資料 。任何發布咗原始智能體日誌嘅開發人員,都可能喺唔知情嘅情況下,將 API Key、密碼同個人身份資訊洩漏咗出街,而佢哋原本以為冇人可以睇到呢啲加密區塊
。呢啲日誌包括儲存咗喺公開 GitHub 倉庫嘅 。
研究團隊向 OpenAI、Anthropic、Google、Microsoft 同 Hugging Face 披露咗佢哋嘅發現。供應商實施咗更改之後,可重複性檢查證實,主要嘅提取技巧已經唔能夠再喺當前嘅 API 版本上成功執行 。文件而家建議開發人員喺分享日誌或者喺對話中途切換模型之前,先剝離推理區塊
。
值得留意嘅係,密碼學研究人員 Matthew Green 喺 2026 年 5 月曾經分別向 OpenAI 同 Anthropic 嘅 bug bounty 計劃報告過跨 session 重播嘅漏洞,但喺呢篇學術論文發表前,佢收到嘅係唔睬唔理嘅回覆 。
呢啲修補程式喺 2026 年 8 月已經生效,但已經從公開網絡抓取嘅、包含已解碼推理區塊嘅歷史 session 日誌,仍然可以俾人存取 。
呢次「偷心」攻擊揭示咗現代 AI API 設計入面一個基本矛盾。供應商想將推理狀態卸載到客戶端,以換取可擴展性同低延遲,但要安全噉跨 session、跨用戶、跨模型綁定呢個狀態,就需要好小心嘅設計。Anthropic、OpenAI 同 Google 採用嘅單一全球加密金鑰方法,係一個捷徑,結果製造咗一個影響每一個同呢啲 API 互動嘅用戶同開發人員嘅安全同私隱漏洞。
呢次攻擊亦恰逢中美之間關於 AI 蒸餾嘅衝突不斷升級。雖然關於 Kimi K3 嘅證據係間接嘅,但佢提供咗目前為止最強嘅技術證據,顯示蒸餾可能正在大規模進行,並且為政策制定者同研究人員提供咗一個新工具,用嚟調查 AI 模型嘅來源。
【資料來源】