模型蒸餾的原理是這樣的: 不直接複製原始模型本身,而是透過公開API向強大的「教師」模型大量提問,收集其產出的問答對,再用這些資料來訓練一個更小、成本更低的「學生」模型。這個學生模型會學習模仿教師模型的推理能力與功能。在軍事應用上,這使得系統可以在本地硬體上部署,無需從頭建立頂尖模型所需的龐大運算基礎設施。
路透社與華府智庫「詹姆斯頓基金會」(Jamestown Foundation)合作審查的論文與專利顯示,蒸餾技術已被用於一系列國防相關AI系統:
一份來自解放軍96904部隊的論文,明確描述了蒸餾美國模型以建立「更小、更安全」的版本,使其適用於國防用途。另一份來自解放軍96941部隊(北京的一個軍事情報與網路戰單位)的論文,則描述使用OpenAI的GPT-3.5來處理敏感的軍用原始碼。一篇2024年來自解放軍國防科技大學的論文,則利用蒸餾技術縮小一個影像處理模型,以便部署在資源受限的軍用硬體上。
蒸餾技術的核心戰略優勢在於經濟性。從頭訓練一個頂尖AI模型需要數十億美元的成本,以及數年的研究、開發、龐大數據集和先進半導體晶片。透過蒸餾,中國研究人員幾乎可以繞過所有這些投資。
透過API查詢頂尖模型——創建虛假帳戶並使用代理網路規避速率限制——中國開發者能以極低的成本提取相同的能力。Anthropic的調查發現,有超過1,600萬次的互動是透過約24,000個針對Claude模型(鎖定其自主推理、工具使用與程式編寫能力)的詐欺帳戶產生的。其中,中國AI開發商MiniMax就獨自貢獻了超過1,300萬次互動。
這項證據引發了一系列不斷升級的指控與政策回應:
儘管蒸餾作為捷徑非常有效,但對於軍事應用而言,它存在內在的技術限制:
能力被盜取與安全性退化相結合,形成了一個危險的動態:
持續進行的蒸餾戰爭正在多個層面上加速美中在AI領域的脫鉤。更嚴格的先進晶片出口管制、更嚴格的API存取限制、對開發者帳戶的身分認證要求,以及潛在的金融制裁,都已擺上談判桌。
核心的戰略風險非常明確:蒸餾讓中國軍方能以極低的成本有效寄生美國的AI投資來發展國防應用,而這個過程本身固有的安全性退化,可能會產出更不受約束、更具危險性的軍事AI系統。