模型蒸馏的工作原理是这样的:研究人员并非直接复制模型本身,而是通过公共API向前沿的“教师”模型发送查询,收集其输出(问题和答案),然后利用这些问答对来训练一个更小、更便宜的“学生”模型。学生模型通过模仿教师模型的推理过程来学习其能力。对于军事应用而言,这使得可以在本地硬件上部署这些系统,而无需建设从零开始训练前沿AI模型所需的大规模计算基础设施。
路透社与总部位于华盛顿的詹姆斯敦基金会(Jamestown Foundation)合作审查的论文和专利显示,蒸馏技术被用于一系列防务相关的AI系统:
解放军96904部队的一篇论文明确描述了蒸馏美国模型,以创建适合国防应用的“更小且更安全”的版本。另一篇来自解放军96941部队(位于北京的一支军事情报与网络战单位)的论文描述了使用OpenAI的GPT-3.5处理敏感的军事源代码。国防科技大学在2024年发表的一篇论文描述了使用蒸馏技术来缩小一个图像处理模型,以便在资源受限的军事硬件上部署。
蒸馏技术的核心战略优势在于经济性。从零开始训练一个前沿AI模型需要花费数十亿美元,并且需要多年的研发、庞大的数据集以及先进的半导体芯片。蒸馏技术让中国研究人员几乎完全绕过了这些投入。
通过API查询前沿模型——创建虚假账户并使用代理网络来规避速率限制——中国开发者可以以极低的成本提取相同的功能。Anthropic的调查发现了大约24,000个欺诈账户针对Claude的智能推理、工具使用和编码能力产生了超过1600万次交互。仅中国AI开发者MiniMax就贡献了其中超过1300万次交互。
这些证据引发了一系列不断升级的指控和政策回应:
尽管作为捷径相当有效,但模型蒸馏存在内在的技术局限性,这对军事应用非常重要:
能力盗窃与安全退化的结合造成了一种危险的态势:
持续的蒸馏战正在多个维度上加速美中在AI领域的脱钩。更严格的先进芯片出口管制、更严格的API访问限制、开发者账户的KYC要求以及潜在的金融制裁都已摆上台面。
核心战略风险是明确的:蒸馏使中国军方能够以极低的成本寄生式利用美国的AI投资用于国防应用,而此过程中固有的安全退化可能会产生约束更少、危险性更高的军事AI系统。