张一鸣给出了两个理由。首先,他认为蒸馏是一种'捷径',会损害真正的长期研究能力。字节跳动应该从第一性原理出发构建基础模型。其次,他承认这一立场可能导致字节跳动在短期内落后于国内竞争对手,如DeepSeek、月之暗面(Moonshot AI)和阿里巴巴的千问(Qwen),但他认为这是打造持久AI实力的必要代价。
要理解这一指令,离不开字节跳动多年来为维持TikTok在美国运营而进行的艰苦斗争。了解公司思路的人士表示,反蒸馏政策'部分受到字节跳动与美国政府在TikTok问题上复杂关系的影响'。
自2025年1月美国最高法院维持《保护美国人免受外国对手控制应用程序法案》以来,字节跳动一直面临美国的严密审查,该法案要求字节跳动剥离TikTok的美国业务,否则将面临禁令。公司最终于2026年初达成协议,将TikTok美国业务从全球业务中拆分。
通过公开放弃蒸馏——美国政府日益将这种做法定性为工业规模的知识产权盗窃——字节跳动可以将自己塑造成一个更合规的参与者,降低美国监管机构以AI模型盗窃为由对TikTok实施进一步限制或制裁的风险。
此举正值中美AI蒸馏之争达到顶峰之际。最引人注目的案例涉及总部位于北京的初创公司月之暗面(Moonshot AI)及其Kimi K3模型。
2026年6至7月,白宫科技政策办公室主任迈克尔·克拉齐奥斯(Michael Kratsios)指控月之暗面对Anthropic最先进的模型Fable进行了'大规模'蒸馏行动,以构建Kimi K3模型。用户很快发现Kimi K3与Anthropic和OpenAI最好的商业模型不相上下。美国财政部威胁要对中国AI公司涉嫌通过蒸馏窃取知识产权行为展开调查、实施制裁和贸易限制。
中国商务部回应称,美国的行为是'AI霸权主义',并警告将采取反制措施。
其他几家中国AI实验室,包括DeepSeek和MiniMax,也被广泛指控有类似行为。OpenAI向众议院中国问题特别委员会透露,DeepSeek员工开发了规避其访问限制并系统性地收集模型输出的方法。Anthropic披露,三家中国AI实验室——DeepSeek、月之暗面和MiniMax——使用了超过24,000个欺诈账户,与Claude进行了超过1,600万次交互。路透社的一篇报道强调了从技术上阻止此类行为的难度。
尽管公开立场强硬,但字节跳动的指令面临至少三大执行力挑战:
缺乏外部验证机制:该指令是一项内部、自我监督的承诺。字节跳动尚未宣布任何独立的审计系统、代码签名检查或第三方验证,以确认其模型是在没有使用蒸馏技术的情况下训练的。
技术检测难度:正如路透社在2025年1月指出的,在模型发布后检测蒸馏极为困难。'学生'模型的权重不一定留下可追溯到特定美国'教师'模型的取证特征。
竞争压力:字节跳动已经落后于DeepSeek和月之暗面等竞争对手。如果这些竞争对手继续快速发展——可能使用了蒸馏技术——字节跳动可能面临巨大的内部压力,要求悄然放宽这一政策。该政策是创始人的口头指令,而非具有约束力的法律合同,可以在没有公开通知的情况下被撤销。
目前尚无报道描述具体的内部管控措施——如API访问日志、训练数据审计或员工保密协议——这些措施将使禁令在实践中可靠执行。
字节跳动的无蒸馏承诺是一场引人注目的赌博。它使公司在美国监管机构眼中成为一个更具合作性的参与者,可能化解TikTok面临进一步制裁的一个主要风险。但这也可能使字节跳动在AI能力竞赛中落后,因为DeepSeek和月之暗面等中国竞争对手继续通过各种手段取得进展。
更广泛的中美AI冲突短期内不太可能缓和。随着美国威胁制裁、中国指责华盛顿推行'AI霸权主义',字节跳动的内部政策可能既是一种地缘政治生存策略,也是一种技术理念。
目前,关键问题仍然是:字节跳动能否让这一承诺真正落实?如果没有人能够真正验证,这又是否重要?