中國嘅 AI 挑戰,已經唔只係「實驗室可唔可以整出一個追得上美國頂尖系統嘅模型」。更關鍵嘅問題係:邊一方可以用最低成本,將夠實力嘅 AI 交到最多開發者、公司同政府手上。
DeepSeek、Moonshot AI 的 Kimi 同阿里巴巴 Qwen,令「開放權重」成為中美 AI 競賽嘅核心戰場。史丹福研究人員嘅評估顯示,中國開放權重模型喺能力同採用率方面,正迅速收窄差距,部分範疇甚至已經追平或超越海外對手。2025 年 9 月,Qwen 更超越 Meta 的 Llama,成為 Hugging Face 上下載量最高嘅大型語言模型系列。18
對華盛頓而言,呢個形勢帶來兩難:限制中國模型,或可減少敏感環境嘅曝光風險;但如果全面禁止,亦可能將開放開發呢一層拱手讓畀中國,並失去本地部署本身帶來嘅透明度同自主控制。
「開放權重」唔等於「完全開源」
開放權重模型,係指模型訓練完成後嘅參數可以下載,第三方可以自行運行、修改或者再訓練。相反,封閉模型通常只可以透過供應商控制嘅應用程式或 API 使用。33
不過,公開權重並唔代表以下資料一定公開:
- 原本嘅訓練程式碼
- 訓練數據及其來源
- 可重現嘅訓練方法
- 完整評測結果
- 不受限制嘅商業使用或再發佈權利
- 過濾、安全調整及模型開發過程嘅詳細資料
所以,「開放」一定要逐個版本、逐份授權條款去睇。一個模型可以畀人下載,但仍然難以重現、受嚴格授權限制,或者對訓練數據諱莫如深。較嚴格嘅「完全開源 AI」標準,要求使用者有實質途徑接觸程式碼、數據相關資料,以及其他研究和重現系統所需嘅元件。41
呢個分別對 DeepSeek、Kimi 同 Qwen 特別重要。三者每次發布嘅權重狀態、授權條款同技術披露都可能唔同,而公開報道亦未必能夠即時反映最新變化。
中國鬥緊嘅唔只係 benchmark,而係採用率
中國 AI 實驗室將相當有競爭力嘅表現,同低價、高效率及本地部署能力結合,令初創企業、研究人員同大型公司多咗一個選擇,唔需要完全依賴昂貴嘅美國託管 API。政策研究同報道形容,呢種模式會形成一個循環:低成本發布吸引使用者,使用者再製作工具同衍生模型,而整個生態圈又會推動下一輪改進。1720
影響唔只係有幾多人用某個聊天機械人。每一次部署,都可能帶來:
- 微調版本及專門用途模型
- 開發工具同軟件整合
- 新 benchmark 同錯誤回報
- 開發者對某個模型系列嘅熟悉程度
- 商業依賴同技術預設
史丹福分析發現,2024 年 8 月至 2025 年 8 月期間,中國開放模型開發者佔 Hugging Face 下載量 17.1%,略高於美國開發者嘅 15.8%。18 其他報道亦記錄到,面對成本上升,美國公司開始增加使用中國模型。31
如果中國模型逐漸嵌入世界各地嘅軟件、裝置、政府服務同工業系統,北京就可能透過技術預設、更新流程及周邊供應鏈取得影響力。呢個係潛在嘅地緣政治槓桿,並唔等於每一個本地部署嘅模型都已經被入侵或者做咗手腳。
所謂「中國 AI 風險」,其實要拆開幾部分
1. 託管服務會接觸到資料
如果使用者將提示內容、文件或者身份資料傳去中國託管嘅服務,資料就會離開自己嘅環境,並可能受服務供應商所在司法管轄區及適用法律規管。因此,政府、國防、醫療、關鍵基礎設施及企業機密等資料,唔應該未經正式風險評估就交畀任何外部服務。
本地部署可以改變呢一個特定嘅資料流向問題。配置得當嘅基礎設施,可以將提示內容同文件留喺機構內部網絡。不過,呢樣唔代表模型檔案、服務軟件或者連接嘅工具一定安全。
2. 審查、偏見同模型行為
模型嘅訓練及對齊方式,可能造成政治取向明顯嘅拒答、遺漏、表述角度或者錯誤資訊。美國國會一份報告指稱,DeepSeek 託管產品將美國使用者資料傳送到中國,並操控回應;但呢啲係國會調查嘅發現及指稱,唔等於已證明每一個可下載權重檔案都含有惡意程式。2
託管產品嘅表現,亦可能同本地運行嘅衍生版本唔一樣。外層應用、系統提示、審核層、檢索工具同更新機制,都可以改變模型最後輸出嘅內容。
3. 後門同供應鏈攻擊
理論上,下載嘅模型套件或者周邊軟件可能含有不安全載入程式、被污染嘅行為,甚至隱藏觸發條件。但模型源自邊個國家,本身唔係存在後門嘅證據。安全團隊應該核實來源、雜湊值同數碼簽署,檢查網絡行為、隔離元件,並測試完整部署堆疊。
4. 封閉模型亦有自身風險
封閉、專有模型同樣涉及集中化同問責問題。使用者通常無法檢查模型權重、訓練數據、隱藏提示、遙測資料、過濾規則或者更新流程。集中式 API 亦可能成為監控、服務中斷、入侵及單方面更改政策嘅高價值目標。
封閉模式可以方便供應商監察濫用、推出安全修正,亦可以阻止模型不受控地再發佈;但封閉唔代表模型天然可信。開放同封閉系統,只係涉及唔同類型嘅風險同控制方式。
點解本地部署係反對全面禁令嘅最強理由?
自行託管可以畀機構更大程度控制風險模型。安全團隊可以鎖定某個版本、驗證模型檔案、限制對外連線、掃描依賴套件、隔離服務、進行紅隊測試,並將敏感提示內容留喺內部基礎設施。公開權重亦方便獨立研究人員重現錯誤、調查偏見或者測試隱藏觸發條件。
但透明度唔係自動等於安全。大部分機構都無法完整審計超大型模型學到嘅行為;微調可能引入新漏洞,而隔離網絡只有喺整個服務堆疊配置正確時,先可以真正阻止資料外流。
實際上,應該評估嘅係部署方式,而唔係模型身上貼咗咩標籤。一個中國託管 API、經審計嘅本地部署,以及未經驗證嘅第三方衍生模型,風險可以完全唔同。
模型蒸餾點解成為爭議中心?
蒸餾(distillation),係利用能力更強嘅「教師模型」所提供嘅資訊,訓練一個較細或者較新嘅「學生模型」。
- 黑盒蒸餾:透過 API 查詢,利用教師模型嘅可見輸出去訓練學生模型。獲得授權時,呢種方法可以係正當技術;但大量抽取可能違反服務條款、繞過安全措施,或者複製專有模型行為。
- 白盒蒸餾:使用權重、logits 或隱藏狀態等內部資料。呢種方法傳遞能力嘅效率可以更高,但通常需要獲授權接觸模型內部資料;未經授權取得,就會引起更直接嘅保安及商業秘密問題。
OpenAI 同 Anthropic 曾指控包括 DeepSeek 在內嘅中國公司,利用模型輸出訓練新模型。美中經濟與安全審查委員會描述過涉及虛假帳戶、代理服務及協調式抽取嘅指稱;路透社亦報道 OpenAI 指 DeepSeek 試圖「搭便車」利用美國前沿模型能力。相關內容目前仍然係指稱,唔係法院或其他裁決程序已確立嘅事實。35
政策難題在於,黑盒抽取喺技術上可能同合法嘅高用量服務難以區分;而要公開證明,往往又要披露敏感調查證據。因此,唔應該將所有蒸餾一概定義為非法,因為獲授權蒸餾本身係標準技術方法。
對矽谷同華盛頓有咩意思?
中國開放權重模型,正對美國以昂貴專有 API 為核心嘅商業模式施加壓力。美國公司要重新考慮:繼續封閉權重係咪可以守住技術優勢,抑或反而畀中國及其他競爭者搶走開發者、軟件整合同全球分發渠道。
Qwen 下載量超越 Llama,係開放模型競賽重要性嘅一個具體訊號。18 不過,現有資料未足以證實 Nvidia 或 Meta 針對 DeepSeek V4 Pro 或 Kimi K3 作出過某項特定、最新回應。涉及個別公司反應嘅說法,應該以有日期嘅第一手聲明為依據,而唔係由整體市場變化推斷。
華盛頓正加強審查。美國眾議院委員會宣布,就採用中國開發模型所涉及嘅國家安全及網絡安全風險展開聯合調查,範圍包括 DeepSeek、阿里巴巴及 Moonshot AI 等公司提供嘅低成本開放權重及 API 系統。14
有報道提到美國正討論限制措施,但現有證據未能證實美國已經對中國開放權重模型實施全面商業禁令。912
唔一定得「全部禁」或者「乜都唔做」
較有針對性嘅框架,可以包括以下幾方面:
- 管制高風險用途:國防、情報、關鍵基礎設施、敏感政府系統,以及處理高影響資料嘅環境,應要求授權,或者禁止使用未經審查嘅模型。
- 訂立安全部署要求:敏感環境應要求來源紀錄、已簽署套件、軟件物料清單、獨立測試、紅隊結果及網絡隔離能力。
- 分開處理託管服務同本地權重:中國託管 API 帶來嘅資料存取風險,唔等同經獨立審計、喺本地運行嘅模型檔案。
- 打擊未經授權抽取:改善帳戶驗證、查詢速率監察、濫用偵測、來源追蹤及合約執法,但唔好將所有蒸餾都定性為盜竊。
- 採取針對性出口及投資限制:集中處理先進晶片、製造設備、雲端運算存取,以及有可信證據涉及軍事或情報用途嘅實體;同時要承認,過度廣泛嘅限制可能加快中國建立替代供應鏈。10
- 建立美國及盟友嘅開放模型生態圈:投資安全、文件齊全、支援多語言評測、運算效率高嘅模型,以及本地部署工具。要真正回應中國嘅採用策略,單靠限制使用者選擇並唔夠,仲要提供有競爭力嘅替代方案。
總結:美中 AI 競賽,鬥緊係誰能夠普及
中國開放權重模型正在改變 AI 競賽,因為佢哋令有能力嘅系統更平、更易客製化,模型一旦發布亦更難遏制。佢哋嘅戰略價值,唔只在於模型質素,更在於可以建立幾大嘅開發者同部署生態圈。
託管服務、敏感資料、供應鏈完整性,以及未經授權蒸餾嘅指稱,都係嚴肅問題。但模型來源地本身唔足以判斷部署是否安全;同樣地,美國封閉模型亦唔會因為權重唔公開,就自然變成零風險。
較站得住腳嘅做法,應該係以風險為本:保護供應鏈、限制敏感用途、調查有可信證據支持嘅模型竊取指控,同時建立一個足以喺「分發能力」同「模型表現」兩方面競爭嘅美國及盟友開放模型生態圈。