中國每日平均 AI token 呼叫量於 2026 年 3 月超過 140 萬億,較 2024 年初約 1,000 億大增逾 1,000 倍。 推理軟件優化成為最快增加有效產出的方法:簡單要求可交由較便宜或本土晶片處理,NVIDIA GPU 則留給複雜及高價值任務。
研究答案

Create a landscape editorial hero image for this Studio Global article: Why are Chinese AI companies optimizing inference software and stretching scarce Nvidia GPU capacity as AI shifts from model training to lar. Article summary: Chinese AI companies are shifting effort from training ever-larger models to serving huge volumes of real-time requests. They are optimizing inference software—such as scheduling workloads across mixed hardware, improvin. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
中國 AI 業界面對的問題,已經唔單止係「有冇足夠晶片」——更關鍵係,有冇足夠合適、穩定而且負擔得起嘅推理運算能力。
當 AI 助手、企業軟件同 AI 代理開始大規模部署,模型要處理嘅已不再係零星提問,而係源源不絕嘅即時請求。尤其係 AI 代理,往往要理解長篇上下文、呼叫工具、執行任務、檢查結果,再反覆修改答案。結果,AI 基礎設施嘅樽頸,正由「訓練模型」逐步轉向「服務用戶」。
模型訓練係建立模型能力;推理(inference)就係模型訓練完成後,實際為用戶生成答案嘅階段。
部分推理工作可以改用中國本土加速器處理,但兩者並非完全可以互換。對於要求高速度、大容量記憶體、穩定性及成熟軟件支援嘅工作,本土硬件仍然未必能夠完全取代高階 NVIDIA 處理器。
因此,中國 AI 公司要處理嘅係一個「混合硬件」問題:較簡單嘅推理可以交畀本土晶片,有限嘅高階 NVIDIA GPU 就要留畀最難替代嘅任務。業界報道指,複雜編程工作尤其造成壓力。
普通問答可能只需要模型即時產生一段簡短答案;但一個編程助手或者自主 AI 代理,可能要完成一連串步驟:保留長上下文、寫程式、使用外部工具、執行及檢查結果,之後再修正答案。
每一步都可能觸發新一輪模型運算。換句話講,公司真正關心嘅唔係手上有幾多張 GPU,而係每張 GPU 可以穩定完成幾多高質素工作。
如果本土處理器喺複雜編程及推理任務上表現較弱,將所有推理工作搬離 NVIDIA 硬件,可能會犧牲答案質素或者運作效率。企業於是要將稀缺嘅 NVIDIA 容量,優先分配畀最需要高性能嘅工作。
Token 通常被視為 AI 需求嘅基本計量單位,但每個 token 並唔代表同一種工作量或者同一種商業價值。
簡單聊天、分類或者低成本輸出,可以交畀較便宜嘅硬件處理。相反,由更強模型產生、涉及較長推理過程,或者需要多次工具呼叫嘅高質素 token,既更食運算,對客戶亦可能更有價值。
所以,單睇 token 總量,可能低估咗高端推理容量嘅短缺。市場可以一邊產生更多 token,一邊更加缺乏能夠為複雜任務提供可靠結果嘅高階硬件。近期業界投資高質素 token 產能,以及整合不同晶片架構嘅異構運算系統,正正反映呢個分別。
據中國國家數據局相關數據,2026 年 3 月中國每日平均 token 呼叫量超過 140 萬億;2024 年初約為 1,000 億,增幅超過 1,000 倍。
呢個數字反映 AI 使用模式已經變咗:模型由實驗、試用同單次提問,走向消費應用、企業軟件,以及可以執行現實工作流程嘅 AI 代理。推理因此唔再係訓練完成後嘅「附帶工序」,而係逐漸成為運算消耗嘅主要來源。
對 AI 公司嚟講,問題唔係需求會唔會出現,而係需求增長速度遠遠快過可用容量。
喺出口管制、高階 NVIDIA 產品供應有限,以及替換硬件生態成本高昂嘅情況下,短期內大幅增加頂級處理器並不容易。中國 AI 開發者亦要面對轉換成本:現有模型、工具同工作流程,已經深度依賴成熟嘅軟件平台,改用另一套晶片架構往往等於重建部分開發環境。
軟件優化唔可以憑空製造新晶片,但可以令每一張現有處理器產生更多有效產出。常見做法包括:
呢啲方法可以暫時拉近需求同供應之間嘅差距,但唔係前沿硬件嘅完整替代品。當高質素要求仍然集中喺少數處理器上,軟件始終只能延長有限資源嘅使用效率。
更棘手嘅係,推理服務價格正受到競爭壓力。Jefferies 分析師估計,中國模型平均每個 token 嘅成本,大約只有美國大型公司服務嘅六分之一。
低價有助推動用戶採用,卻同時限制咗企業可以用嚟支付高端運算嘅收入。另一方面,編程助手同 AI 代理比普通聊天更耗費資源。中國 AI 公司於是陷入一個兩難局面:需求急升、客戶期望低價使用,但最有能力處理高難度推理嘅運算容量,卻難以快速增加或者替代。
呢種矛盾已經反映喺服務供應上。有市場報道指,當需求超出可用運算資源,部分中國模型開發商同雲服務商需要降低服務速度、限制使用量,甚至加價;資源消耗較高嘅編程助手尤其受影響。
中國 AI 基礎設施嘅核心挑戰,並非簡單嘅晶片數量不足,而係缺乏一套完整組合:高性能處理器、兼容而成熟嘅軟件生態,以及可以用合理成本大規模提供高價值推理服務嘅系統。
隨住軟件改善,以及企業按照本土晶片嘅強項重新設計部署方式,本土硬件可以吸收更多工作。但就目前證據而言,業界仍處於過渡階段:一方面要盡量優化推理每一個環節,另一方面要將本土晶片用喺最適合嘅地方,再將有限 NVIDIA 容量留畀最難處理嘅任務。
呢種策略可以令現有資源捱耐啲,但如果 AI 代理持續擴張,中國最終仍要同時增加硬件供應,以及建立一個令不同處理器真正容易協作嘅軟件生態。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
中國每日平均 AI token 呼叫量於 2026 年 3 月超過 140 萬億,較 2024 年初約 1,000 億大增逾 1,000 倍。
中國每日平均 AI token 呼叫量於 2026 年 3 月超過 140 萬億,較 2024 年初約 1,000 億大增逾 1,000 倍。 推理軟件優化成為最快增加有效產出的方法:簡單要求可交由較便宜或本土晶片處理,NVIDIA GPU 則留給複雜及高價值任務。
高質素推理需要更多運算資源,但中國模型每個 token 的平均價格據估計約為美國同類服務的六分之一,企業因此面對成本與收入的雙重壓力。