科大訊飛(iFLYTEK)沒有打算靠國產算力,直接在「最大模型」競賽中硬撼採用 Nvidia GPU 的前沿實驗室。它選擇的路線,是將現有硬件的可用效率盡量推高,服務教育、醫療、汽車及企業等對私隱、部署控制和可靠性有實際要求的場景。
換句話說,iFLYTEK 賣的未必是最長的上下文窗口,而是能否穩定完成一項工作。
五倍差距,集中在超長上下文訓練
公司據報在 2026 年 8 月的業績會議上承認,當訓練上下文長度超過 256K tokens,國產加速器的效率可能較 Nvidia H200 低最多約 5 倍。不過,這個數字屬管理層披露,並非已由獨立人士根據一份公開的業績會議逐字稿核實。
8
這個差距對需要處理數十萬甚至上百萬 tokens 的大型訓練任務尤其重要,但並非所有實際應用都需要把整個超長歷史一次過放入模型的注意力窗口。
例如,學校系統可能只需搜尋課程內容及學生紀錄;臨床工具需要的是相關病歷和醫療知識;車載助手要掌握對話狀態和車輛資料;企業 AI 則通常只需連接指定的內部文件和工作流程。
在這些情況,系統可以用檢索、分段處理、結構化記憶,以及工具或智能體調用,將真正相關的資料交給模型。這樣做並不代表長上下文沒有價值,只是可以減少每次都使用最昂貴上下文窗口的需要。
因此,iFLYTEK 的取捨相當清楚:如果客戶更重視領域準確度、數據私隱、部署自主權、延遲及工作流程能否完成,而不是追求業界最長上下文,公司便不必在每一種訓練規模上都複製 Nvidia 的成本效益。
從模型到記憶體,全面做硬件—軟件協同
iFLYTEK 的應對方案不是單一軟件技巧,而是一套覆蓋整個 AI 技術棧的工程計劃,包括:
- 模型架構,例如混合專家(Mixture of Experts,MoE)方法;
- 為特定加速器設計的算子及 kernel;
- 分散式通訊和專家並行;
- 記憶體布局及 KV cache 管理;
- 訓練框架、調度系統及部署工具。
目標是減少通訊開銷、紓緩記憶體瓶頸、提高硬件使用率,並按照國產晶片的特性調整模型。原因在於,一張加速卡的規格,並不能單獨決定整個訓練或推理系統的表現。
按照 iFLYTEK 公開資料,公司的國產算力集群早期訓練效率只有行業主流集群約 30%;經過算子優化、分散式策略迭代及整體工程調校後,據報已提升至 84% 至 93%。這些數字是公司自行公布的表現,並非經獨立審核的基準測試。
17
Spark 系列,是這條路線最直接的驗證
目前最清晰的證據,是 iFLYTEK 並沒有把國產晶片只當作「訓練在外國、推理在本地」的替代品,而是持續在國產基礎設施上開發 Spark 模型系列。
Spark X2-Flash 被形容為一個擁有 300 億參數的 MoE 模型,並且完全在華為昇騰 910B 集群上完成訓練及部署。這代表一條由訓練、迭代到部署的端到端國產路線,而不只是模型完成後才移植到另一套硬件。
8
公司亦以長序列推理流程及 Spark X2,展示模型與基礎設施協同優化的方向。Spark X2-VL 就將同一模型系列延伸至多模態工作負載;iFLYTEK 公開資料則表示,X2、X2-Flash 及 X2-VL 均於 2026 年完成升級。
17
這個方向亦延續公司早期的國產算力工作。iFLYTEK 表示,Spark 模型一直採用涵蓋訓練、迭代及推理部署的全國產算力路線。
17 早前報道則提到,將每一代模型算法適配到國產晶片,需要超過六個月,才可令表現超過高端 Nvidia 晶片的 80%。
5
全國產旗艦模型,將測試策略能否擴大
iFLYTEK 在 2026 年 8 月 21 日的業績簡報會上宣布,會在今年的 Global 1024 Developer Festival 推出一款基於全國產算力的新一代通用旗艦模型。公告支持在活動前先行分階段發布,但未能確立問題所指的「8 月下旬」具體時間。
1
這款模型將成為重要測試:iFLYTEK 的方法能否由教育、醫療等較明確的專門場景,擴展至更廣泛的通用模型市場?如果發布順利,將顯示國產基礎設施可以支撐另一代大型模型;但單憑一次發布,仍不足以證明國產硬件在所有訓練工作負載上已追平 Nvidia。
由「賣 tokens」轉向「賣完成工作」
面對算力受限,公司大致有兩條路:直接參與前沿模型訓練的成本及規模競賽,或者將模型嵌入產品,令算力只成為整體價值的一部分。iFLYTEK 明顯偏向後者。
其模型組合瞄準教育及醫療等垂直領域。對這些場景來說,私有化部署、專業領域質素和運作可靠性,可能與通用 benchmark 分數同樣重要。公司資料指 Spark 支援教育及其他實際應用;醫療方面,iFLYTEK 亦公布以 Spark 醫療大模型為基礎的臨床決策支援系統。
17
35
這種產品導向亦令工程投資可以重複使用。更好的算子、通訊方式、記憶體處理及部署框架,可以沿用到下一代模型和不同客戶的安裝環境。由此產生的優勢,未必是絕對訓練成本已經更低,而是公司可以在受限硬件上榨出更多可用工作,同時掌握由訓練到部署的完整生命周期。
為何劉慶峰認為兩年內可能出現轉折?
這個判斷並非建立在「國產晶片已經等同 Nvidia」的假設上,而是基於累積的適配經驗。過去數年,iFLYTEK 持續將模型架構、分散式系統和軟件工具調整至國產基礎設施。當晶片、網絡、編譯器、框架及開發者生態逐步成熟,這些經驗或可縮短公司令新一代模型投入生產所需的時間。
在這個情境下,現時的劣勢反而可能變成組織上的優勢:iFLYTEK 會有較低的遷移成本、更多生產環境經驗,以及較成熟的國產部署技術棧。公司公開說法將這項工作形容為,建立一套由算力基礎設施延伸至模型應用、獨立而可控的完整系統。
3
17
但這仍然是可能性,而不是保證。關於中國 AI 硬件市場的報道仍然區分:國產晶片在推理方面進步較快,但在訓練,尤其是記憶體系統表現上,Nvidia 仍然具備優勢。
2
6
最大風險:前沿需求可能跑得更快
這套策略最適合的前提,是教育、醫療、汽車及企業客戶繼續將安全部署、領域準確度、延遲和工作流程結果放在無限上下文之前。
如果客戶日後普遍要求真正的百萬 tokens 訓練及推理,iFLYTEK 的方法就會面對更大壓力,因為這正是 H200 優勢最明顯的地方。
所以,核心問題不在於 iFLYTEK 能否消除每一項硬件差距,而在於它的工程能力和產品整合,能否令這個差距對足夠多高價值應用而言變得不再關鍵。Spark X2 系列、公司公布的效率提升,以及即將推出的全國產旗艦模型,都顯示 iFLYTEK 正朝這個方向下注;但超長上下文,仍然是最難繞過的考驗。