科大讯飞并没有试图通过打造“最大模型”,去正面复制依赖英伟达算力的前沿实验室。面对国产算力约束,它采取的是另一种打法:让现有硬件足够高效地服务教育、医疗、汽车和企业客户,再把商业价值建立在可靠的任务完成和完整的产品交付上,而不是单纯比拼上下文长度。
这一路线的前提,是公司承认国产算力存在明显短板。据报道,在超过 256K token 的长上下文训练中,国产加速器的效率可能比英伟达 H200 低约 5 倍。不过,这一数字来自管理层披露,目前并非根据主要业绩电话会文字实录独立核验的结果。
8
用“够用的上下文”替代无限上下文
对多数生产环境而言,模型并不一定需要在同一个注意力窗口中持续处理数百万 token 的完整历史。
学校系统可能需要检索课程内容和学生记录;临床工具需要调用相关医学资料;车载助手需要保留对话状态并读取车辆数据;企业系统则需要访问限定范围内的内部文档和业务流程。对这些应用来说,更现实的方案是把信息检索、分段处理、结构化记忆以及工具或智能体调用结合起来,只把真正相关的内容送入模型。
这种方法并不会让长上下文能力失去价值,但可以减少最昂贵的超长上下文窗口被频繁调用的次数。科大讯飞的判断是:如果客户更看重领域准确性、数据隐私、部署自主权、响应延迟和工作流能否稳定完成,而不是基准测试中的最大上下文长度,那么公司就不必在所有训练规模上复制英伟达的经济效率,也有机会形成竞争力。
从模型到部署,整条 AI 技术栈一起优化
科大讯飞的应对并不是某一项孤立的软件技巧,而是一项覆盖硬件与软件协同设计的系统工程,涉及:
- 模型架构,包括混合专家(MoE)等方法;
- 针对特定加速器优化的算子和内核;
- 分布式通信与专家并行;
- 内存布局和 KV Cache 管理;
- 训练框架、任务调度和部署工具链。
这些工作旨在减少通信开销,缓解内存瓶颈,提高硬件利用率,并让模型适应国产芯片的具体特性。原因很简单:一块加速器的纸面参数,并不能决定完整训练或推理系统的实际表现。
科大讯飞在公开材料中称,其国产集群早期训练效率约为行业主流集群的 30%;通过持续进行算子优化、分布式策略迭代和全方位工程调优,这一比例已提升至 84%—93%。这些数字属于公司披露的性能数据,并非经过独立审计的基准测试结果。
17
讯飞星火 X2 系列是最直接的验证
这条路线最有说服力的证据,是科大讯飞持续在国产基础设施上开发讯飞星火模型,而不是把国产芯片仅当作训练完成后的推理替代方案。
据介绍,讯飞星火 X2-Flash 是一款拥有 300 亿参数的混合专家模型,完全基于华为昇腾 910B 集群训练并部署。它的意义在于,这展示的是从训练到部署的端到端国产化路径,而不只是先在其他硬件上训练、再将模型移植到国产平台。
8
公司还将长序列推理流水线和讯飞星火 X2 作为模型与基础设施协同优化的案例。讯飞星火 X2-VL 则把这一模型家族扩展到多模态任务。科大讯飞公开材料称,X2、X2-Flash 和 X2-VL 均在 2026 年完成升级。
17
更早的国产算力实践也指向同一方向。公司表示,讯飞星火模型已经走通覆盖训练、迭代和推理部署的全国产算力路线。
17 此前报道还提到,为了让每一代模型算法适配国产芯片,相关迭代往往需要超过 6 个月,才能达到高端英伟达芯片 80% 以上的性能。
5
国产旗舰模型将迎来下一场检验
在 2026 年 8 月 21 日的业绩说明会上,科大讯飞宣布,将在当年的全球 1024 开发者节发布一款基于完全国产算力的新一代通用旗舰模型。现有公告支持在活动前推出阶段性版本,但并不能完全证明问题中所说的“8 月下旬”这一精确时间点。
1
这款模型将检验科大讯飞的路线能否从专业化场景进一步扩展到更广泛的通用任务。若发布顺利,它可以说明国产基础设施能够支撑又一代重要模型;但单次发布本身,并不能证明国产硬件已经在所有训练负载上实现了英伟达级别的性能对等。
为什么这条路线有机会支撑“产品优先”的业务
算力受限的公司大致有两种选择:一是直接参与前沿模型训练的成本和规模竞争;二是把模型嵌入具体产品,在客户真正购买的解决方案中创造价值。科大讯飞显然更强调第二条路径。
公司的模型组合面向教育、医疗等垂直领域。在这些场景中,私有化部署、专业领域质量和系统稳定性,可能与通用基准分数同样重要。科大讯飞材料显示,讯飞星火已服务教育等应用场景;其医疗材料则介绍了由讯飞星火医疗大模型支持的临床决策支持系统。
17
35
产品优先还有一个重要好处:工程改进可以反复复用。更好的算子、通信方式、内存管理和部署框架,能够跨越不同模型代际和客户安装环境持续发挥作用。由此形成的优势不一定意味着绝对训练成本已经低于英伟达,而是意味着科大讯飞能够从受限硬件中提取更多可用产出,同时掌握从训练到部署的完整生命周期。
刘庆峰所说的“两年窗口”意味着什么
科大讯飞判断差距可能缩小,依据的不是国产芯片已经与英伟达完全等效,而是多年积累的适配经验。公司持续将模型架构、分布式系统和软件工具适配到国产基础设施。随着芯片、网络、编译器、训练框架和开发者生态逐步成熟,这些经验有望缩短新一代模型投入生产所需的时间。
在这种情形下,今天的劣势甚至可能转化为组织能力上的优势:科大讯飞拥有更低的迁移成本、更丰富的生产经验,以及较成熟的国产部署栈。公司公开表述将这一过程描述为,从计算基础设施到模型应用,持续建设自主、可控的全栈体系。
3
17
但这仍然是一条可能的路径,而不是确定性结论。关于中国 AI 芯片市场的报道仍区分了国产芯片在推理领域的进展,以及英伟达在训练领域的优势,尤其是在内存系统性能方面的差距。
2
6
最大风险:前沿需求可能跑得更快
科大讯飞的策略在以下前提下最有效:教育、医疗、汽车和企业客户持续优先考虑安全部署、领域准确性、响应延迟和工作流结果,而不是无限扩大的上下文窗口。
如果这些客户开始把真正的百万 token 训练和推理视为标准能力,那么这条路线的吸引力就会下降。问题的关键因此不是科大讯飞能否消除每一项硬件差距,而是它能否通过工程能力和产品整合,让这项差距对足够多的高价值应用变得“不再重要”。
讯飞星火 X2 系列、公司披露的效率提升,以及即将推出的国产旗舰模型,都表明科大讯飞正在朝这个目标推进;但在超长上下文训练方面,国产算力与 H200 之间的差距仍是最需要解决的挑战。