2026 年 7 月 17 日公布的首批人工智能终端测试结果显示,共有 11 款移动终端达到 L3,包括 9 款手机和 2 款平板。 L3 是目前已经明确能力要求并具备测试方法的最高等级,但并非整个体系的终点;标准还规划了尚待完善的 L4 协同级。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is China’s MIIT national AI-terminal intelligence grading standard, what does the first July 2026 batch of 11 certified devices—includi. Article summary: China’s AI-terminal grading system is a voluntary capability benchmark, not a phone-approval regime. The July 2026 L3 results show that some specific devices can act as bounded, user-supervised agents—not that they are a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
中国新推出的人工智能终端分级体系,最好理解为一把衡量“整台设备能做什么”的能力标尺,而不是手机版的“自动驾驶等级”。2026 年 7 月 17 日公布的首批结果中,11 款移动终端达到 L3,包括 9 款手机和 2 款平板。它们说明,部分经过送测的软硬件配置已经能够在用户监督下提供边界明确的复杂任务辅助;但这并不意味着这些设备可以在所有应用和服务中脱离监管自主行动。2
5
这套框架名为 GB/Z 177—2026《人工智能终端智能化分级》。“GB/Z”表示国家标准化指导性技术文件,因此它主要提供统一的能力评价方式,并不是手机上市前必须取得的强制性许可。1
5
6
它评测的是一个完整的终端系统,而不只是底层大模型的参数规模或聊天效果。评测范围包括模型、操作系统、应用与工具接口、记忆机制、权限管理,以及端侧计算和云端处理之间的协同方式。5
19
标准将终端能力归纳为五个维度:
这五大维度下又细分出 14 项子能力,包括用户感知、任务规划、工具调用、短期与长期记忆,以及情境适应等。19
四个等级代表终端从响应明确指令,逐步发展到理解目标、安排任务并协调多个系统的能力。目前 L1 至 L3 已有较明确的能力要求,L4 虽然已经被纳入框架,但具体要求和测试方法仍在完善。5
21
25
| 等级 | 实际表现 |
|---|---|
| L1 响应级 | 理解清晰、直接的指令,并完成通常只有一步的操作,例如打开某项功能或设置提醒。 |
| L2 工具级 | 理解较简单的意图,进行有限推理,并通过预设工具或流程完成受限的多步骤任务。它更像能力较强的聊天机器人或应用内助手,而不是开放式智能体。 |
| L3 辅助级 | 理解更完整的目标,在信息不足时主动追问,将任务拆解为多个步骤,动态选择和编排工具,支持多模态交互,并结合短期和长期记忆完成任务。 |
| L4 协同级 | 目标是让多个智能体、设备和服务彼此协作,但详细能力边界和测试规则尚未确定。 |
关键变化并不是“L3 手机像人一样思考”,而是设备能够把理解、规划、工具调用、记忆和执行连接成一条相对完整的任务流程。5
19
7 月公布的移动终端结果包括 9 款手机和 2 款平板。手机品牌涉及华为、摩托罗拉、荣耀、vivo、OPPO、小米和阶跃星辰等。2
3
5
最稳妥的结论是:这些被提交测试的具体产品及其相关软硬件配置,达到了当前 L3 测试要求。这个结果并不意味着:
首批测试来自厂商主动送测的产品,并非对整个市场进行随机抽样。因此,L3 更像是“具体产品与配置评级”,而不是品牌智能化排名。5
6
把它称作“国家 L3 认证”,容易让人误以为这是手机销售的监管门槛。由于 GB/Z 177—2026 属于指导性技术文件,L3 结果并不是手机上市前必须取得的行政许可,而是供行业使用的能力基准和评测结果。1
6
同时,L3 也不是对“无限自主权”的背书。它评估的是终端能否在规定条件下提供复杂任务辅助,并不意味着手机可以不受限制地访问个人数据、账户、支付工具或所有第三方应用。涉及金钱、敏感信息和不可逆操作时,用户仍应处于控制环节。5
19
一部 L2 手机或应用内助手,可能可以回答“杭州今天天气怎么样”,搜索资料,或者按照预设流程生成一份旅行建议。但任务通常停留在当前对话或有限的工具路径中。5
19
如果用户说“帮我规划一个杭州周末行程”,L3 手机理论上可以进一步:
最后一点是 L3 的边界所在:L3 是受监督的任务委托,不是无限制的代理权。 智能体可以准备操作,甚至完成部分流程,但当涉及支付、敏感数据或不可撤销承诺时,最终控制权应回到用户手中。5
L4 面临的难题不只是模型能力够不够强,更在于多个智能体、设备和服务之间如何安全地协作。要让 L4 具备可重复、可验证的测试方法,至少需要解决:
这些问题牵涉手机厂商、操作系统提供商、应用和服务商、模型提供商以及用户。只要跨平台协作、权限转移和责任归属还无法被写成稳定且安全的测试场景,L4 就很难真正落地认证。5
7
因此,AI 手机下一阶段的重要升级,未必只是更快的芯片或更大的模型,也可能取决于互操作性、权限管理、用户同意和责任规则能否建立起来。5
7
两套体系都使用 L1 至 L4,确实容易造成误解。但汽车自动驾驶分级关注的是动态驾驶任务由谁执行、由谁监控,以及什么时候必须由人类接管;人工智能终端分级关注的则是感知、意图理解、推理、工具调用、记忆和学习等任务能力。5
所以,L3 手机不等于具备条件自动驾驶能力的汽车。即使未来出现 L4 手机,也不能据此推断设备可以在所有涉及重大后果的场景中不经用户确认、自主做出安全决定。5
华为 Pura X Max,以及联想旗下的摩托罗拉设备,都是首批 L3 结果中常被提及的例子。2
5但购买手机时,L3 标签不应成为唯一依据。
智能体的实际表现可能取决于系统更新、助手和模型是否可用、应用接口、权限设置以及云端连接。换句话说,一些 L3 风格的实用功能未必需要购买新手机;新硬件可能在运行速度、隐私处理或续航方面带来改善,但并不自动意味着只有换机才能获得相关体验。5
在把 L3 标签当成购买理由之前,建议确认:
首批结果最清晰的信号是:AI 手机正在从“会聊天的设备”,走向可以被量化评估的任务执行系统。但 L3 仍然只是针对特定配置的受监督辅助能力基准——它不是无限自主行为的承诺,不是手机上市的强制准入证,也不是终端智能化的最终等级。1
5
7
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
2026 年 7 月 17 日公布的首批人工智能终端测试结果显示,共有 11 款移动终端达到 L3,包括 9 款手机和 2 款平板。
2026 年 7 月 17 日公布的首批人工智能终端测试结果显示,共有 11 款移动终端达到 L3,包括 9 款手机和 2 款平板。 L3 是目前已经明确能力要求并具备测试方法的最高等级,但并非整个体系的终点;标准还规划了尚待完善的 L4 协同级。
L3 代表在用户监督下完成复杂任务的能力,不等于手机可以绕过用户,自主处理付款、敏感数据或所有第三方应用。