中國於 2026 年 7 月 17 日公布首批 AI 終端測試結果,共有 11 部流動裝置達到 L3,包括 9 部智能電話及 2 部平板電腦。 L3 是現時有明確能力要求及測試方法的最高級別,但標準同時列出未完全定義的 L4「協同級」。 L3 評估的是特定產品連同其軟件、權限及雲端協作配置,不代表整個品牌或所有版本都具備相同能力。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is China’s MIIT national AI-terminal intelligence grading standard, what does the first July 2026 batch of 11 certified devices—includi. Article summary: China’s AI-terminal grading system is a voluntary capability benchmark, not a phone-approval regime. The July 2026 L3 results show that some specific devices can act as bounded, user-supervised agents—not that they are a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
中國首批 AI 終端智能化分級測試結果,最容易令人誤會的地方,就是把手機的 L3 與汽車的「L3 自動駕駛」混為一談。
其實,這套制度更接近一把評估整部裝置 AI 能力的尺,而不是「手機可以無人看管地自己做事」的自動駕駛級別。2026 年 7 月 17 日公布的首批結果,列出 11 部達到 L3 的流動終端,包括 9 部智能電話及 2 部平板電腦。這證明的是:指定的產品及軟硬件配置,在受規範的測試條件下,可以提供有界限、由用戶監督的智能協助;並不代表它們可以在所有應用程式及服務中完全自主運作。2
5
相關框架名為 GB/Z 177—2026《人工智能終端智能化分級》。當中的「GB/Z」代表國家標準化指導性技術文件,作用是提供一套共同的能力評估方法,而不是手機上市前必須取得的強制性准入認證。1
5
6
它評估的不是單一語言模型有幾大、聊天有幾自然,而是整個終端系統,包括:
標準將能力分為五個主要維度:
五大維度之下,再細分為 14 項子能力,例如用戶感知、任務規劃、工具調用、短期及長期記憶,以及情境適應等。19
四個級別代表終端由簡單回應,逐步走向理解目標、安排工作及跨系統協作。目前 L1 至 L3 已有較具體的能力要求,L4 雖然已列入框架,但詳細要求及測試方法仍有待完善。5
21
25
| 級別 | 實際上代表甚麼? |
|---|---|
| L1・回應級 | 聽懂清晰指令,完成通常只有一步的簡單操作,例如開啟某項功能或設定提醒。 |
| L2・工具級 | 理解較簡單的意圖,進行有限推理,並沿用預設工具或工作流程完成受限制的多步任務。它較接近能力較強的聊天機械人或應用程式內置助手。 |
| L3・輔助級 | 理解較完整的目標,在資料不足時主動追問,將工作拆成步驟,選擇及編排不同工具,處理多模態互動,並運用短期及長期記憶。 |
| L4・協同級 | 目標是讓不同 AI 代理、裝置及服務互相協調,但詳細能力邊界及測試規則尚未完全確定。 |
所以,L3 的重點不是手機「像人一樣思考」,而是可以把理解、規劃、工具調用、記憶及實際操作串成一個較完整的任務流程。5
19
7 月公布的結果涵蓋 9 部來自華為、Motorola、榮耀、vivo、OPPO、小米及階躍星辰的智能電話,以及 2 部平板電腦。2
3
5
較準確的解讀是:這些提交測試的產品及相關軟硬件配置,符合現時 L3 的測試要求。結果並不代表:
首批測試是由廠商提交產品參與,而不是對市場上的手機進行隨機抽樣。因此,L3 是針對一款具體產品及其配置的評級,不是替整個品牌排名「智能段位」。5
6
把它簡稱為「國家 L3 認證」,可能會令人誤以為手機必須先取得 L3 才能在市場出售。實際上,GB/Z 177—2026 屬於指導性技術文件,L3 結果主要是行業能力基準及評估標準,並非手機上市所需的監管批准。1
6
同樣地,L3 也不是「無限自主權」的證明。測試的是終端在特定條件下能否提供複雜協助,而不是授予裝置任意讀取個人資料、登入帳戶、付款或操作所有第三方應用程式的權力。涉及金錢、敏感資料或不可逆決定時,用戶仍然是控制流程的一部分。5
19
換句話說,L3 是現時有完整、可測試要求的最高級別,但並不是整套框架所能想像的最高智能水平。L4「協同級」已經存在於分級架構之中,只是具體標準仍未完成。5
7
一部 L2 裝置可能可以回答「杭州今日天氣如何?」、搜尋資料,或者按預設流程產生一份行程建議。不過,整個對話及任務通常仍然局限於某條預先設定的工具路徑,記憶亦主要停留在目前對話之內。5
19
L3 裝置則是針對用戶背後的完整目標工作。例如用戶說:「幫我安排一個杭州週末行程。」它理論上可以:
最後一點尤其重要:L3 是受監督的委託,不是無限制的授權。 AI 可以替用戶準備操作,卻不應在涉及付款、敏感資料或不可逆承諾時自行作最後決定。5
L4 面對的難題,不只是模型夠不夠強,而是不同代理、裝置及服務之間如何安全地合作。要建立可重複、可驗證的 L4 測試,至少要回答以下問題:
這些關係牽涉的不只是技術,還包括權限、安全、審計及責任分配。在業界未能將它們整理成安全而一致的測試案例之前,L4 很難真正落實評級。5
7
因此,AI 手機下一步的關鍵,未必只是更快的晶片或更大的模型,也可能是跨裝置協作、權限管理、互通性及責任規則能否建立起來。5
7
兩套制度都使用 L1 至 L4,容易造成錯誤聯想。但汽車自動駕駛分級,主要描述動態駕駛工作由誰負責、由誰監察,以及何時需要人類接管;AI 終端分級則評估感知、意圖理解、推理、工具使用、記憶及學習等能力。5
所以,L3 AI 手機並不等同於可以在特定條件下自行駕駛的汽車。即使將來有 L4 手機,也不代表它可以在所有涉及金錢、個人資料或其他重大後果的情況下,完全不經用戶確認而安全行動。5
華為 Pura X Max,以及 Lenovo 旗下的 Motorola 產品,是首批 L3 結果中較受注意的例子。不過,L3 標籤不應成為唯一的購機理由。2
5
實際使用上的 Agent 能力,可能取決於作業系統更新、助手及模型是否可用、應用程式整合、權限設定,以及雲端連線。這意味着,部分 L3 式功能未必一定要購買新手機;新硬件或許可以改善速度、私隱或電池表現,但實際功能也可能透過系統及服務更新逐步加入。5
相反,擁有一部達到 L3 的型號,也不等於所有宣傳中的 AI 功能都能在每個應用程式、地區、帳戶或付款流程中穩定運作。評級針對的是提交測試的終端配置及指定能力,並不是對真實世界所有服務互通性的保證。5
買手機前,與其只問「有沒有 L3」,不如留意:
最值得記住的是:中國首批 L3 測試結果,反映 AI 手機正由「回答問題」走向「完成任務」,亦開始有一套較清晰的能力尺。但 L3 仍然只是針對特定配置的受監督協助基準,不是完全自主行為的保證,不是手機上市的強制門檻,也不是終端智能發展的終點。1
5
7
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
中國於 2026 年 7 月 17 日公布首批 AI 終端測試結果,共有 11 部流動裝置達到 L3,包括 9 部智能電話及 2 部平板電腦。
中國於 2026 年 7 月 17 日公布首批 AI 終端測試結果,共有 11 部流動裝置達到 L3,包括 9 部智能電話及 2 部平板電腦。 L3 是現時有明確能力要求及測試方法的最高級別,但標準同時列出未完全定義的 L4「協同級」。
L3 評估的是特定產品連同其軟件、權限及雲端協作配置,不代表整個品牌或所有版本都具備相同能力。