2026年7月17日に公表された中国初のAI端末テストでは、スマートフォン9台とタブレット2台の計11台がL3と評価された。 L3は現時点で要件と試験方法が定義されている最高レベルだが、販売に必須の認証でも、端末が無制限に自律動作することの証明でもない。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is China’s MIIT national AI-terminal intelligence grading standard, what does the first July 2026 batch of 11 certified devices—includi. Article summary: China’s AI-terminal grading system is a voluntary capability benchmark, not a phone-approval regime. The July 2026 L3 results show that some specific devices can act as bounded, user-supervised agents—not that they are a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
中国で始まったAI端末の「L3」評価は、スマートフォンを自動運転車のように分類する制度ではない。モデル単体の性能ではなく、端末全体がユーザーの目的を理解し、作業を分解し、複数のツールを使って支援できるかを測る能力ベンチマークだ。
2026年7月17日に公表された第1弾の結果では、スマートフォン9台とタブレット2台、計11台のモバイル端末がL3に到達した。ここから読み取れるのは、試験に提出された特定のハードウェアとソフトウェアの構成が、ユーザーの確認を前提とした範囲限定の支援を実現できたということだ。あらゆるアプリやサービスで、端末が人間の監督なしに行動できるという意味ではない。2
5
基準の名称は、GB/Z 177—2026「人工知能端末智能化分級」(人工知能端末の知能化レベル分類)だ。「GB/Z」は国家標準化に関する指導性の技術文書を示す記号であり、スマートフォンを販売するために取得が義務づけられる強制認証ではない。業界共通の能力評価のものさし、と考えるのが正確だ。1
5
6
評価対象は、言語モデルの大きさや会話の自然さだけではない。端末上のモデル、OS、アプリやツールとの接続、メモリー、権限設定、端末側処理とクラウド処理の連携までを含めた「システム全体」が対象になる。5
19
評価は次の5つの能力軸で構成される。
さらに、ユーザー認識、タスク計画、ツール呼び出し、短期・長期記憶、状況適応など、14の下位能力に細分化されている。19
4段階は、明確な指示に反応するだけの端末から、複数のシステムをまたいで作業を調整する端末へ、能力が広がっていく流れを示している。現時点で具体的な要件が定められているのはL1〜L3で、L4は枠組みに名称があるものの、詳細な要件や試験方法は今後整備される予定だ。5
21
25
| レベル | 実際の意味 |
|---|---|
| L1:応答レベル | 明確な指示を理解し、カレンダーを開く、リマインダーを設定するといった単純な単発操作を実行する。 |
| L2:ツールレベル | より簡単な意図を理解し、限定的な推論を行い、あらかじめ用意されたツールや手順で複数段階の作業をこなす。高機能なチャットボットやアプリ内アシスタントに近い。 |
| L3:支援レベル | ユーザーの大きな目的を理解し、不足情報を質問し、作業を分解。状況に応じてツールを選び、連携させ、マルチモーダルなやり取りと短期・長期の記憶を使って支援する。 |
| L4:協同レベル | 複数のAIエージェント、端末、サービス間の連携を想定する。ただし、詳しい要件とテスト方法はまだ策定中だ。 |
重要なのは、L3端末が「人間のように考える」という話ではないことだ。知覚、意図理解、計画、ツール利用、記憶、実行を、ひとつの作業フローとしてつなげられる点に意味がある。5
19
7月の結果では、Huawei、Motorola、Honor、vivo、OPPO、Xiaomi、Stepfunに関連する9台のスマートフォンと、2台のタブレットがL3と評価された。2
3
5
ただし、結論はあくまで「提出された端末構成が、現在のL3試験要件を満たした」というところまでだ。次のような意味ではない。
第1弾は、市場にある端末を無作為に調べた結果ではなく、メーカーが提出した製品を対象にしたものだ。したがってL3は、ブランド全体の「賢さランキング」ではなく、特定の製品とソフトウェア・ハードウェア構成に対する評価と見るべきだ。5
6
ニュースやメーカーの宣伝で「中国の国家L3認証」と表現されると、販売許可のように受け取られやすい。しかしGB/Z 177—2026は指導性の技術文書であり、L3を取得しなければスマートフォンを販売できない、という制度ではない。能力を比較・評価するための業界基準だ。1
6
また、L3は理論上の最高レベルでもない。枠組みには、その上のL4「協同レベル」も明記されている。L3が「最高」とされる場合は、現在、要件と試験方法が定義され、公に評価できる最高レベルという意味に限って理解する必要がある。5
7
L3は、複雑な支援を定められた条件で行えるかを評価するもので、個人データ、アカウント、決済、すべてのサードパーティーアプリへの無制限アクセスを端末に与えるものではない。特に金銭や機微情報、取り消しにくい操作が関わる場合、ユーザーは引き続き確認者であり、最終的な意思決定者だ。5
19
L2相当のアシスタントなら、「杭州の天気は?」と質問して情報を検索したり、決められた手順で旅行プランを提案したりできる。通常は、現在の会話や限定されたツールの経路の中でタスクが完結する。5
19
一方、L3相当の端末は、より曖昧で大きな目的を受け取ることを想定している。たとえば「週末の杭州旅行を計画して」と頼んだ場合、次のような流れが考えられる。
この最後の境界が、L3を理解するうえで最も重要だ。L3は「監督付きの委任」であって、無制限の権限ではない。 AIが手続きを準備しても、決済や予約の最終権限はユーザーに戻る。5
L4の課題は、単にL3より高性能なモデルを作ることではない。複数のAIエージェント、端末、サービスを安全に連携させるためのルール作りが難しいのだ。
実用的なL4の評価には、少なくとも次の論点を整理する必要がある。
これらを安全で再現可能なテストケースに落とし込めるまでは、L4を意味のある形で認証するのは難しい。次の大きな進歩は、チップの高速化やモデルの大型化だけでなく、相互運用性、権限管理、責任分担のルールに左右される可能性が高い。5
7
L1〜L4という呼び方が共通しているため、AI端末のL3を自動運転のL3と同じものだと考えてしまいがちだ。しかし自動車の自動運転レベルは、走行中の動的な運転タスクを誰が担い、誰が監視し、どのタイミングで人間が引き継ぐのかを評価するものだ。
AI端末のL1〜L4は、知覚、意図理解、推論、ツール利用、記憶、学習、そして将来的な協同といった端末の能力を評価する。つまり、L3のスマートフォンは「条件付き自動運転車」と同等ではない。将来L4のスマートフォンが登場しても、あらゆる重大な判断を人間の確認なしに安全に任せられるという意味にはならない。5
第1弾の例としては、Huaweiの「Pura X Max」や、Lenovo傘下のMotorolaブランドの端末が挙げられる。2
5 ただし、L3の表示だけを購入理由にするのは早計だ。
実際に使えるエージェント機能は、OSの更新、アシスタントやモデルの提供状況、アプリ連携、権限設定、クラウド接続に左右される。新しいハードウェアは処理速度、プライバシー、バッテリー性能などで有利になる場合があるが、L3相当の便利な機能を使うために、必ずしも新しい端末を買う必要があるとは限らない。5
反対に、L3と評価されたモデルを持っていても、宣伝されているすべてのAIエージェント機能が、すべてのアプリ、サービス、地域、アカウント、決済フローで同じように動く保証はない。評価されるのは提出された端末構成と試験対象の能力であり、現実世界での全面的な互換性ではない。5
購入前には、次の点を確認したい。
今回の結果が示した最も明確な変化は、AIスマートフォンが「会話が上手いか」だけでなく、「目的を受け取り、作業を完了へ近づけられるシステムか」という観点で測られ始めたことだ。一方、L3は特定構成を対象とした監督付き支援のベンチマークであり、自律動作の全面的な保証でも、販売に必要な認可でも、端末知能の最終到達点でもない。1
5
7
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
2026年7月17日に公表された中国初のAI端末テストでは、スマートフォン9台とタブレット2台の計11台がL3と評価された。
2026年7月17日に公表された中国初のAI端末テストでは、スマートフォン9台とタブレット2台の計11台がL3と評価された。 L3は現時点で要件と試験方法が定義されている最高レベルだが、販売に必須の認証でも、端末が無制限に自律動作することの証明でもない。