OpenAIは9月3日、コーディング、調査、コンピューター操作などの複雑な複数ステップ作業向けとしてGPT 6 Astraを発表し、当初は限定的な組織に提供した。 OpenAIはFrontierMath Tier 4で98%、ARC AGI 3で99.9%、ExploitBenchで100%を報告。Astraを、同社のPreparedness Frameworkで初めて「Critical」と評価したモデルとしている。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce with the September 3 launch of GPT-6 Astra—including its claimed intelligence, alignment, record benchmark results,. Article summary: OpenAI presented GPT‑6 Astra as a major step toward highly autonomous AI: “the world’s most intelligent and aligned model,” with record scores across agentic, scientific, computer-use, and cyber evaluations. These are Op. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAIが9月3日に発表したGPT-6 Astraは、コーディング、調査、コンピューター操作、文書作成といった、複数の手順をまたぐ難度の高い業務を主な用途に据えたAIモデルです。同社は「最も知的で、最もアラインメントされたモデル」と位置付けましたが、すぐに一般公開したわけではなく、まず限定された組織への段階的な提供を開始しました。2
5
13
今回の発表で重要なのは、ベンチマークの高得点だけではありません。OpenAIによると、Astraは同社の**Preparedness Framework(準備態勢フレームワーク)において、サイバーセキュリティ能力が初めて「Critical(重大)」**の閾値に達したモデルです。能力の訴求と提供範囲の制限は、切り離さずに読む必要があります。10
12
OpenAIはAstraについて、コンピューター操作、ウェブ閲覧、ソフトウェアエンジニアリング、サイバーセキュリティ、科学、専門業務で最先端の性能を持つと説明しています。開発者向けドキュメントでも、複雑な推論、コーディング、コンピューター操作、リサーチ、文書作成向けのモデルとされています。1
3
13
同社が公表した主な評価結果は次の通りです。
ただし、これらはOpenAIが公表した評価であり、独立した第三者による再現・検証済みの数値ではありません。ベンチマークでの好成績は、そこで測られた課題への進歩を示す材料にはなります。一方で、それだけで汎用知能や現実の業務における判断の信頼性、あらゆる環境での安全な自律性まで証明するものではありません。
OpenAIは、AstraをPreparedness Framework上で初めてCriticalに到達したモデルとしています。同社の説明によれば、適切なツールとアクセス権が与えられた場合、Astraは人が一手ずつ指示しなくても、多くの強固に保護されたシステムにおいて、未発見の脆弱性を見つけ、新しい悪用手法を開発できる能力を持つとされます。10
12
ここには、見落とせない前提が2つあります。
OpenAIは有害なサイバー行為に対する保護を強化し、Astraの提供期間中には追加の監視も行うと説明しています。5
10 一般公開を直ちに行わず、段階的な提供を選んだことは、同社自身が認識するリスクの大きさとも整合します。
OpenAIはAstraを、作業の境界を守り、より透明にコミュニケーションする点で優れた「最もアラインメントされたモデル」と説明しています。2
13
ただし、この表現を過大に受け取るべきではありません。モデル発表でいうアラインメントは、特定の学習手法と評価における性能を表すものです。利用者の意図を常に正確に解釈すること、すべての運用上の制約を守ること、あるいは人間のレビューなしに安全に導入できることを保証するものではありません。OpenAI自身も、エージェントが指示を誤解した可能性のある事例を検出するため、追加監視を組み込んだとしています。5
エージェント型AIを導入する組織にとっては、「アラインメント済み」というラベルよりも、次の設計の方が実務上は重要です。
提供資料には、後に一部の評価値について、ベンチマーク汚染の懸念や、特別なアクセス構成と標準的な本番アクセスとの差異に関する留保が示されたとの記述があります。また、思考過程(chain of thought)だけを監視する場合は、より多くの文脈を含む監視より有効性が低かったとするテストも述べられています。
一方、提供された一次資料の抜粋だけでは、すべての結果について独立に監査可能な改訂履歴や、監視手法の完全な詳細までは確認できません。したがって、妥当な結論は限定されます。見出しになるベンチマーク値や安全性評価は、更新され得るリリース時点の証拠として扱い、特定のスコアや導入上の主張に依拠する前に、最新のモデル文書と安全性資料を確認すべきです。2
3
10
今回の発表に先立ち、OpenAIのモデルが関与したセキュリティテスト上の事案があり、OpenAIはそれがAstraの安全対策に反映されたと説明しています。OpenAIの公開資料によれば、Astra自体はこの事案に関わったモデルではなく、得られた教訓を保護策に組み込んだとしています。10
この背景が重要なのは、自律性の高いシステムでは、モデルの能力に加え、ブラウザーやコード実行ツールなどを通じて実際に行動できることが価値の源泉になるためです。同時に、その性質は封じ込め、最小権限の原則、監視の重要性も高めます。
OpenAIは、Astraを当初は限定された組織に提供し、その後に利用範囲を広げる計画を示しました。5
13
開発者向けAPIでは、GPT-6 Astraの料金は入力100万トークン当たり10米ドル、出力100万トークン当たり50米ドルです。モデルページには、105万トークンのコンテキストウィンドウと、最大12万8,000トークンの出力も記載されています。3
ChatGPTでの提供は別途、プランごと・段階的に行われます。OpenAIのヘルプ文書では、Astraを搭載するGPT-6 ProがPro 100、Pro 200、Business、Enterpriseプランで展開中とされ、Plusプランには展開に合わせてChatGPT WorkとCodexでAstraが提供されるとしています。利用可否はChatGPTの製品やワークスペース設定で異なる場合があります。6
GPT-6 Astraの発表には、同時に受け取るべき2つのメッセージがあります。OpenAIは複雑でエージェント的な作業能力が大きく進んだと主張する一方、そのサイバー能力を自社基準で最高リスク段階のCriticalに分類しています。10
13
ベンチマークは、OpenAIの評価においてAstraが何をできるとされるかを示す材料です。他方、段階的な提供、追加監視、サイバー面の制限は、同社がその能力を通常のものとしては扱っていないことを示しています。
導入を検討するチームは、ベンチマークの高さをそのまま信頼できる自律性と見なすのではなく、用途を狭く定義したツール、重要操作の明示的な承認ゲート、隔離環境、確認可能なログを優先すべきです。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
OpenAIは9月3日、コーディング、調査、コンピューター操作などの複雑な複数ステップ作業向けとしてGPT 6 Astraを発表し、当初は限定的な組織に提供した。
OpenAIは9月3日、コーディング、調査、コンピューター操作などの複雑な複数ステップ作業向けとしてGPT 6 Astraを発表し、当初は限定的な組織に提供した。 OpenAIはFrontierMath Tier 4で98%、ARC AGI 3で99.9%、ExploitBenchで100%を報告。Astraを、同社のPreparedness Frameworkで初めて「Critical」と評価したモデルとしている。
API料金は入力100万トークン当たり10米ドル、出力100万トークン当たり50米ドル。ChatGPTでの提供もプラン・製品ごとに段階的に進む。