OpenAIによると、GPT 6 AstraはGPT 5.6 Solより事実誤りが少なく、長期・複数ターンに及ぶ攻撃を含む脱獄とプロンプトインジェクションへの耐性が大幅に高い。 Gray SwanのIPI Arenaでは、13の先端モデル、41のエージェントシナリオ、27万2,000件超の攻撃試行を検証し、間接プロンプトインジェクションに完全耐性のモデルはなかったと報告された。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAIの自己評価によれば、GPT-6 AstraはGPT-5.6 Solから安全性を大きく引き上げたモデルだ。事実誤りが減り、プロンプトインジェクションへの耐性が高まり、長い攻撃手順を経る脱獄にもより強くなったとされる。25
30
ただし、ここで重要なのはモデル自体の改善と、実運用の安全性は同義ではないという点だ。Webページ、メール、文書、コードリポジトリ、ツール出力など、エージェントが読み込む外部コンテンツに悪意ある指示が埋め込まれていた場合、より高性能なモデルでもそれだけで安全とはいえない。Gray Swanの間接プロンプトインジェクション(IPI)検証では、テスト対象モデルのうち完全に免疫を持つものはなかった。4
OpenAIは、AstraがGPT-5.6 Solよりも脱獄に対して大幅に堅牢であり、特により長い攻撃軌跡でも強いと説明している。25
これは、一度の露骨な指示だけでなく、攻撃者が会話を何ターンも続け、前の文脈を利用しながら誘導を変えていくケースを想定した改善を意味する。研究、コーディング、ブラウジング、複数段階の作業を担うエージェントでは、こうした持続的・適応的な攻撃への耐性が重要になる。
OpenAIは、ブラウジングや職場での利用を想定した場面でも、Astraのプロンプトインジェクション耐性がSolより向上したと報告している。また、事実誤りも減ったとしている。25
30
もっとも、事実性の比較は読み方に注意が必要だ。報告された誤りの再現テストは、ユーザーがすでに「誤答」として報告した会話を主な対象にしており、日常利用全体における幻覚率を直接表すものではない。25
30
Astraは、複雑な複数ステップの作業に対応し、文書・スプレッドシート・プレゼンテーションを作成できると案内されている。19 だからこそ、モデルの改善を評価しつつも、接続先のツールやデータを含む運用設計まで安全性の対象として考える必要がある。
提供された資料からは、AstraがAnthropicのClaude Opus 5より、事実性、直接的な脱獄耐性、間接プロンプトインジェクション耐性のすべてで優れている、という一律の結論は導けない。
モデル間の安全性を公正に比べるには、同じテストセット、同等のエージェント用ツール、同一のシステム指示、共通の攻撃成功基準、さらに同程度に適応できる攻撃者が必要になる。ベンダーごとの評価や公開レッドチーム競技では、こうした条件が異なり得る。Gray Swanの資料ではClaude Opus 5がArenaで利用可能なモデルとして挙げられているが、提示資料にはAstraとOpus 5を同条件で比較したスコアカードはない。1
4
したがって、根拠を持って言える範囲はより限定的だ。OpenAIの最も強い主張は、Astraが自社の前世代モデルGPT-5.6 Solより改善したという点にある。
直接的な脱獄は、攻撃者がモデルに見える形でルールの上書きや禁止行為を求める攻撃だ。OpenAIが示す、長い攻撃軌跡に対するAstraの改善は、こうした粘り強く適応的な攻撃者への対処と特に関係する。25
これに対し、間接プロンプトインジェクションは、エージェントが処理しているコンテンツを経由して届く。たとえば、Webページ、メール、文書、検索結果、コーディングの実行履歴、ツール出力に悪意ある指示を潜ませ、利用者の本来の目的からエージェントをそらそうとする手法だ。Gray SwanのIPIチャレンジも、Webコンテンツ、ツール出力、コーディングエージェントのトレースなど、現実的な環境に隠された指示を対象としている。5
この違いは決定的だ。エージェントの利用者は、攻撃に使われた悪意ある指示そのものを一度も目にしない可能性がある。
Gray SwanはIPI Arenaについて、13の先端モデル、464人のレッドチーマー、41のシナリオ、27万2,000件超の攻撃試行を含むと報告した。そして、テストしたモデルの中に間接プロンプトインジェクションへの完全な免疫を示したものはなかったとしている。4
この結果は、ツールを使うAIエージェントの運用において、IPIが未解決の問題であることを強く示す。一方で、あらゆる安全性指標を網羅したベンダー中立の総合ランキングではない。すべてのモデルが同じ失敗率だったことを意味するものでも、個別モデルの事実性や直接的な脱獄耐性の評価を置き換えるものでもない。
単体のチャットアシスタントなら、インジェクションの成功は誤解を招く回答にとどまるかもしれない。しかし、業務システムへ接続したAIエージェントでは、影響が大きくなり得る。
OpenAIはAstraについて、Preparedness Frameworkにおけるサイバーセキュリティ能力の**「Critical」しきい値**を満たすと分類している。適切なツールとアクセス権があれば、人間が各段階を指示しなくても、防御が堅い多くのシステムで未知の脆弱性を見つけ、悪用方法を開発できるとしている。27
これは認可された防御業務に役立ち得る能力である一方、エージェントのワークフローが侵害された場合の影響も引き上げる。信頼できないコンテンツを通じてエージェントの目的をそらせる攻撃者は、何を検索するか、どのツールを呼び出すか、どんな操作を提案するかに影響を与えようとする可能性がある。機密データ、コードリポジトリ、クラウド環境、ブラウザ、業務アプリケーションへのアクセスが増えるほど、リスクも高まる。
プロンプトインジェクション耐性は、防御の一層として扱うべきであり、セキュリティ境界そのものではない。重要度の高いエージェント業務では、少なくとも次の設計が必要になる。
OpenAIも、能力の高いシステムに対する措置として、より強い分離、ネットワークおよびツールアクセスの制限、監視、サンドボックス実行を挙げている。34
Astraは、報告された事実誤りの減少と、直接的な脱獄への耐性向上という点で、GPT-5.6 Solより強力な後継モデルといえる。25
30 ただし、提示資料に基づけば、Claude Opus 5よりあらゆる条件で安全だと断定することはできない。また、間接プロンプトインジェクションはAIエージェント全体に残る重大な弱点だ。
4
企業にとっての実務上の教訓は明快だ。より強いモデルを選ぶだけでは足りない。悪意ある文書やWebページが、モデルの能力や接続済みツールを攻撃者の操作経路に変えられないよう、周辺システムを設計する必要がある。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
OpenAIによると、GPT 6 AstraはGPT 5.6 Solより事実誤りが少なく、長期・複数ターンに及ぶ攻撃を含む脱獄とプロンプトインジェクションへの耐性が大幅に高い。
OpenAIによると、GPT 6 AstraはGPT 5.6 Solより事実誤りが少なく、長期・複数ターンに及ぶ攻撃を含む脱獄とプロンプトインジェクションへの耐性が大幅に高い。 Gray SwanのIPI Arenaでは、13の先端モデル、41のエージェントシナリオ、27万2,000件超の攻撃試行を検証し、間接プロンプトインジェクションに完全耐性のモデルはなかったと報告された。
提示された資料だけでは、AstraとAnthropicのClaude Opus 5について、事実性や脱獄耐性の優劣を横並びで確定することはできない。