Googleは9月30日、Gemini 4世代の旗艦モデルとなる「Gemini 4 Argon」を発表しました。ソフトウェア開発、法務・金融などの専門業務、サイバーセキュリティといった複雑で長時間にわたる作業を想定しています。ただし、当面の提供先は審査を通ったサイバー防衛関係者に限られ、一般向けの公開はまだです。
9
Googleが示した比較テストでは、OpenAIやAnthropicのモデルを上回る項目もあります。一方、利用できる人が限られているため、多くの開発者や企業が実務で性能を確かめる段階には至っていません。
6
Argonはどんな作業を想定している?
Googleによると、Argonは同社がこれまで提供してきた上位のProモデルより大規模で、複雑な作業に対応する最も高性能なモデルです。長い工程を伴うソフトウェア開発のほか、法務・金融分野を含む企業の知識業務、サイバー防衛を主な用途に挙げています。
9
ただし、報道や公表資料ではモデルのパラメーター数は明らかにされていません。「従来のProモデルより大規模」という説明だけでは、具体的な規模や、利用料金・処理速度・個別の業務で競合モデルとどう違うかまでは分かりません。
Google公表のベンチマーク結果
Googleが公表した比較では、知識業務を測るVals IndexでArgonは68.9%を記録。OpenAIのGPT-6 Astraは63.1%、AnthropicのClaude Opus 5.5は67.0%でした。業務自動化を測るAutomationBenchではArgonが51.3%で、Astraの41.4%、Opus 5.5の42.5%を上回っています。
長い工程を含むソフトウェア開発のテストDeepSWE v1.1では77.9%と、Googleは最高水準の結果を報告しました。 サイバーセキュリティ関連の比較については、首位を単独で獲得したというより、同率首位とする報道があります。
3
7
こうした数値は、Googleが選んだテストでArgonがどのような結果を出したかを示す材料です。ただし、特定の課題におけるベンチマーク結果が、あらゆる用途での総合的な優位性を示すわけではありません。一般公開も限られているため、幅広い利用者による独立した検証はまだ進んでいません。
6
いま使えるのは誰?
Googleは「Fairwind Program」を通じて、選定・審査されたサイバー防衛関係者にArgonを提供しています。同社は、サイバー防衛で活用してもらう一方、悪用のリスクを抑えるために提供範囲を限定していると説明しています。また、米政府が行うリリース前モデルへの自主的なアクセス・評価のプロセスにも参加しています。
6
5
開発者、企業、一般ユーザー向けの広範な提供は始まっておらず、ここで参照した報道にも一般公開の確定日程はありません。
6 報道では、AnthropicがClaude Mythos Previewへのアクセスを限られた組織に絞っていることとの類似も指摘されていますが、両社のプログラムを詳しく比較できるだけの情報は示されていません。
6
Gemini 3.5 Proの遅れが示すこと
報道によると、GoogleはGemini 3.5 Proの能力、とりわけコーディング性能を高めるため、リリースを遅らせていました。その後、同モデルを公開するのではなく、Gemini 4 Argonへと軸足を移しています。
この経緯により、ArgonはGoogleにとって、OpenAIやAnthropicが先端モデルを進化させてきた期間を経て投入する新たな旗艦という位置づけになりました。ただし、Gemini 3.5 Proの遅れについて確認できる報道上の説明は、能力改善に取り組んでいたという点です。特定のDeepMind組織変更が遅れを引き起こしたとする根拠は、ここで参照した情報からは確認できません。
コスト面の優位性はArgonで確認できるか
Googleは競争戦略の一環として、モデルのコスト面の強みも訴えてきました。ベンチマークの性能だけでなく、価格を競争軸にできる可能性はあります。
ただし、参照した情報からは、Argonそのものが競合の旗艦モデルより低コストだと確認できる比較は得られません。現時点で分かるのは、Googleが一部の開発・企業向けベンチマークで強い結果を示しつつ、評価を進めるために提供範囲を絞っていることです。実際の業務でどこまで差が出るのか、コスト面でも優位なのかは、より多くの利用者が試せるようになってから判断する必要があります。
6