| 論点 | 根拠に基づく答え |
|---|---|
| Claude Opus 4.7は確認済みか | はい。AnthropicはClaude Opus 4.7を文書化し、開発者がClaude APIでclaude-opus-4-7を使えると説明しています 。 |
| GPT-5.5 SpudはOpenAIの公式モデルとして確認済みか | 提供されたOpenAI公式資料では確認できません。そこにあるのはGPT-5、GPT-5 mini、GPT-5.2-Codex、GPT-5.4のプロンプトガイダンスです 。 |
| Spudという名前はどこに出てくるか | Reddit投稿とOpenAI Developer Communityの機能要望スレッドに出てきますが、リリースノートやAPIのモデル文書ではありません 。 |
| Claude対Spudの幻覚ベンチマークはあるか | 提供された資料には、同一タスク・同一採点の直接比較はありません。公平な評価では、誤答だけでなく棄権、つまり答えない判断も別に採点すべきです 。 |
これは、将来または非公開のSpudモデルが存在し得ないと証明するものではありません。あくまで、現在の引用資料からはGPT-5.5 SpudをOpenAIの公式モデルとして扱えず、幻覚の少なさでClaudeと勝敗を付ける根拠もない、という意味です。
Claude Opus 4.7について最も強い根拠は、横並びの幻覚ランキングではなくAnthropicの製品資料です。Anthropicは開発者がclaude-opus-4-7をClaude API経由で使えると説明し 、ドキュメントではClaude Opus 4.7にタスク予算が導入されたとしています 。
タスク予算は、モデルにどれだけ作業させるかを制御するうえでは重要です。ただし、それだけでモデルが不確かな事実主張をいつ控えるか、つまり較正された不確実性をどれほど備えているかを示す公開ベンチマークにはなりません。
誠実性に関する注目材料はあります。MashableはAnthropicのOpus 4.7システムカードを引用し、Claude Opus 4.7のMASK honesty rateが91.7%で、従来のAnthropicモデルや他のフロンティアAIモデルよりハルシネーションや過度な同調が少ないと報じました 。これは有用な情報ですが、検証済みのGPT-5.5 Spudモデルとの同一条件比較ではないため、Claude対Spudの答えにはなりません。
提供されたOpenAI資料で確認できるのは、GPT-5、GPT-5 mini、GPT-5.2-Codex、GPT-5.4のプロンプトガイダンスです 。この資料群でSpudという名前が出てくるのは、Reddit投稿とOpenAI Developer Communityの機能要望スレッドです 。
コミュニティ投稿は、噂や関心の所在を知る手掛かりにはなります。しかし、公式のモデルページ、モデルカード、API識別子、リリース告知と同じ重みでは扱えません。
一方で、OpenAIのハルシネーション解説は、評価設計の参考になります。OpenAIは、一般的な訓練や評価の仕組みが不確実性を認めるよりも推測を報いるため、モデルが自信ありげに間違う方向へ誘導されると説明しています。また、確信を持って誤情報を出すより、不確実性を示す、または確認のために質問する方がよいとも述べています 。
OpenAIのSimpleQA例は、正答率だけでは実態を見誤ることを示しています。そこではgpt-5-thinking-miniが棄権52%、正答22%、誤答26%とされる一方、o4-miniは棄権1%、正答24%、誤答75%とされています 。前者は答える回数が少ないものの、誤答は大幅に少ない例です 。医療、法務、金融、企業の意思決定支援のように誤答コストが高い場面では、この差が単なる正答率以上に重要になります。
ハルシネーション対策は、何でも拒否することではありません。使えるAIは、根拠が十分なら答え、質問が曖昧なら確認し、根拠を持てないなら答えを控える必要があります。このバランスが、較正された不確実性です。
研究面でも、この見方は支持されています。ただし、万能薬ではありません。2024年の研究は、質問応答の場面で不確実性に基づく棄権が正確性、ハルシネーション、安全性を改善すると報告しています 。I-CALMは、検証可能な答えを持つ事実質問におけるエピステミックな棄権を扱い、現在のLLMは棄権すべき場面でも棄権に失敗し得ると指摘しています 。行動的に較正された強化学習の研究も、モデルが不確実性を認めて棄権するよう促す方法を検討しています 。
より広いレビューでも、不確実性の定量化はハルシネーション検出の道具とされ、較正された不確実性はモデルの回答を信頼するか、人に回すか、追加検証するかを判断する助けになると説明されています 。
ただし、棄権は多ければよいわけではありません。分かりませんばかりのモデルは安全でも役に立たず、逆に一切棄権しないモデルは便利に見えても危険です。重要なのは、答えるべき場面で答え、答えるべきでない場面で止まることです。
claude-opus-4-7を使い、OpenAI側は未確認のSpudラベルではなく、GPT-5やGPT-5 miniなど文書化されたモデルを使います 。少なくとも、この資料群の範囲ではOpenAIの公式モデルとしては確認できません。引用されたOpenAI公式資料はGPT-5、GPT-5 mini、GPT-5.2-Codex、GPT-5.4のプロンプトガイダンスを確認しており、SpudはReddit投稿とコミュニティの機能要望スレッドに出てくるだけです 。
この資料だけでは厳密には答えられません。Claude Opus 4.7は公式に文書化されており 、MASK honesty rate 91.7%という二次報道もあります 。しかし、検証済みのGPT-5.5 Spudという比較対象がなく、両者を同じ条件で採点したベンチマークも提示されていません 。
Claude Opus 4.7と、GPT-5やGPT-5 miniなど文書化されたOpenAIモデルを、同じタスク、同じツール、同じプロンプト、同じ採点基準で比較すべきです。見るべき指標は正答率だけでなく、誤答率と棄権の質を含めたセットです 。
この証拠から、Claudeが勝った、あるいはSpudが勝ったとは言えません。支持できる結論はもっと限定的です。Claude Opus 4.7は公式に文書化されている。GPT-5.5 Spudは、引用されたOpenAI公式資料では確認されていない。そしてハルシネーション制御を評価するなら、根拠のない主張を避ける正しい棄権を含め、較正された不確実性を評価軸に入れる必要があります 。