Isso não prova que um modelo futuro ou privado chamado Spud nunca possa existir. Significa apenas que, com as fontes citadas, não há base para tratar GPT-5.5 Spud como modelo oficial da OpenAI nem para declarar um vencedor em controle de alucinações.
A fonte mais forte sobre o Claude Opus 4.7 é documentação de produto, não um ranking público contra modelos da OpenAI. A Anthropic afirma que desenvolvedores podem usar claude-opus-4-7 pela Claude API . A documentação também diz que o Claude Opus 4.7 introduz task budgets, ou orçamentos de tarefa
.
Esse tipo de recurso é relevante para controle operacional, mas não é a mesma coisa que um benchmark público de incerteza calibrada. Em outras palavras: controlar como uma tarefa é executada não responde, por si só, quando o modelo sabe dizer “não tenho evidência suficiente para afirmar isso”.
Há, ainda assim, um sinal relacionado a honestidade. A Mashable publicou, citando o system card da Anthropic, que o Claude Opus 4.7 teve taxa de honestidade MASK de 91,7% e era menos propenso a alucinar ou a agir de forma bajuladora do que modelos anteriores da Anthropic e outros modelos de fronteira . É um dado relevante, mas não resolve a comparação com Spud, porque não é um benchmark pareado contra um modelo GPT-5.5 Spud verificado.
Nas fontes oficiais da OpenAI incluídas aqui, os nomes verificados são outros: GPT-5, GPT-5 mini, GPT-5.2-Codex e materiais de orientação para GPT-5.4 . O rastro de Spud, neste conjunto, vem de posts no Reddit e de um tópico de solicitação de recurso na OpenAI Developer Community
.
Posts de comunidade podem sinalizar rumores, desejos de usuários ou discussões em andamento. Mas eles não equivalem a uma página oficial de modelo, um model card, um identificador de API ou um anúncio de lançamento.
O texto da OpenAI sobre alucinações é mais útil para desenhar testes do que para verificar Spud. A OpenAI argumenta que procedimentos comuns de treino e avaliação recompensam o chute em vez do reconhecimento de incerteza, e diz que modelos deveriam indicar incerteza ou pedir esclarecimento em vez de fornecer informação confiante, porém incorreta .
O exemplo SimpleQA da OpenAI mostra por que olhar só para acurácia pode enganar. A empresa lista gpt-5-thinking-mini com 52% de abstenção, 22% de acerto e 26% de erro, enquanto o4-mini aparece com 1% de abstenção, 24% de acerto e 75% de erro . No exemplo, o primeiro modelo responde menos vezes, mas erra muito menos
. Em uso real, especialmente em produtos de maior risco, essa diferença pode valer mais do que uma resposta confiante para toda pergunta.
Controle de alucinação não é simplesmente recusar tudo. Um modelo útil deve responder quando há boa base, pedir contexto quando a pergunta está ambígua e se abster quando a resposta não pode ser sustentada. Esse é o sentido prático de incerteza calibrada.
A pesquisa acadêmica apoia essa leitura, com ressalvas. Um estudo de 2024 relata que a abstenção baseada em incerteza melhora correção, reduz alucinações e aumenta segurança em cenários de perguntas e respostas . O trabalho I-CALM enquadra a abstenção epistêmica como a decisão de não responder a perguntas factuais com resposta verificável quando o modelo não tem segurança suficiente, e observa que LLMs atuais ainda podem falhar em se abster quando deveriam
. Outra linha, sobre aprendizado por reforço calibrado comportamentalmente, estuda formas de incentivar modelos a admitir incerteza por meio da abstenção
.
Revisões mais amplas tratam a quantificação de incerteza como ferramenta para detectar alucinações e descrevem a incerteza calibrada como útil para decidir quando confiar, encaminhar ou verificar a resposta de um modelo . A ressalva é importante: a abstenção precisa ser calibrada. Um modelo que diz “não sei” o tempo todo pode ser seguro, mas pouco útil. Um modelo que nunca se abstém pode parecer produtivo, mas tende a ser mais arriscado.
claude-opus-4-7; do lado da OpenAI, use um modelo documentado, como GPT-5 ou GPT-5 mini, em vez de um rótulo Spud não verificado Não como modelo oficial da OpenAI nas evidências fornecidas. As fontes oficiais citadas documentam GPT-5, GPT-5 mini, GPT-5.2-Codex e orientação para GPT-5.4; Spud aparece em posts do Reddit e em um tópico de solicitação de recurso na comunidade .
Não dá para responder de forma rigorosa com estas fontes. O Claude Opus 4.7 é documentado oficialmente , e há reportagem secundária citando taxa de honestidade MASK de 91,7%
. Mas não há um alvo GPT-5.5 Spud verificado nem um benchmark compartilhado para os dois nomes
.
Compare o Claude Opus 4.7 com modelos documentados da OpenAI sob as mesmas tarefas, ferramentas, prompts e regras de pontuação. O conjunto de métricas deve combinar acurácia, taxa de erro e comportamento de abstenção, não apenas acurácia .
Não há base para concluir que Claude venceu Spud, nem que Spud venceu Claude, em controle de alucinação. A conclusão sustentada pelas fontes é esta: Claude Opus 4.7 está documentado oficialmente; GPT-5.5 Spud não está verificado nos materiais oficiais da OpenAI citados; e a melhor forma de avaliar controle de alucinação é recompensar incerteza calibrada, incluindo a abstenção correta quando uma afirmação não pode ser sustentada .