Cela ne prouve pas qu’un nom de code « Spud » n’ait jamais existé en interne. En revanche, cela signifie que les affirmations publiques sur sa date de sortie, ses performances ou une supériorité en ancrage multimodal ne sont pas établies par les preuves officielles disponibles dans ce corpus.
La preuve officielle la plus solide pointe vers GPT-5.4. La page modèle d’OpenAI présente GPT-5.4 comme son modèle de pointe pour le travail professionnel complexe, et le guide du dernier modèle ainsi que l’index des modèles renvoient eux aussi à GPT-5.4 .
À l’inverse, les sources spécifiques à Spud examinées ici relèvent d’articles généralistes, de Reddit, de publications X et de vidéos YouTube, pas de pages modèle, guides, model cards ou rapports de benchmarks officiels d’OpenAI . La conclusion prudente est donc simple : GPT-5.5 « Spud » doit être considéré comme une rumeur ou une étiquette non vérifiée tant qu’OpenAI ne publie pas de documentation officielle.
| Affirmation | Statut | Ce que les sources soutiennent |
|---|---|---|
| GPT-5.5 « Spud » est un modèle public officiel d’OpenAI | Non vérifié | Les sources officielles OpenAI examinées documentent GPT-5.4, pas une page modèle GPT-5.5 ou Spud . |
| Spud est imminent ou déjà validé | Non vérifié | Les références à Spud dans ce corpus viennent de sources web généralistes ou de contenus sociaux/vidéo générés par des utilisateurs . |
| OpenAI a documenté des workflows multimodaux pour les documents | Vérifié pour GPT-5.4 | OpenAI fournit des consignes GPT-5.4 pour la vision et la compréhension de documents, ainsi que des recommandations de prompt pour les images denses ou spatialement sensibles . |
| Spud fait mieux que GPT-5.4 en ancrage multimodal | Non étayé ici | Les documents officiels examinés soutiennent GPT-5.4 ; ils ne fournissent pas de capacités ni de benchmarks spécifiques à Spud . |
La page officielle de GPT-5.4 indique qu’il s’agit du modèle de pointe d’OpenAI pour les travaux professionnels complexes . OpenAI publie aussi une page de type cookbook consacrée à la vision et à la compréhension de documents avec GPT-5.4 . Dans les éléments consultés, ces exemples couvrent notamment l’extraction structurée depuis un formulaire d’assurance manuscrit, le raisonnement spatial sur un plan d’appartement, la compréhension de graphiques et l’extraction de boîtes englobantes depuis un formulaire de police .
Ces exemples sont importants, car le vrai travail documentaire ne se limite pas à produire un résumé fluide. Un modèle bien ancré doit relier sa réponse à ce qui est visible : libellés et valeurs de champs, cellules de tableau, marques d’un graphique, écriture manuscrite, mise en page et position spatiale. Mais il faut garder la mesure : les documents GPT-5.4 cités ici sont des guides et démonstrations d’OpenAI, pas un audit indépendant couvrant tous les workflows documentaires en production .
La recommandation de prompt est également très concrète. OpenAI conseille d’utiliser le niveau de détail original pour les images grandes, denses ou spatialement sensibles, en particulier pour l’usage d’ordinateur, la localisation, l’OCR et les tâches où la précision du clic compte . Pour des formulaires, scans, captures d’écran ou graphiques, une chaîne de traitement peut donc perdre en fiabilité si elle réduit trop l’image ou supprime des détails que le modèle doit inspecter.
L’OCR, ou reconnaissance optique de caractères, consiste surtout à lire du texte. L’ancrage multimodal va plus loin : il demande de relier texte, disposition, position, structure visuelle et raisonnement pour produire une réponse vérifiable sur la page.
La littérature de recherche va dans ce sens. L’évaluation de la compréhension de documents couvre notamment la compréhension de formulaires, l’analyse de reçus et la question-réponse visuelle sur documents . Pour des documents multipages, la VQA documentaire peut demander au modèle de raisonner à travers plusieurs pages, de naviguer dans le document, de retrouver les passages pertinents et d’inspecter des pages ciblées plutôt que de se contenter d’une seule image ou d’un recadrage .
C’est pourquoi une capture d’écran impressionnante ne suffit pas. Une évaluation sérieuse doit couvrir les types de documents réellement traités, la qualité des scans, le nombre de pages, les écritures manuscrites, les tableaux, les graphiques, les petits caractères et les cas d’échec probables.
original pour les entrées denses, grandes ou spatialement sensibles : OCR, localisation, précision du clic ou usage d’ordinateur .Le nom « Spud » circule dans des contenus de type rumeur, mais il n’est pas vérifié comme modèle public officiel d’OpenAI dans les sources étudiées ici. La conclusion exploitable est plus précise : évaluer GPT-5.4 pour les workflows de vision et de compréhension de documents documentés par OpenAI, et considérer les promesses autour de GPT-5.5 « Spud » comme non prouvées jusqu’à la publication d’une page modèle, d’un guide, d’une model card ou d’un rapport de benchmark officiel .