La page officielle de GPT-5.4 indique qu’il s’agit du modèle de pointe d’OpenAI pour les travaux professionnels complexes . OpenAI publie aussi une page de type cookbook consacrée à la vision et à la compréhension de documents avec GPT-5.4
. Dans les éléments consultés, ces exemples couvrent notamment l’extraction structurée depuis un formulaire d’assurance manuscrit, le raisonnement spatial sur un plan d’appartement, la compréhension de graphiques et l’extraction de boîtes englobantes depuis un formulaire de police
.
Ces exemples sont importants, car le vrai travail documentaire ne se limite pas à produire un résumé fluide. Un modèle bien ancré doit relier sa réponse à ce qui est visible : libellés et valeurs de champs, cellules de tableau, marques d’un graphique, écriture manuscrite, mise en page et position spatiale. Mais il faut garder la mesure : les documents GPT-5.4 cités ici sont des guides et démonstrations d’OpenAI, pas un audit indépendant couvrant tous les workflows documentaires en production .
La recommandation de prompt est également très concrète. OpenAI conseille d’utiliser le niveau de détail original pour les images grandes, denses ou spatialement sensibles, en particulier pour l’usage d’ordinateur, la localisation, l’OCR et les tâches où la précision du clic compte . Pour des formulaires, scans, captures d’écran ou graphiques, une chaîne de traitement peut donc perdre en fiabilité si elle réduit trop l’image ou supprime des détails que le modèle doit inspecter.
L’OCR, ou reconnaissance optique de caractères, consiste surtout à lire du texte. L’ancrage multimodal va plus loin : il demande de relier texte, disposition, position, structure visuelle et raisonnement pour produire une réponse vérifiable sur la page.
La littérature de recherche va dans ce sens. L’évaluation de la compréhension de documents couvre notamment la compréhension de formulaires, l’analyse de reçus et la question-réponse visuelle sur documents . Pour des documents multipages, la VQA documentaire peut demander au modèle de raisonner à travers plusieurs pages, de naviguer dans le document, de retrouver les passages pertinents et d’inspecter des pages ciblées plutôt que de se contenter d’une seule image ou d’un recadrage
.
C’est pourquoi une capture d’écran impressionnante ne suffit pas. Une évaluation sérieuse doit couvrir les types de documents réellement traités, la qualité des scans, le nombre de pages, les écritures manuscrites, les tableaux, les graphiques, les petits caractères et les cas d’échec probables.
original pour les entrées denses, grandes ou spatialement sensibles : OCR, localisation, précision du clic ou usage d’ordinateur Le nom « Spud » circule dans des contenus de type rumeur, mais il n’est pas vérifié comme modèle public officiel d’OpenAI dans les sources étudiées ici. La conclusion exploitable est plus précise : évaluer GPT-5.4 pour les workflows de vision et de compréhension de documents documentés par OpenAI, et considérer les promesses autour de GPT-5.5 « Spud » comme non prouvées jusqu’à la publication d’une page modèle, d’un guide, d’une model card ou d’un rapport de benchmark officiel .