Pour les équipes produit, les développeurs et les responsables IA, la nuance est importante. Un surnom de modèle n’est pas un benchmark. Et une grande fenêtre de contexte — c’est-à-dire la quantité de texte qu’un modèle peut recevoir en entrée — ne prouve pas, à elle seule, que le modèle saura conserver les consignes dans un long flux de travail avec outils, fichiers et plusieurs sessions.
| Affirmation | Statut | Ce que les sources permettent de dire |
|---|---|---|
| GPT-5.5 Spud est un modèle OpenAI officiellement documenté | Non vérifié | Le guide API, le changelog et les notes de version GPT examinés renvoient à « Latest: GPT-5.4 », pas à un modèle public GPT-5.5 Spud . |
| OpenAI a publié une date de sortie, une model card, une page API ou des tarifs pour GPT-5.5 Spud | Non trouvé dans les sources officielles examinées | Des pages non officielles évoquent un calendrier et des capacités possibles, mais les documents OpenAI de ce corpus documentent GPT-5.4 . |
| OpenAI a publié des benchmarks sur la rétention des consignes en contexte long pour Spud | Non vérifié | Le corpus ne contient pas de system card OpenAI ni de benchmark officiel spécifique à Spud sur le contexte long . |
| OpenAI a publié des éléments liés aux longues exécutions pour GPT-5.4 Thinking | Oui, mais seulement pour GPT-5.4 Thinking | OpenAI affirme que GPT-5.4 Thinking fait nettement mieux que des modèles antérieurs sur des traces longues difficiles, et décrit CoT-Control comme une suite d’évaluation de plus de 13 000 tâches . |
Le nom « Spud » circule bien en ligne. On le retrouve dans des publications Facebook, des fils Reddit, des posts sur X, des vidéos YouTube et des articles non officiels évoquant des fenêtres de lancement, du préentraînement, de la multimodalité ou de nouvelles capacités . Ces références montrent qu’une rumeur existe. Elles ne démontrent pas qu’OpenAI a lancé un modèle.
Pour établir la disponibilité d’un modèle, les preuves les plus solides seraient normalement une page API OpenAI, une entrée de changelog, une note de version, une annonce officielle, une system card ou un artefact de benchmark — précisément le type de sources primaires qui, dans ce corpus, identifient ou décrivent GPT-5.4 .
L’absence de documentation publique ne prouve pas qu’aucun nom de code interne n’existe. Elle signifie simplement que les affirmations publiques sur la date de sortie, l’accès API, le prix, la mémoire ou la fiabilité en contexte long de Spud restent non vérifiées dans les sources examinées.
Les éléments OpenAI les plus solides portent sur GPT-5.4. Le guide API s’intitule « Using GPT-5.4 », et le changelog comme les notes de version GPT renvoient à « Latest: GPT-5.4 » .
Dans son annonce de GPT-5.4, OpenAI indique que le modèle intègre les capacités de codage de GPT-5.3-Codex et améliore le travail avec les outils, les environnements logiciels, les feuilles de calcul, les présentations et les documents . La même annonce affirme que GPT-5.4 atteint 83,0 % sur les comparaisons GDPval, contre 70,9 % pour GPT-5.2, sur un benchmark présenté comme testant la capacité d’agents à produire du travail de connaissance bien spécifié dans 44 métiers .
La preuve officielle la plus proche de la question de la fiabilité sur de longs workflows concerne GPT-5.4 Thinking, pas Spud. La system card de GPT-5.4 Thinking affirme que le modèle réussit nettement mieux que les modèles précédents sur des traces longues difficiles, notamment pour suivre et annuler des opérations tout en préservant le travail de l’utilisateur ; la page décrit CoT-Control comme une suite d’évaluation de plus de 13 000 tâches . C’est une affirmation sur GPT-5.4 Thinking, pas une preuve que GPT-5.5 Spud a été publié ou testé de façon comparable.
La fiabilité en contexte long ne consiste pas seulement à faire entrer beaucoup de texte dans une requête. Dans un usage réel, un modèle peut devoir conserver des contraintes placées très loin les unes des autres, maintenir un état au fil des tours ou des sessions, choisir le bon outil, corriger un travail antérieur sans casser le reste, et garder un livrable cohérent sur plusieurs fichiers ou documents.
La recherche récente traite encore ce sujet comme un problème d’évaluation ouvert. Des synthèses couvrent les techniques d’extension de contexte, la modélisation long contexte, les changements d’architecture, les approches de workflow et le context engineering, plutôt que de présenter le suivi d’instructions en contexte long comme un problème résolu . Une étude d’évaluation systématique compare aussi des techniques d’optimisation pour les modèles de langage en contexte long, y compris dans des cas où les modèles doivent traiter et retenir de grands volumes d’information .
La rétention des consignes est de plus en plus mesurée directement. LongAlign introduit LongBench-Chat pour évaluer le suivi d’instructions en contexte long . LifBench propose un Long-context Instruction Following Benchmark centré sur la performance et la stabilité du suivi d’instructions en contexte long . LocoBench vise les workflows complexes de génie logiciel et inclut la rétention de mémoire multi-session ainsi que des workflows de développement sur plusieurs sessions .
Les recommandations d’évaluation d’OpenAI invitent à construire des évaluations orientées production et mentionnent explicitement le choix d’outils ; OpenAI avertit qu’à mesure que l’on ajoute des outils et des tâches à une architecture d’agent unique, le modèle peut avoir plus de mal à suivre les consignes ou à sélectionner le bon outil . OpenAI publie aussi des conseils pour des tâches Codex à long horizon, ce qui montre que le travail étendu en plusieurs étapes est bien un cas d’usage produit, mais ce n’est pas un benchmark de Spud .
Une suite d’évaluation pratique devrait au minimum couvrir six comportements :
Le verdict devrait changer seulement avec des preuves primaires plus solides : une page API ou une page modèle OpenAI nommant GPT-5.5 ou Spud, une entrée de changelog ou de notes de version, une annonce OpenAI, une model card ou system card, ou des résultats d’évaluation reproductibles couvrant le suivi d’instructions, la mémoire multi-session, le choix d’outils, l’annulation d’opérations et la cohérence des livrables .
En attendant, la formulation la plus sûre reste limitée : GPT-5.5 Spud n’est pas publiquement vérifié dans les documents officiels OpenAI examinés ici, et sa fiabilité en contexte long n’est pas établie par les preuves disponibles. Le bon réflexe consiste à benchmarker les modèles réellement accessibles, et à traiter les surnoms non officiels comme des rumeurs tant qu’OpenAI n’a pas publié de documentation.