gpt-5.5 et gpt-5.5-2026-04-23, et indique que GPT-5.5 et GPT-5.5 Pro sont disponibles dans l’API après une mise à jour du 24 avril 2026 Claude Opus 4.7 est le modèle le mieux documenté par une source primaire dans cette comparaison. Anthropic le décrit comme un modèle de raisonnement hybride qui pousse la frontière pour le code et les agents IA, avec une fenêtre de contexte d’un million de tokens . La page produit ajoute qu’Opus 4.7 améliore les performances en code, vision, tâches complexes en plusieurs étapes et travail professionnel de connaissance
.
La différence la plus nette concerne le long contexte. La documentation d’Anthropic affirme que Claude Opus 4.7 offre une fenêtre d’un million de tokens au tarif API standard, sans supplément long contexte . La même documentation signale des gains sur des tâches de travailleurs du savoir, en particulier lorsque le modèle doit vérifier visuellement ses propres sorties : relecture de documents
.docx, édition de présentations .pptx, analyse de graphiques et de figures .
Des détails utiles existent aussi côté tiers, mais ils doivent rester étiquetés comme tels. Caylent indique qu’Opus 4.7 prendrait en charge jusqu’à 128 000 tokens de sortie et conserverait le tarif Opus standard de 5 $ par million de tokens d’entrée et 25 $ par million de tokens de sortie . Pour une décision budgétaire, c’est une piste ; la preuve primaire la plus robuste reste toutefois l’absence de prime long contexte annoncée par Anthropic
.
La limite principale vient des benchmarks. L’article de Vellum sur Claude Opus 4.7 liste des catégories comme le code, les capacités agentiques, la finance, le raisonnement, le multimodal, la vision, la recherche et la sûreté, mais l’extrait accessible ne contient pas les scores nécessaires pour opposer directement Claude à GPT-5.5, DeepSeek V4 ou Kimi K2.6 .
GPT-5.5 est suffisamment confirmé pour entrer dans une présélection technique. La documentation API d’OpenAI liste gpt-5.5 ainsi que la version datée gpt-5.5-2026-04-23, marque le modèle comme long contexte et affiche des niveaux de limites d’usage . La page de lancement d’OpenAI, datée du 23 avril 2026, indique qu’après une mise à jour du 24 avril 2026 GPT-5.5 et GPT-5.5 Pro sont disponibles dans l’API
.
Ce socle confirme l’existence et l’accès API, mais il ne suffit pas à classer GPT-5.5 face aux trois autres. Les extraits officiels disponibles ne donnent pas la taille exacte de la fenêtre de contexte, la limite de sortie, le prix, les modalités détaillées, les scores de benchmark, la latence ni les performances de code .
Des pages tierces comblent partiellement ces vides, sans avoir la même valeur qu’une documentation OpenAI. DesignForOnline rapporte un prix de 5 $ par million de tokens d’entrée et 30 $ par million de tokens de sortie . LLM Stats rapporte une fenêtre API de 1 million de tokens en entrée et 128 000 en sortie, ainsi que des entrées texte et image avec sortie texte
. Ces chiffres sont utiles pour préparer les questions à poser au fournisseur, pas pour établir un verdict définitif.
Lecture pratique : testez GPT-5.5 tôt si votre produit repose déjà sur l’infrastructure OpenAI. Mais, à partir de ces seules sources, il serait imprudent d’affirmer qu’il bat Claude, DeepSeek ou Kimi sur les benchmarks, le coût ou la performance agentique .
DeepSeek possède la grille de coûts la plus concrète de ce comparatif. Sa page de tarification indique une longueur de contexte d’un million de tokens, une sortie maximale de 384 000 tokens, la sortie JSON, les appels d’outils, Chat Prefix Completion en bêta et FIM Completion en bêta . Elle donne aussi des prix par million de tokens pour les entrées en cache hit, les entrées en cache miss et les sorties : 0,028 $ et 0,03625 $ pour les entrées en cache, 0,14 $ et 0,435 $ pour les entrées hors cache, puis 0,28 $ et 0,87 $ pour les sorties, avec des mentions de remise limitée et des valeurs non remisées barrées dans l’extrait
.
La photographie propre à V4 est solide, mais plus indirecte. EvoLink affirme que les documents API officiels de DeepSeek listent deepseek-v4-flash et deepseek-v4-pro, publient les prix officiels et documentent un contexte d’un million de tokens avec 384 000 tokens de sortie maximale au 24 avril 2026 . Hugging Face indique que DeepSeek a publié V4 avec deux checkpoints MoE : DeepSeek-V4-Pro avec 1,6 billion de paramètres au total et 49 milliards actifs, et DeepSeek-V4-Flash avec 284 milliards de paramètres au total et 13 milliards actifs
. Hugging Face ajoute que les deux ont une fenêtre de contexte d’un million de tokens et que les résultats de benchmark sont compétitifs, sans être à l’état de l’art
.
La fiche OpenRouter de V4 Pro mentionne séparément une fenêtre de 1 048 576 tokens et un prix de 0,435 $ par million de tokens d’entrée et 0,87 $ par million de tokens de sortie . C’est une triangulation utile, mais les équipes doivent vérifier les prix actuels directement, car la page DeepSeek comporte des mentions de remise limitée
.
Lecture pratique : DeepSeek V4 mérite un test précoce si vos premiers filtres sont le coût, le long contexte, les très longues sorties, la sortie JSON ou les appels d’outils. Cela ne prouve pas automatiquement une supériorité en qualité, fiabilité, sûreté, latence ou réussite d’usage des outils ; ces dimensions demandent des essais sur vos propres charges.
Kimi K2.6 est positionné sur les bons usages des modèles de pointe, mais ses spécifications exactes sont moins solidement confirmées par des sources primaires dans ce corpus. Le site Moonshot présente K2.6 comme nativement multimodal, avec de fortes capacités de code et de performance agentique . Le blog technique Kimi recommande d’utiliser l’API officielle pour reproduire les résultats de benchmark Kimi-K2.6 et renvoie les fournisseurs tiers vers Kimi Vendor Verifier
.
Les chiffres plus précis viennent surtout de tiers. LLM Stats indique que Kimi K2.6 dispose d’un contexte d’entrée de 262 144 tokens et peut générer jusqu’à 262 144 tokens en sortie . DesignForOnline décrit Kimi K2.6 avec un contexte de 262 000 tokens, la vision, l’usage d’outils, les appels de fonctions et un prix à partir de 0,7500 $ par million de tokens
. Atlas Cloud liste un prix API à partir de 0,95 $ par million de tokens
. Un article LinkedIn décrit Kimi K2.6 comme open-weight, mais cette affirmation issue d’un contenu généré par un utilisateur doit être considérée comme moins fiable tant que Moonshot ne confirme pas directement les conditions de licence
.
Lecture pratique : Kimi K2.6 vaut une évaluation pour les flux de travail mêlant multimodal, code et agents. Avant un choix de production, il faut néanmoins vérifier auprès de Moonshot ou d’une API officielle la licence, la longueur de contexte, les limites de sortie, les prix, la méthode de benchmark et la compatibilité avec les fournisseurs .
Un gagnant unique façon classement de championnat serait trompeur. Le résumé accessible de Vellum liste des domaines de benchmark pour Claude Opus 4.7 sans afficher les résultats détaillés . La page OpenAI de GPT-5.5 comporte une section d’évaluations dans sa structure, mais l’extrait ne montre pas les chiffres
. Hugging Face dit que les scores de DeepSeek V4 sont compétitifs, pas à l’état de l’art
. Le blog Kimi renvoie vers l’API officielle pour reproduire les résultats de Kimi-K2.6, sans afficher ces résultats dans l’extrait disponible
.
C’est important, car le classement peut changer selon la tâche : génération de code, extraction dans un très long contexte, analyse multimodale de documents, fiabilité des appels d’outils, planification agentique, latence ou coût lorsque le cache est touché ou non. Sans un même banc d’essai appliqué aux quatre modèles, une affirmation de meilleur modèle global relève davantage du marketing que de la preuve.
gpt-5.5 Pour une décision de production, organisez un test comparatif sur vos propres tâches plutôt que de vous fier à des promesses générales. Utilisez les mêmes prompts, outils, tailles de contexte, fichiers d’entrée et grilles de notation pour chaque modèle. Suivez au minimum cinq axes : réussite de la tâche, fiabilité des appels d’outils, exactitude en long contexte, latence et coût complet en tokens.
Pour DeepSeek, distinguez les coûts cache hit et cache miss, car la page de prix les sépare explicitement . Pour GPT-5.5, séparez ce qui est confirmé par OpenAI de ce qui provient de pages tierces tant que la documentation officielle ne donne pas plus de détails
. Pour Kimi K2.6, traitez les listings de fournisseurs et les affirmations open-weight issues d’utilisateurs comme des pistes à vérifier, non comme des preuves finales d’achat
.
Si l’on juge sur les preuves plutôt que sur le bruit, Claude Opus 4.7 est le modèle phare le plus clairement documenté de cette comparaison, notamment pour le contexte d’un million de tokens, le code, les agents IA et le travail de connaissance . DeepSeek V4 dispose de la preuve tarifaire la plus forte et d’éléments crédibles sur le long contexte, même si une partie des détails V4 Flash/Pro est plus lisible dans des synthèses tierces que dans l’extrait tarifaire seul
. GPT-5.5 est confirmé dans les documents API et de lancement d’OpenAI, mais les extraits officiels accessibles sont trop incomplets pour un comparatif de performance exhaustif
. Kimi K2.6 a un positionnement officiel crédible autour du multimodal, du code et des agents, mais beaucoup de détails techniques et commerciaux exigent encore une confirmation primaire plus solide
.