Autrement dit, l’enjeu n’est pas seulement de savoir si ERNIE 5.1 est puissant. L’enjeu est de savoir si Baidu peut faire de la performance par euro — ou par unité de calcul — un avantage compétitif.
La revendication centrale est assez précise. ERNIE 5.1 n’est pas présenté comme un nouveau modèle fondation entraîné entièrement depuis zéro. Baidu dit qu’il hérite du socle de pré-entraînement d’ERNIE 5.0 .
L’entreprise ajoute deux éléments de compression : les paramètres totaux seraient ramenés à environ un tiers, et les paramètres actifs à environ la moitié . Les paramètres totaux correspondent à l’empreinte globale du modèle ; les paramètres actifs désignent la partie effectivement sollicitée lors d’un calcul donné.
Le point clé : le fameux 6 % concerne le pré-entraînement. Baidu affirme qu’ERNIE 5.1 utilise environ 6 % du coût de pré-entraînement de modèles comparables . Cela ne signifie pas, d’après les éléments disponibles, que le chiffre couvre automatiquement tout le coût de développement, le post-entraînement, le déploiement, l’inférence, l’efficacité matérielle ou les prix commerciaux.
L’argument de Baidu repose sur plusieurs briques techniques et stratégiques.
La première économie vient de l’héritage. En s’appuyant sur la base de pré-entraînement d’ERNIE 5.0, ERNIE 5.1 est présenté comme une évolution issue d’un socle existant, plutôt qu’un modèle repartirait de zéro avec un budget complet de pré-entraînement .
C’est ce qui rend la revendication intéressante : le gain ne viendrait pas seulement d’un meilleur matériel ou d’un réglage marginal, mais d’une manière différente d’exploiter un modèle déjà entraîné.
Baidu affirme avoir compressé les paramètres totaux à environ un tiers et les paramètres actifs à environ la moitié . La distinction est importante : réduire les paramètres totaux peut alléger le modèle dans son ensemble, tandis que réduire les paramètres actifs peut limiter la quantité de calcul mobilisée à chaque usage.
C’est pour cela qu’ERNIE 5.1 doit être lu comme une annonce d’efficacité. Baidu ne dit pas seulement : le modèle sait faire davantage. Il dit aussi : il le fait avec une structure plus légère.
Le rapport technique d’ERNIE 5.0 décrit un paradigme d’« entraînement élastique » permettant à une seule phase de pré-entraînement de produire une famille de modèles avec différents compromis entre capacité et efficacité . Le rapport explique que cette approche échantillonne dynamiquement des sous-modèles de profondeur, de largeur et de parcimonie de routage variables, puis permet à ces sous-modèles d’hériter des connaissances du modèle complet pour les étapes ultérieures de post-entraînement .
Cela éclaire la logique derrière ERNIE 5.1 : l’idée n’est pas simplement d’entraîner toujours plus gros, mais de construire un socle flexible dont on peut dériver des configurations plus efficaces .
Baidu met aussi en avant un apprentissage par renforcement entièrement asynchrone et désagrégé, ainsi qu’un post-entraînement agentique à grande échelle, pour renforcer les capacités d’agent, de raisonnement et de création d’ERNIE 5.1 .
En clair, la promesse n’est pas seulement de réduire la taille. Baidu affirme aussi que le travail effectué après le pré-entraînement contribue au profil final du modèle . Le blog de Baidu indique par ailleurs qu’ERNIE 5.1 s’est classé premier en Chine sur l’Arena Search Arena .
Si l’approche tient dans la pratique, elle déplace le centre de gravité de la course à l’IA. L’avantage ne serait plus seulement d’avoir le plus grand modèle ou le plus gros entraînement initial, mais de savoir recycler un socle, choisir les bonnes sous-architectures, réduire le calcul actif et améliorer les comportements par post-entraînement.
C’est ce qui rend ERNIE 5.1 stratégique. Baidu affirme explicitement qu’un modèle plus compact peut conserver des performances de base de premier plan à son échelle, avec un coût de pré-entraînement très réduit . Dans un secteur où les coûts de calcul sont devenus un sujet central, ce récit d’efficacité est aussi important que les résultats eux-mêmes.
Le principal point faible est la vérification. Les documents publics cités ne donnent pas un décompte complet du budget d’entraînement, du matériel utilisé, du mélange de données, de la durée d’entraînement, du taux d’utilisation des accélérateurs, du coût de post-entraînement ni de la liste exacte des « modèles comparables » utilisés pour arriver au chiffre de 6 % .
Cela ne rend pas l’annonce sans intérêt. Mais cela empêche de traiter ce 6 % comme un standard industriel confirmé de façon indépendante.
ERNIE 5.1 compte parce qu’il reformule le progrès en IA autour du rapport coût-performance. Baidu affirme que le modèle hérite d’ERNIE 5.0, réduit fortement ses paramètres et atteint des performances de base de premier plan à son échelle avec environ 6 % du coût de pré-entraînement de modèles comparables .
La lecture la plus solide est donc la suivante : ERNIE 5.1 est une revendication sérieuse d’efficacité, appuyée par une logique de réutilisation, de compression, d’entraînement élastique et de post-entraînement . Mais tant que les bases de comparaison et la comptabilité détaillée ne sont pas rendues plus transparentes, ce n’est pas encore une preuve définitive que Baidu a fixé un nouveau benchmark de coût pour toute l’industrie.