La distillation fonctionne de la manière suivante : au lieu de copier le modèle lui-même, les chercheurs envoient des requêtes à un modèle « enseignant » puissant via son API publique, collectent les réponses (questions et réponses) et utilisent ces paires pour entraîner un modèle « étudiant » plus petit et moins coûteux. L'étudiant apprend ainsi à imiter le raisonnement et les capacités de l'enseignant . Pour des applications militaires, cela permet un déploiement sur du matériel local sans nécessiter l'infrastructure de calcul massive nécessaire à la construction de modèles de pointe à partir de zéro .
Les articles et brevets examinés par Reuters, en collaboration avec la Jamestown Foundation basée à Washington, montrent que la distillation est utilisée pour une gamme de systèmes d'IA liés à la défense :
Un article de l'Unité 96904 de l'APL (Armée Populaire de Libération) décrit explicitement la distillation de modèles américains pour créer des versions « plus petites et plus sécurisées » adaptées aux applications de défense . Un autre article de l'Unité 96941 de l'APL — une unité de guerre électronique et de renseignement militaire à Pékin — décrit l'utilisation de GPT-3.5 d'OpenAI pour traiter du code source militaire sensible . Un article de 2024 de l'Université Nationale de Technologie de la Défense de l'APL utilise la distillation pour réduire la taille d'un modèle de traitement d'images destiné à être déployé sur du matériel militaire aux ressources limitées .
L'avantage stratégique principal de la distillation est économique. Entraîner un modèle d'IA de pointe à partir de zéro coûte des milliards de dollars et nécessite des années de recherche et développement, des ensembles de données massifs et l'accès à des puces semi-conductrices avancées. La distillation permet aux chercheurs chinois de contourner la quasi-totalité de cet investissement .
En interrogeant les modèles de pointe via API — en créant des comptes frauduleux et en utilisant des réseaux de proxy pour contourner les limites de débit — les développeurs chinois peuvent extraire les mêmes capacités à une fraction du coût. L'enquête d'Anthropic a identifié plus de 16 millions d'échanges générés via environ 24 000 comptes frauduleux ciblant les capacités de raisonnement agentique, d'utilisation d'outils et de codage de Claude. Le développeur chinois MiniMax était à lui seul responsable de plus de 13 millions de ces échanges .
Ces preuves ont déclenché une série d'accusations et de réponses politiques :
Malgré son efficacité comme raccourci, la distillation de modèles comporte des limitations techniques inhérentes qui importent pour les applications militaires :
La combinaison du vol de capacités et de la dégradation de la sécurité crée une dynamique dangereuse :
La guerre de distillation en cours accélère le découplage entre les États-Unis et la Chine dans l'IA sur plusieurs fronts . Des contrôles d'exportation plus stricts sur les puces avancées, des restrictions d'accès aux API, des exigences KYC pour les comptes développeurs et d'éventuelles sanctions financières sont tous sur la table .
Le risque stratégique central est clair : la distillation permet à l'armée chinoise de parasiter efficacement l'investissement américain dans l'IA pour des applications de défense à une fraction du coût, tandis que la dégradation de la sécurité inhérente au processus pourrait produire des systèmes d'IA militaires moins contraints et plus dangereux.