Liquid AI lance LFM2.5 2.6B, un modèle compact à 2,6 milliards de paramètres (2,69B au total), conçu pour exécuter des workflows d'agents IA directement sur l'appareil, sans recours au cloud. Avec une empreinte mémoire inférieure à 2,5 Go, il atteint 220 tokens/s sur un Apple M5 Max, 113 tokens/s sur un AMD Ryzen AI...

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI's LFM2.5-2.6B model — its release date, parameter count, key design focus on agentic workflows (including planning, tool c. Article summary: Here is a comprehensive breakdown of Liquid AI's **LFM2.5-2.6B** model.. Topic tags: general, academic, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
Liquid AI a dévoilé le 4 août 2026 le LFM2.5-2.6B, un modèle de langage compact et ouvert conçu pour faire tourner des workflows d'agents IA directement sur votre appareil — plus besoin d'aller chercher le cloud à chaque requête . Avec ses 2,69 milliards de paramètres au total et une empreinte mémoire inférieure à 2,5 Go, il devient envisageable sur un simple laptop, un serveur en périphérie, voire un smartphone
.
Le LFM2.5-2.6B a été lancé le 4 août 2026 . C'est un modèle dense de 2,69B paramètres avec 30 couches : 22 blocs de convolution courte à double porte et 8 couches d'attention à requêtes groupées (GQA), le tout reposant sur l'architecture hybride LFM2
.
L'objectif est clair : exécuter des workflows d'agents entièrement sur l'appareil — planifier, appeler des outils, faire des recherches web et réaliser des tâches en plusieurs étapes — sans que les données ne quittent jamais le terminal et sans coût d'inférence marginal . Le modèle intègre nativement l'appel d'outils et a été entraîné à fonctionner de manière fiable dans des environnements agents réels comme Hermes Agent, OpenClaw et Pi
.
Le LFM2.5-2.6B fonctionne dans moins de 2,5 Go de mémoire . Les vitesses de décodage suivantes sont celles fournies par Liquid AI :
| Matériel | Vitesse de décodage |
|---|---|
| Apple M5 Max | 220 tokens/s |
| AMD Ryzen AI Max+ 395 | 113 tokens/s |
| Smartphones | ~30 tokens/s |
| Un seul Nvidia H100 (haute concurrence) | ~15 000 tokens/s |
Le modèle prend en charge llama.cpp (GGUF), MLX (Apple Silicon), vLLM, SGLang, ONNX et la bibliothèque standard Transformers .
Téléchargement open-weight sur Hugging Face à l'adresse LiquidAI/LFM2.5-2.6B, avec des dépôts séparés pour les formats quantifiés GGUF, MLX et ONNX . Sous licence LFM1.0 open-weight
.
Liquid AI a été fondée en 2023 en tant que spin-off du MIT CSAIL par Ramin Hasani (CEO), Mathias Lechner (CTO), Alexander Amini (CSO) et Daniela Rus (professeure au MIT et directrice du CSAIL) . La technologie de l'entreprise est née des recherches sur les réseaux de neurones liquides au MIT
.
Le LFM2.5-2.6B est déconseillé pour le codage agentique ou les tâches lourdes en connaissances. Sur les benchmarks de code, des modèles plus gros (comme Qwen3.5-9B) gardent l'avantage, et la fiche officielle sur Hugging Face déconseille son utilisation pour ces besoins . Pour du codage agentique complexe ou de la recherche approfondie de connaissances, les modèles plus gros restent préférables
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Liquid AI lance LFM2.5 2.6B, un modèle compact à 2,6 milliards de paramètres (2,69B au total), conçu pour exécuter des workflows d'agents IA directement sur l'appareil, sans recours au cloud.
Liquid AI lance LFM2.5 2.6B, un modèle compact à 2,6 milliards de paramètres (2,69B au total), conçu pour exécuter des workflows d'agents IA directement sur l'appareil, sans recours au cloud. Avec une empreinte mémoire inférieure à 2,5 Go, il atteint 220 tokens/s sur un Apple M5 Max, 113 tokens/s sur un AMD Ryzen AI Max+ 395 et environ 30 tokens/s sur smartphone.
Le modèle a été pré entraîné sur environ 34 000 milliards de tokens avec un contexte de 128K tokens, et bénéficie d'un pipeline de post entraînement en quatre étapes incluant de l'apprentissage par renforcement agenti...