Le LFM2.5-2.6B a été lancé le 4 août 2026 . C'est un modèle dense de 2,69B paramètres avec 30 couches : 22 blocs de convolution courte à double porte et 8 couches d'attention à requêtes groupées (GQA), le tout reposant sur l'architecture hybride LFM2 .
L'objectif est clair : exécuter des workflows d'agents entièrement sur l'appareil — planifier, appeler des outils, faire des recherches web et réaliser des tâches en plusieurs étapes — sans que les données ne quittent jamais le terminal et sans coût d'inférence marginal . Le modèle intègre nativement l'appel d'outils et a été entraîné à fonctionner de manière fiable dans des environnements agents réels comme Hermes Agent, OpenClaw et Pi .
Le LFM2.5-2.6B fonctionne dans moins de 2,5 Go de mémoire . Les vitesses de décodage suivantes sont celles fournies par Liquid AI :
| Matériel | Vitesse de décodage |
|---|---|
| Apple M5 Max | 220 tokens/s |
| AMD Ryzen AI Max+ 395 | 113 tokens/s |
| Smartphones | ~30 tokens/s |
| Un seul Nvidia H100 (haute concurrence) | ~15 000 tokens/s |
Le modèle prend en charge llama.cpp (GGUF), MLX (Apple Silicon), vLLM, SGLang, ONNX et la bibliothèque standard Transformers .
Téléchargement open-weight sur Hugging Face à l'adresse LiquidAI/LFM2.5-2.6B, avec des dépôts séparés pour les formats quantifiés GGUF, MLX et ONNX . Sous licence LFM1.0 open-weight .
Liquid AI a été fondée en 2023 en tant que spin-off du MIT CSAIL par Ramin Hasani (CEO), Mathias Lechner (CTO), Alexander Amini (CSO) et Daniela Rus (professeure au MIT et directrice du CSAIL) . La technologie de l'entreprise est née des recherches sur les réseaux de neurones liquides au MIT .
Le LFM2.5-2.6B est déconseillé pour le codage agentique ou les tâches lourdes en connaissances. Sur les benchmarks de code, des modèles plus gros (comme Qwen3.5-9B) gardent l'avantage, et la fiche officielle sur Hugging Face déconseille son utilisation pour ces besoins . Pour du codage agentique complexe ou de la recherche approfondie de connaissances, les modèles plus gros restent préférables .