LFM2.5-2.6B è stato rilasciato il 4 agosto 2026 . Si tratta di un modello denso con 2,69 miliardi di parametri e 30 strati: 22 blocchi a doppia convoluzione con gate e 8 strati di attenzione a query raggruppata (GQA), basato sull'architettura ibrida LFM2 .
Il modello è stato costruito per eseguire flussi di lavoro agentici interamente sul dispositivo — pianificazione, chiamata di strumenti, ricerca sul web ed esecuzione di attività multi-step — con i dati che non lasciano mai il dispositivo e un costo di inferenza marginale pari a zero . Supporta la chiamata nativa di strumenti ed è stato addestrato per funzionare in modo affidabile all'interno di ambienti agentici reali come Hermes Agent, OpenClaw e Pi .
LFM2.5-2.6B funziona in meno di 2,5 GB di memoria . Le seguenti velocità di decodifica sono dati forniti da Liquid AI:
| Hardware | Velocità di decodifica |
|---|---|
| Apple M5 Max | 220 token/s |
| AMD Ryzen AI Max+ 395 | 113 token/s |
| Smartphone | ~30 token/s |
| Singola Nvidia H100 (alta concorrenza) | ~15.000 token/s |
Il modello supporta llama.cpp (GGUF), MLX (Apple Silicon), vLLM, SGLang, ONNX e i classici Transformers .
Scaricabile con pesi aperti su Hugging Face all'indirizzo LiquidAI/LFM2.5-2.6B, con repository separati per i formati quantizzati GGUF, MLX e ONNX . La licenza è la LFM1.0 open-weight .
Liquid AI è stata fondata nel 2023 come spin-off del MIT CSAIL da Ramin Hasani (CEO), Mathias Lechner (CTO), Alexander Amini (CSO) e Daniela Rus (professoressa del MIT e direttrice del CSAIL) . La tecnologia dell'azienda si basa sulla ricerca sulle reti neurali liquide condotta al MIT .
LFM2.5-2.6B non è raccomandato per attività di coding agentico o compiti che richiedono molte conoscenze. Nei benchmark di programmazione, modelli più grandi (ad esempio Qwen3.5-9B) mantengono un vantaggio, e la scheda ufficiale su Hugging Face sconsiglia di usarlo per questi carichi di lavoro . Per attività complesse di coding agentico o recupero approfondito di conoscenze, sono ancora preferibili modelli più grandi .