美团声称LongCat-2.0的性能可与谷歌的Gemini 3.1 Pro相媲美 。在正式亮相之前,该模型以匿名身份“Owl Alpha”在OpenRouter上运行,据称其在编码基准测试中位居开发者排行榜首位
。
LongCat团队在X(原Twitter)上发布的关键基准测试分数包括:Terminal-Bench 2.1: 70.8,SWE-bench Pro: 59.5(作为对比,GPT-5.5为58.6),SWE-bench Multilingual: 77.3,以及FORTE: 73.2 。
LongCat-2.0的意义远不止于基准测试分数:
相比前代LongCat-Flash,LongCat-2.0引入了两项显著的架构改进:
开发者和研究人员可以在宽松的MIT许可证下获取LongCat-2.0。模型权重、推理代码和文档已在GitHub、Hugging Face和LongCat官方网站上提供。同时还提供了API接口和在线交互演示 。