美團表示,LongCat-2.0 嘅效能 可以媲美 Google 嘅 Gemini 3.1 Pro 。喺正式公布之前,呢個模型一直以匿名身份 「Owl Alpha」 喺 OpenRouter 平台上畀開發者測試,據報佢喺編程基準測試中佔據咗開發者排名嘅榜首
。
LongCat 團隊喺 X(前稱 Twitter)上公布嘅關鍵基準測試成績包括:Terminal-Bench 2.1:70.8 分;SWE-bench Pro:59.5 分(作為對比,GPT-5.5 係 58.6 分);SWE-bench Multilingual:77.3 分;FORTE:73.2 分 。
LongCat-2.0 嘅影響遠遠超出基準測試分數本身:
LongCat-2.0 喺上一代 LongCat-Flash 嘅基礎上,引入咗兩項關鍵改進:
開發者同研究人員可以喺寬鬆嘅 MIT 授權下存取 LongCat-2.0。模型權重、推理程式碼同相關文件已經上載到 GitHub、Hugging Face 同 LongCat 官方網站。另外,官方亦提供咗 API 端點同互動式網上體驗版畀大家試用 。