Текущие свидетельства удобно разделить на три уровня.
exchange-core, сделала более 1 000 вызовов инструментов и изменила более 4 000 строк кода.Если совсем коротко: кейс есть, но уровень проверки пока недостаточный.
Kimi K2.6 не представляют просто как очередной чат-бот. Microsoft Foundry помещает модель в категорию agentic, multimodal models и пишет, что она рассчитана на долгий горизонт рассуждений, программирование и автономное выполнение задач.
SiliconFlow называет Kimi K2.6 open-source мультимодальной моделью и подчёркивает long-horizon coding, autonomous agent orchestration и coding-driven design. Там же приведены бенчмарк-цифры: 58,6 в SWE-Bench Pro и 86,3 в BrowseComp Agent Swarm. Ollama описывает Kimi K2.6 как open-source native multimodal agentic model с упором на long-horizon coding, coding-driven design, proactive autonomous execution и swarm-based task orchestration.
Этого достаточно для осторожного вывода: Kimi K2.6 действительно нацелена на роль долгоживущего coding-агента. Но продуктовая формулировка и бенчмарки сами по себе не доказывают, что модель можно без присмотра запускать на любом реальном проекте на всю ночь и ожидать готовый, качественный merge-ready код.
Самая прямая публичная зацепка — объявление на Kimi Forum. В разделе про long-horizon coding там указаны 4 000+ вызовов инструментов, более 12 часов непрерывного выполнения и обобщение на разные языки, включая Rust, Go и Python.
Более конкретная 13-часовая история связана с exchange-core. DEV Community пишет, что, согласно релизному блогу Moonshot, Kimi K2.6 потратила 13 часов на переписывание частей open-source matching engine exchange-core, сделала более 1 000 вызовов инструментов, изменила более 4 000 строк кода и добилась заявленного прироста пропускной способности без участия человека. The Neuron также упоминает 13-часовой прогон, в котором K2.6 переработала exchange-core и запустила более 1 000 вызовов инструментов. Пост аккаунта Kimi_Moonshot в X говорит о 13-часовом выполнении, 12 стратегиях оптимизации и более чем 1 000 tool calls.
Поэтому точная формулировка такая: «13 часов» — не случайный слух, а публично заявленный кейс. Но это ещё не инженерное доказательство, которое внешний читатель может полностью восстановить, перезапустить и проверить.
Чтобы превратить демонстрационный кейс в доказанную способность, нужны артефакты, которые обычно позволяют воспроизвести результат:
Пока в открытом доступе видны в основном краткие числа и описания: длительность выполнения, количество tool calls, объём правок и сюжет вокруг exchange-core. Это помогает понять, откуда взялось утверждение, но не доказывает устойчивость, переносимость на другие проекты и надёжность автономной работы без человека.
Даже если сама модель лучше планирует и вызывает инструменты, долгоживущий coding-agent — это не только LLM. Это ещё инфраструктура: агентный фреймворк, интерфейсы инструментов, состояние между шагами, восстановление после ошибок, тестирование, мониторинг и ограничения окружения.
VentureBeat, обсуждая Kimi K2.6 и долгоживущих агентов, отмечает, что многие orchestration frameworks изначально проектировались для агентов, работающих секунды или минуты; длительные агенты вскрывают ограничения enterprise orchestration и управления состоянием.
Иначе говоря, вопрос «может ли Kimi K2.6 работать 13 часов» нельзя свести только к весам модели. Важны обвязка, права доступа, тестовый контур и то, как система переживает ошибки. Cloudflare сообщает, что Moonshot AI Kimi K2.6 доступна в Workers AI; Microsoft Foundry, SiliconFlow и Ollama также имеют страницы или точки доступа для K2.6. Это показывает, что модель становится доступнее разработчикам, но размещение на платформах не равно независимой проверке 13-часовой автономной разработки.
Более корректные формулировки:
exchange-core: в пересказах фигурируют 13 часов, более 1 000 вызовов инструментов и более 4 000 изменённых строк кода.А вот так лучше не писать:
Kimi K2.6 и утверждение про «13 часов кода» не стоит сразу объявлять фейком. Публичные источники действительно указывают на 12–13-часовой long-horizon coding-кейс, а сама модель явно продвигается как инструмент для агентного программирования и автономного выполнения задач.
Но более сильное утверждение — что Kimi K2.6 уже независимо доказала способность стабильно и без присмотра работать 13 часов в обычных реальных проектах — пока не подтверждено. Практичный вывод: можно воспринимать K2.6 как серьёзную заявку на долгоживущего coding-агента, но нельзя превращать «13 часов» в гарантированное обещание продуктивности.