Цена за токен — обманчивый показатель. Бенчмарк показал, что цена модели за токен не является надёжным предсказателем реальной общей стоимости в агентных рабочих процессах. Более крупные модели могут быть гораздо эффективнее по числу токенов: модель с низкой ценой за токен может в итоге стоить дороже, если ей требуется больше токенов для выполнения той же задачи. Это заставило Databricks оценивать модели по реальной стоимости выполнения задачи целиком, а не по сырым тарифам API .
Совокупная стоимость владения оказалась в пользу GLM 5.2. Через API Z.ai GLM 5.2 стоит примерно $1.40 за миллион входящих токенов и $4.40 за миллион исходящих . Для команды, обрабатывающей 10 миллионов токенов в месяц при соотношении ввода/вывода 50/50, общая сумма составит около $29 в месяц
. Конкурирующие модели, такие как Anthropic Opus 4.8 ($5/$25 за миллион токенов), могут обходиться в 3–6 раз дороже при сопоставимых или незначительно лучших результатах бенчмарков
. В пересчёте на задачу один из тестов Databricks показал, что GLM 5.2 с агентом Pi достигает уровня успешности 87.5% при стоимости $1.25 за задачу, тогда как Opus 4.8 с высокими затратами усилий через Claude Code достигает сопоставимого уровня успешности при $2.00 за задачу
.
Производительность на уровне топовых моделей при гораздо более низкой стоимости. GLM 5.2 набрала 62.1 балла на SWE-bench Pro, превзойдя GPT-5.5 (58.6) и приблизившись к Anthropic Opus 4.8 . На FrontierSWE Dominance модель показала 74.4%, почти сравнявшись с 75.1% у Opus 4.8
. Внутренние тесты Databricks подтвердили эти публичные результаты: китайская open-weight модель сравнялась или приблизилась по возможностям к ведущим проприетарным моделям на тех же реальных инженерных задачах
.
Гибкость развёртывания благодаря MIT-лицензии. GLM 5.2 имеет MIT-лицензию и полностью открытые веса, что позволило Databricks развернуть её на собственных серверах, дообучить и плотно интегрировать в свой агентный рабочий процесс кодинга без лицензионных отчислений за каждое рабочее место или привязки к вендору . Эта лицензионная модель позволяет предприятиям запускать модель на собственной инфраструктуре, избегая постоянных затрат на API при высоких объёмах использования.
Пригодность для многошаговых задач с длинным горизонтом. Бенчмарк был сосредоточен на агентных правках кода, затрагивающих множество файлов и шагов рассуждения. GLM 5.2 с контекстным окном в 1 миллион токенов и архитектурой смеси экспертов (MoE) на 744 миллиарда параметров была специально оптимизирована для такой репозиторий-масштабной, длительной работы, а не для автодополнения одного файла . На Terminal-Bench 2.1, который тестирует выполнение командной строки и агентных задач, модель набрала 81.0 балл, став самой сильной open-source моделью и уступив только Claude Opus 4.8 (85.0)
.