| Модель | Тип токена | Прежняя ставка | Непик (новый) | Пик (новый) | Эффективное изменение |
|---|---|---|---|---|---|
| V4-Flash | Ввод (cache miss) | $0,14 | $0,21 | $0,42 | +50% непик, +200% пик |
| V4-Flash | Ввод (cache hit) | $0,0028 | $0,007 | $0,014 | +150% непик, +400% пик |
| V4-Flash | Вывод | $0,28 | $0,42 | $0,84 | +50% непик, +200% пик |
| V4-Pro | Ввод (cache miss) | $0,435 | $0,99 | $1,98 | +128% непик, +355% пик |
| V4-Pro | Ввод (cache hit) | $0,003625 | $0,03 | $0,06 | +728% непик, +1555% пик |
| V4-Pro | Вывод | $0,87 | $1,98 | $3,96 | +128% непик, +355% пик |
Самое резкое повышение — V4-Pro cache-hit input: с $0,003625 до $0,06 в пике — рост примерно на 1555% . В DeepSeek заявили, что изменения нужны для более эффективного распределения ресурсов и стимулирования пользователей переносить несрочные задачи на непиковые окна
.
В августе 2026 года независимая тестовая компания Composio оценила DeepSeek V4 Flash в восьми различных агентских оркестрационных фреймворках на 30 намеренно сложных многошаговых рабочих процессах с использованием живых инструментов: Gmail, GitHub, Slack и Google Sheets . На каждую задачу отводилось 900 секунд, все фреймворки использовали одни и те же размещённые инструменты Composio MCP
.
Общий результат: из 240 запусков успешными были только 129 — общий процент прохождения 53,8%. Лишь 6 из 30 рабочих процессов были успешно выполнены каждым фреймворком .
| Фреймворк | Процент прохождения (из 30 задач) | Стоимость за успешную задачу |
|---|---|---|
| Pi Agent | 20/30 (66,7%) | $0,028 |
| Prime Agent | ~15/24 (62,5% валидных запусков) | $0,131 |
| OMP (Oh My Pi) | 17/30 (56,7%) | $0,103 |
| Claude Code | 16/30 (53,3%) | $0,195 |
| Codex | 16/30 (53,3%) | $0,081 |
| Deep Agents (LangChain) | 16/30 (53,3%) | $0,045 |
| Hermes Agent | 15/30 (50,0%) | $0,056 |
| OpenCode | 14/30 (46,7%) | $0,067 |
Pi Agent лидировал как по проценту успеха (20/30), так и по экономической эффективности ($0,028/задача) . Разные фреймворки выигрывали по разным метрикам — успешность, стоимость и скорость, — что означает: выбор оркестрации важен не меньше, чем возможности самой модели
. Разрыв в 20 процентных пунктов между лучшим и худшим фреймворками демонстрирует крайнюю чувствительность к среде выполнения, настройкам инструментов, кэшированию, повторам и стеку провайдера
.
Сочетание более высоких цен и нестабильных реальных результатов заставило аналитиков пересмотреть пригодность DeepSeek V4 для бизнеса.
VentureBeat отметила, что одна и та же модель V4 Flash показывала существенно разные результаты в зависимости от фреймворка, набора инструментов и стека кэширования — это означает, что предприятиям необходимо инвестировать в зрелость оркестрации наравне с выбором модели . Комментарии Composio указали, что только выбор фреймворка менял успешность на три задачи, стоимость — почти в 3 раза, а скорость — в 2,2 раза
.
Даже в непиковые часы каждый тип токена стал дороже. Аналитики говорят, что это меняет расчёт ROI для высоконагруженных агентских задач, особенно для чат-ботов поддержки клиентов и пайплайнов генерации кода, которые ранее полагались на агрессивно низкие цены DeepSeek .
Официальные агентские бенчмарки DeepSeek (82,7 на Terminal-Bench 2.1, 70,3 на Toolathlon-Verified) выглядят впечатляюще, но реальный показатель 53,8% напоминает, что места в таблицах лидеров не гарантируют надёжности в продукционных средах с живыми API, лимитами запросов и состоянием рабочих процессов .
Трафик API проходит через серверы в Китае, что создаёт проблемы соответствия для регулируемых предприятий. Аналитики советуют тщательное архитектурное планирование для управления данными, аудиторских следов и контроля разрешений инструментов . Для регулируемых отраслей единственный жизнеспособный путь к продукционной эксплуатации — саморазмещение открытых весов
.