Gartner прогнозирует рост стоимости инференса одного агентного воркфлоу более чем в пять раз к 2028 году, хотя цены на токены могут снизиться на 95% к 2030 му. ИИ агенты расходуют в 5–30 раз больше токенов, чем обычные чат боты: они планируют действия, вызывают инструменты, проверяют результаты и исправляют ошибки.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Gartner’s “inference paradox” regarding the future cost of AI agents, including its prediction that inference costs per agentic work. Article summary: Gartner’s “inference paradox” is that cheaper AI tokens do not necessarily make autonomous AI cheaper to operate. It forecasts that inference cost per agentic workflow will rise more than fivefold by the end of 2028 even. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Дешевые токены не означают автоматически дешевый автономный ИИ. Так называемый «парадокс инференса» Gartner описывает ситуацию, в которой стоимость инференса одного агентного воркфлоу к концу 2028 года может вырасти более чем в пять раз, даже если цена токенов к 2030 году снизится на 95%. Причина в том, что ИИ-агент выполняет для достижения результата намного больше вычислительной работы, чем обычный чат-бот.
Обычный чат-бот чаще всего получает запрос и формирует один ответ. Агентная система действует иначе: она разбивает задачу на этапы, составляет план, выбирает инструменты, извлекает данные, анализирует результаты, проверяет работу, исправляет ошибки и решает, что делать дальше.
Поэтому важна не только цена отдельного токена. Имеет значение, сколько токенов и обращений к модели требуется для достижения полезного бизнес-результата. Падение цен может даже стимулировать компании использовать более мощные модели рассуждений и создавать более длинные, автономные сценарии. Экономия на единице расчета в таком случае не успевает за ростом объема вычислений.
Прогноз Gartner относится к стоимости инференса на один завершенный воркфлоу, а не просто к тарифу за токен. Инференс включает вычисления, необходимые для получения итогового результата, в том числе повторяющиеся обращения к модели в рамках одного процесса.
Агентные системы добавляют вычислительную нагрузку сразу на нескольких уровнях:
По мере накопления контекста последующие обращения могут содержать все больше предыдущей информации. Более мощные модели рассуждений также способны использовать значительно больше токенов и вычислительных ресурсов, проходя через несколько последовательных решений. Согласно публикациям с пересказом анализа Gartner, для выполнения сопоставимых задач агентам может требоваться в 5–30 раз больше токенов, чем чат-ботам, хотя точный показатель зависит от сценария и настроек модели.
Эти факторы усиливают друг друга: воркфлоу одновременно использует больше вызовов, более длинный контекст и более дорогие модели. Поэтому стоимость определяется не только тарифом за токен, а сочетанием четырех переменных: цены токена, его объема, выбранной модели и структуры процесса.
Модель Tokenomics Gartner рассматривает работу ИИ как последовательность сценариев разной сложности, а не как единый стандартный «запрос». В открытых публикациях эта шкала описывается следующим образом:
Публичные материалы подтверждают направление этой шкалы и главный порог: передача задачи агентной модели рассуждений может увеличить стоимость инференса как минимум в пять раз по сравнению с базовым чат-ботом. При дальнейшем усложнении задачи расходы могут расти еще сильнее. При этом надежных публичных коэффициентов отдельно для базового выполнения, планирования, обучения и продвинутого рассуждения нет. Поэтому такие множители не следует выдавать за официальные бенчмарки Gartner.
Нет. Парадокс не означает, что прогресс в аппаратном обеспечении, архитектуре моделей или экономике токенов остановился. Он показывает другой эффект: повышение эффективности делает более мощные системы доступными для большего числа задач.
Когда передовые модели дешевеют, компании могут запускать сценарии, которые раньше были слишком дорогими. Они также могут наделять агентов большей автономностью, подключать больше инструментов, увеличивать контекст и давать им больше времени на рассуждение. Все это повышает объем инференса для каждого завершенного задания. В логике Gartner рост возможностей и использования может опережать снижение стоимости одной операции.
Для планирования ИИ-продуктов это принципиальное различие. Более низкая цена токена улучшает экономику фиксированной нагрузки. Но она не гарантирует снижения стоимости бизнес-результата, если сама нагрузка постоянно усложняется.
Сложность модели должна соответствовать сложности задачи. Детерминированные операции, поиск, классификацию и другие низкорисковые процессы можно направлять небольшим или более дешевым моделям. Передовые модели рассуждений стоит оставлять для тех этапов, где тестирование показывает ощутимое улучшение результата, оправдывающее дополнительные расходы. Среди рекомендаций Gartner называются многоуровневая маршрутизация, лимиты токенов и мониторинг.
Нужно заранее контролировать параметры, из-за которых агент может выйти за пределы бюджета:
Кэширование стабильных результатов, сокращение или суммирование истории, структурированные ответы инструментов и передача исключительных случаев сотруднику помогают уменьшить число лишних вызовов, не отказываясь от автономности там, где она действительно создает ценность.
Цена токена и стоимость одного обращения к агенту — неполные показатели. Компаниям следует измерять стоимость завершенного результата: например, закрытого обращения, одобренной заявки, квалифицированного лида или выполненной инженерной задачи. Одновременно нужно отслеживать качество, задержку, долю ошибок и объем участия человека.
До запуска пилота полезно зафиксировать базовый процесс и минимально приемлемый уровень качества. Только после этого можно оценивать, создает ли агент достаточную ценность для масштабирования. Если система экономит токены, но не обеспечивает более быстрый или качественный результат, такая эффективность может оказаться лишь видимостью.
Тарификация по фактическому потреблению создает риск неожиданных расходов, когда воркфлоу становится рекурсивным, длительным или чрезмерно автономным. Бюджетные ограничения, квоты на отдельные процессы, мониторинг стоимости в реальном времени, уведомления и механизмы распределения расходов между подразделениями позволяют увидеть проблему до масштабного запуска.
Экономика моделей не остается неизменной. Воркфлоу, построенный на дорогой передовой модели, со временем может быть переведен на более дешевую модель с достаточными возможностями, дообученную или дистиллированную версию либо на обычную автоматизацию. Поэтому следует регулярно оценивать связку «модель плюс процесс», а не считать сегодняшнюю архитектуру постоянной.
Gartner прогнозирует, что к концу 2027 года будет отменено более 40% проектов в области агентного ИИ из-за роста расходов, неясной бизнес-ценности или недостаточного контроля рисков. Это предупреждение против масштабирования автономности до того, как компания поймет ее экономику и правила управления, а не утверждение, что любой проект с агентами обречен на провал.
Хорошо оптимизированная система по-прежнему может окупаться, если она ускоряет или заменяет ценный и повторяемый процесс. Практический критерий прост: дополнительная ценность от рассуждения, координации и автономности должна быть выше дополнительных расходов на инференс и эксплуатацию.
Надежнее всего исходить из того, что цена токенов и общая стоимость работы агентов могут двигаться в противоположных направлениях. Токен — лишь одна строка в бюджете. Нужно моделировать весь воркфлоу, выбирать наименее мощную конфигурацию, которая соответствует целевому качеству, вводить операционные лимиты и расширять автономность только после появления производственных данных о реальном улучшении конкретного бизнес-результата.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Gartner прогнозирует рост стоимости инференса одного агентного воркфлоу более чем в пять раз к 2028 году, хотя цены на токены могут снизиться на 95% к 2030 му.
Gartner прогнозирует рост стоимости инференса одного агентного воркфлоу более чем в пять раз к 2028 году, хотя цены на токены могут снизиться на 95% к 2030 му. ИИ агенты расходуют в 5–30 раз больше токенов, чем обычные чат боты: они планируют действия, вызывают инструменты, проверяют результаты и исправляют ошибки.
Компаниям стоит направлять простые задачи дешевым моделям, ограничивать сложность воркфлоу и считать стоимость завершенного бизнес результата, а не только цену токена.