Gartner вказує на два процеси, які накладаються один на одного .
Навіть якщо ціна окремого токена знижується, загальне споживання може зростати значно швидше. Gartner також зазначає, що витрати на AI coding надалі тиснутимуть на бюджети через інвестиції в інфраструктуру та проблеми з прибутковістю моделей .
Найдетальніше задокументований приклад — Uber. Компанія вичерпала весь бюджет на AI coding на 2026 рік уже до квітня . Після цього Uber встановила для працівників ліміт у 1 500 доларів на місяць для кожного coding-інструмента, зокрема Claude Code від Anthropic і Cursor . Ліміти діють окремо для кожного сервісу: витрати на один інструмент не впливають на бюджет іншого .
Масштаб використання також зростав дуже швидко. До березня 2026 року Claude Code використовували 84% інженерів Uber, тоді як наприкінці 2025-го — 32% . До запровадження обмежень щомісячні витрати на одного інженера становили приблизно 500–2 000 доларів .
Операційний директор Uber заявив, що «зв’язок між витратами на ШІ та цінністю для клієнта поки що не простежується» . Ця фраза добре ілюструє головну проблему корпоративного ШІ: активніше використання інструмента ще не означає пропорційно більшу користь для бізнесу.
Окремий урок дає Accenture. За даними витоку аудіозапису та публікацій у медіа, найбільше токенів витрачали не інженери, а працівники інших підрозділів, які використовували ШІ для перетворення PDF-файлів на презентації . Компанія планує запустити продукт Token IQ, щоб керівництво могло оцінювати, чи відповідають витрати на ШІ отриманій віддачі .
Цей випадок важливий тим, що неконтрольоване споживання виникає не лише під час написання коду. Будь-який масовий робочий процес із великими файлами, довгим контекстом або численними повторними запитами може швидко збільшити рахунок.
Оплата за токени ускладнює фінансовий контроль. Традиційного щомісячного платежу за ліцензію вже недостатньо, адже витрати залежать від моделі, довжини контексту, кількості запитів і того, наскільки автономно діє агент.
Опитування KPMG Global AI Pulse за другий квартал 2026 року охопило понад 2 100 керівників у 20 країнах . Воно показало, що лише 26% організацій мають повну видимість витрат на використання ШІ в реальному часі .
Глобальний керівник напрямку ШІ в KPMG Стів Чейз зазначив, що деякі клієнти вичерпували річні бюджети на токени й хмарні ресурси за лічені місяці. В одному з випадків використання токенів зросло в шість разів .
Отже, проблема полягає не тільки у високій ціні моделей. Компанії часто не мають інструментів, які показують, хто саме витрачає токени, на які завдання й чи дає це вимірюваний результат.
Gartner пропонує не відмовлятися від ШІ, а керувати ним як повноцінною статтею витрат — із правилами, моніторингом і відповідальними за бюджет. Рекомендації містяться в червневій записці How to Optimize Token Consumption for AI Coding та звіті 10 Best Practices for Optimizing Generative and Agentic AI Costs .
Компаніям варто заздалегідь визначити, коли coding-агент справді потрібен і який рівень автономності йому дозволяти. Gartner пропонує розділяти завдання на три моделі: робота під керівництвом розробника, робота розробника разом з агентом і повністю агентна робота .
Написання тестів, рефакторинг, створення базового каркаса проєкту, документація та прості виправлення помилок не завжди потребують найдорожчих frontier-моделей. Для таких частих і чітко визначених операцій доцільно використовувати менші спеціалізовані моделі, залишаючи потужніші системи для складних завдань .
Context engineering — підготовка якісного й релевантного контексту для моделі — допомагає прибрати зайву та повторювану інформацію із запитів. Менше непотрібного контексту означає менше токенів і нижчі витрати .
Кешування може зменшити повторне обчислення, а пакетна обробка — кількість зайвих звернень до моделей. Водночас компаніям потрібно відстежувати споживання токенів у реальному часі — окремо для кожного розробника, команди, репозиторію та типу робочого процесу .
Фінансове управління хмарними ресурсами, відоме як FinOps, може стати моделлю і для AI-витрат. Gartner радить створити рівень управління з моніторингом споживання, індивідуальними бюджетами та автоматичним виявленням аномалій, які сигналізують про неконтрольоване використання .
Gartner зауважує, що продуктивність помітно зростає у вузьких і добре описаних завданнях — написанні тестів, рефакторингу, створенні шаблонного коду, документації та простих виправленнях . Натомість рішення щодо архітектури, нестандартне налагодження та міркування між різними системами зазвичай дають лише помірне покращення .
Тому компаніям варто оцінити, яка частина роботи команди належить до першої категорії, і спрямовувати ШІ насамперед туди. Саме співвідношення між витратами на токени та кількістю корисних функцій, які реально потрапили у продакшн, а не кількість згенерованого коду, має бути головним показником ефективності.
Епоха необмежених витрат на AI coding добігає кінця. Інструменти справді можуть прискорити роботу над чітко визначеними завданнями, але без контролю рахунки здатні зростати швидше, ніж продуктивність .
Досвід Uber показує, що навіть агресивне впровадження ШІ не гарантує зрозумілої віддачі. Дані KPMG демонструють: більшість компаній ще не бачить повної картини власних витрат. А рекомендації Gartner зводяться до простої формули — спочатку видимість і правила, потім масштабування.
Для бізнесу це не означає відступ від ШІ. Це означає перехід від експерименту до керованого центру витрат, де кожен токен має бути пов’язаний із конкретним завданням і вимірюваною цінністю.