Аналітики припускають, що Google може бути зацікавлена у двох складових експертизи AMD:
Водночас це не означає автоматичної заміни Broadcom. Компанія залишається давнім партнером Google у спільному проєктуванні TPU: у березні 2026 року сторони уклали оголошену п’ятирічну угоду, що охоплює покоління v8–v11 .
У нинішньому поколінні Ironwood, або TPU v7x, MediaTek відповідає за I/O та координацію виробництва . Тож участь AMD, якщо вона справді існує, може стосуватися окремого проєкту чи конкретної версії TPU v10, а не повного переформатування партнерства Google з Broadcom. Водночас очікуваний випуск Ironwood на пакуванні CoWoS, за повідомленнями, було знижено приблизно на 32 тисячі пластин
.
Google також нібито розглядає Samsung Foundry як виробничого партнера для окремих компонентів TPU v10, який у деяких повідомленнях має кодову назву «Ice Fish». Це може допомогти компанії диверсифікувати виробництво за межами TSMC . Окремо Google вела фінальні переговори з Marvell щодо інших кастомних AI-чипів
.
Ключове застереження: Google і AMD не підтвердили ці відомості. Публічна інформація SemiAnalysis — це ринкові чутки, а не офіційний анонс. Проєкт AMD може виявитися окремим SKU, експериментальним напрямом або способом зменшити залежність від одного постачальника .
Для традиційного пакетного інференсу схема відносно проста: запит надходить до моделі, GPU виконує прямий прохід, а система повертає відповідь . Процесор у такому сценарії переважно займається маршрутизацією запиту та іншими допоміжними завданнями.
Агентний ШІ працює інакше. Він може розбивати завдання на підзадачі, будувати план, звертатися до API, шукати інформацію, виконувати код у пісочниці, обробляти результати й повторно звертатися до моделі. Усе це створює довгий ланцюжок операцій, значна частина яких виконується на CPU.
Дослідження показало, що в агентних навантаженнях, домінованих викликами інструментів, обробка на CPU може формувати до 88% наскрізної затримки . Інший аналіз оцінює цей показник навіть у 90,6% для окремих агентних конвеєрів
. Це не означає, що GPU стає непотрібним: він і далі виконує основний інференс моделі. Але вузьким місцем дедалі частіше стає координація навколо нього.
У кластерах для навчання моделей на один CPU припадає приблизно сім–вісім GPU, тобто співвідношення становить близько 1:7 або 1:8 . Коли центр ваги зміщується до інференсу, показник наближається до 1:3 або 1:4
.
Для агентних систем він може змінитися ще радикальніше. Під час телефонної конференції Intel за підсумками першого кварталу 2026 року компанія повідомила, що деякі клієнти вже використовують чотири CPU на один GPU — фактично співвідношення 1:1 у певних кластерах .
Morgan Stanley прогнозує додаткове зростання ринку CPU на $32,5–60 млрд до 2030 року, пов’язуючи його саме з цією перебудовою інфраструктури . AMD, зі свого боку, наголошує, що агентний ШІ — це не один GPU-центричний інференсний процес, а гетерогенний конвеєр. Для оркестрації, планування, викликів інструментів і роботи в пісочницях йому потрібні процесори з високою щільністю ядер і великою кількістю потоків
.
Навчання з підкріпленням, особливо для агентних моделей, передбачає постійне повторення кількох кроків:
Такі цикли потребують швидкої взаємодії із середовищем, перевірок, розгалуженої логіки та координації на стороні CPU. Чистий матричний прискорювач не завжди ефективно виконує ці завдання.
Саме тому Nvidia оптимізує Vera з 88-ядерним дизайном Olympus, а Intel — Xeon 6+ під сценарії, які описуються як «тісний цикл reinforcement learning у пісочниці» . Галузь поступово приходить до спільного висновку: майбутні AI-прискорювачі не обов’язково будуть великими матричними двигунами без універсальних ядер.
Якщо Google справді інтегрує CPU-ядра AMD у корпус TPU, це може зменшити затримки між процесорною логікою та AI-прискорювачем. У традиційній системі частина взаємодії проходить через окремі компоненти та інтерфейси, зокрема PCIe. Тісніше поєднання обчислювальних блоків потенційно дає змогу швидше виконувати ланцюжок «виклик інструмента → крок у середовищі → оновлення політики».
Ідеться про перехід до систем на одному корпусі, які поєднують різні типи обчислень залежно від етапу роботи. GPU може відповідати за міркування та інференс моделі, тоді як CPU — за планування, обмін даними, логіку, запуск інструментів і симуляцію середовища.
| Напрям | Що це означає |
|---|---|
| Архітектура | AI ASIC поступово можуть перетворюватися з чистих матричних прискорювачів на гібридні системи з CPU та accelerator-чиплетами. |
| Профіль навантажень | Агентний ШІ та reinforcement learning мають більше розгалужень, викликів інструментів і координації, ніж щільне навчання моделей. Їм потрібні CPU-ядра, а не лише додаткові FLOPS GPU. |
| Ланцюжок постачання | Google розподіляє ролі між Broadcom, MediaTek, Marvell і, можливо, AMD, щоб отримати доступ до спеціалізованої IP та зменшити залежність від одного партнера. |
| Ринок | Для AMD це може стати першим масштабним входом у кастомні AI ASIC. Для Nvidia з’являється додатковий архітектурний тиск — не лише з боку інших GPU, а й від гібридних прискорювачів. |
Повідомлення про можливі CPU-ядра всередині TPU v10 — це значно більше, ніж чергове оновлення специфікацій. Воно відображає зміну самих AI-навантажень.
Модель, яка просто обробляє один запит, справді потребує потужного матричного прискорювача. Але агент, що тисячу разів викликає інструменти, перевіряє результати, взаємодіє із середовищем і коригує план, потребує іншої архітектури. У такій системі CPU перестає бути другорядним «обслуговувальним» компонентом і стає одним із центральних елементів обчислень.
Якщо ринкові чутки SemiAnalysis підтвердяться, Google та AMD можуть уже зараз випробовувати саме такий формат — гібридний AI-чип, розрахований не лише на великі матричні операції, а й на постійні цикли міркування, дій та взаємодії із середовищем.