Анонімний тест перетворився на масштабну перевірку в реальних умовах
26 серпня 2026 року Zhipu AI — компанія, відома на міжнародному ринку також як Z.ai, — розкрила таємницю навколо моделі Ox Alpha. У китайських спільнотах розробників її називали «Niu Lai». Виявилося, що під цим анонімним іменем тестували GLM-5.3-Flash — відкриту модель із доступними вагами та нативною мультимодальністю із серії GLM.
1
15
До офіційного релізу модель безкоштовно працювала на платформах OpenRouter і OpenCode без логотипу чи назви компанії-розробника. За п’ять днів вона обробила понад 50 трильйонів токенів. Zhipu також заявила, що весь цей трафік забезпечував кластер із понад 100 000 чипів китайського виробництва.
8
15
Подальші повідомлення оцінювали обсяг у понад 60 трильйонів токенів за шість днів, а використання на OpenRouter — більш ніж удвічі вище, ніж у зіставного трафіку DeepSeek. Різні цифри пояснюються відмінними періодами підрахунку та методиками платформ. Найобережніший висновок: тест точно перевищив 50 трильйонів токенів і привернув надзвичайно високий попит.
1
3
30
Цінність такого експерименту — у його «сліпому» характері. Користувачі не знали, хто стоїть за моделлю і на якому обладнанні вона працює. Вони оцінювали лише якість відповідей, швидкість, доступність і ціну.
Що відомо про китайську чипову інфраструктуру
Zhipu стверджує, що онлайн-інференс GLM-5.3-Flash виконувався на понад 100 000 китайських прискорювачів. Після програмної оптимізації, за словами компанії, ефективність обладнання та вартість обробки одного токена стали порівнюваними з показниками поширених GPU Nvidia.
15
24
Точних постачальників чипів у наведених матеріалах Zhipu не назвала. У галузевих публікаціях як можливих учасників згадували Huawei, Moore Threads і Hygon, однак це припущення не підтверджене самою компанією.
30
40
Заяву важливо трактувати вузько. Вона не доводить, що китайські чипи загалом зрівнялися з Nvidia за всіма типами навантажень, витіснили її під час навчання моделей або мають еквівалентні інструменти для розробників. Натомість це свідчення того, що великий сервіс інференсу можна побудувати на не-Nvidia стеку, якщо модель, серверне програмне забезпечення та апаратна платформа оптимізуються разом.
Чому вирішальним стало програмне забезпечення
Контекстне вікно на 1 048 576 токенів створює складні вимоги до пам’яті, пропускної здатності, обміну даними між чипами та планування запитів. Для їх подолання Zhipu побудувала спеціалізований рушій інференсу на базі SGLang і використала кілька технік:
- квантизацію W8A8 для зменшення обчислювального та memory-навантаження;
- змішану квантизацію кешу INT8, FP8 і BF16;
- тензорний паралелізм у межах вузлів;
- архітектуру Encode–Prefill–Decode (EPD), яка розділяє мультимодальне кодування, попередню обробку промпту та генерацію токенів у незалежно масштабовані пули.
11
24
Zhipu заявила, що порівняно з початковим базовим варіантом на тому самому обладнанні ці зміни приблизно втричі підвищили наскрізну продуктивність сервісу.
24
26 Пізніша документація SGLang також описує додаткове зростання пропускної здатності та збільшення місткості кешу FP8 порівняно з конфігурацією BF16. Однак ці дані не є незалежним аудитом початкової заяви Zhipu про триразове підвищення.
17
Для Nvidia це передусім сигнал щодо ролі CUDA в інференсі, а не доказ негайного руйнування її загальних переваг. Спеціалізовані ядра, квантизація, паралелізм і планування можуть зменшити залежність від CUDA у конкретних виробничих сценаріях. Водночас екосистема програмного забезпечення Nvidia, її інструменти, встановлена база та позиції в навчанні моделей — окремі питання, яких цей реліз не розв’язує.
Характеристики GLM-5.3-Flash
GLM-5.3-Flash описують як розріджену Mixture-of-Experts-модель із 320 мільярдами загальних параметрів і приблизно 18 мільярдами активних параметрів на кожен токен. Вона підтримує контекстне вікно на 1 048 576 токенів і нативний мультимодальний ввід, що робить її придатною для роботи з довгими документами, програмування та тривалих агентних сценаріїв.
2
5
7
За даними, наведеними для Artificial Analysis Intelligence Index, модель отримала 57 балів — стільки ж, скільки Claude Opus 4.8. Це паритет лише за одним комплексним індексом, а не доказ однакової якості на всіх тестах, у прикладних завданнях чи в роботі AI-агентів.
9
Ціна як ключ до конкуренції
Опублікована ціна API становить 0,15 долара за мільйон вхідних токенів і 0,50 долара за мільйон вихідних токенів.
4
29 У тогочасних оглядах модель називали приблизно вдесятеро дешевшою за GLM-5.3 і приблизно в 40 разів дешевшою за Claude Opus 4.8. Водночас такі співвідношення залежать від того, які саме типи токенів, тарифні рівні та плани порівнювати.
1
4
Практичне значення GLM-5.3-Flash — не в одному рекордному показнику, а в поєднанні трьох чинників: розрідженої архітектури, оптимізації інференсу та агресивної ціни. Тест Ox Alpha показав, що така комбінація здатна залучити величезний потік користувачів ще до розкриття бренду моделі.
Це не означає, що Zhipu усунула всі обмеження китайського апаратного чи програмного стеку. Але компанія продемонструвала важливу для ринку річ: у масштабному інференсі перевага може народжуватися не лише з характеристик окремого чипа, а й із наскрізного проєктування моделі, рушія обслуговування та інфраструктури.