26 серпня Zhipu AI підтвердила: анонімна модель Ox Alpha, яку в китайськомовному середовищі називали «Ню Лай», є GLM 5.3 Flash — моделлю з відкритими вагами та нативною мультимодальністю. Безкоштовне анонімне тестування на OpenRouter і OpenCode залучило понад 50 трлн токенів за п’ять днів, а згодом — понад 60 трлн з...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
26 серпня 2026 року китайська компанія Zhipu AI, також відома під міжнародним брендом Z.ai, підтвердила, що загадкова модель Ox Alpha — або «Ню Лай» (牛来) у китайськомовному онлайн-середовищі — насправді є GLM-5.3-Flash. До офіційного розкриття модель анонімно тестували на платформах OpenRouter і OpenCode, де вона швидко очолила рейтинги використання. 1
4
6
Ox Alpha позиціонувалася як безкоштовна модель без очевидного брендингу розробника. За повідомленнями, за перші п’ять днів вона обробила понад 50 трлн токенів, а за шість днів показник перевищив 60 трлн. Модель очолила рейтинги OpenRouter і OpenCode, а її пікове використання, за окремими даними, більш ніж удвічі перевищувало показники зіставних продуктів DeepSeek. 3
Після підтвердження Zhipu представила модель під назвою GLM-5.3-Flash як модель із відкритими вагами. Вона підтримує текст, зображення та відео, а також розрахована на роботу з надзвичайно довгим контекстом.
Zhipu заявила, що під час анонімного тестування весь сервіс працював на кластері з понад 100 000 чипів китайського виробництва. Компанія стверджує, що після оптимізації програмного забезпечення ефективність апаратної частини та собівартість обробки одного токена стали порівнянними з показниками поширених GPU NVIDIA. 3
6
Водночас точні моделі та постачальники чипів не розкривалися. У медіа згадували можливу участь Huawei, Moore Threads і Hygon, але це залишається непідтвердженою версією, а не офіційною заявою Zhipu. 40
Цей епізод не доводить, що китайські прискорювачі загалом зрівнялися з рішеннями NVIDIA або що їхня інференс-економіка однакова в будь-яких умовах. Однак він демонструє інше: масштабне реальне навантаження можна обслуговувати на не-NVIDIA інфраструктурі, якщо поєднати значний кластер із глибокою системною оптимізацією.
Для екосистеми CUDA це важливий сигнал, але не вирок. Спеціалізовані програмні стеки та рушії інференсу можуть зменшувати залежність від CUDA в окремих виробничих сценаріях. Водночас переваги NVIDIA в інструментах, спільноті розробників, навчанні моделей і загальній екосистемі нікуди не зникають.
За наявними технічними матеріалами, Zhipu побудувала рушій інференсу на базі SGLang. У ньому використовувалися:
Ці підходи мають зменшувати навантаження на пам’ять, пропускну здатність, міжчипову комунікацію та планування обчислень — особливо під час роботи з контекстом до одного мільйона токенів. 4
7
Zhipu повідомляла приблизно про триразове зростання наскрізної продуктивності порівняно з початковою конфігурацією. Документація SGLang також наводить вищу пропускну здатність і помітно більшу місткість FP8-кешу порівняно з конфігурацією BF16. Однак ці результати документації не є незалежним аудитом початкової заяви компанії про триразове прискорення. 2
GLM-5.3-Flash — це розріджена модель типу mixture of experts (MoE) із 320 млрд загальних параметрів. На обробку кожного токена активується близько 18 млрд параметрів, що дає змогу зменшити обчислювальні витрати порівняно з повністю щільною моделлю такого самого масштабу. Контекстне вікно становить 1 048 576 токенів. 5
7
За даними, наведеними для індексу Artificial Analysis Intelligence Index, модель отримала 57 балів — такий самий показник, як і Claude Opus 4.8. Це означає паритет саме в межах складеного індексу, а не однакову якість на кожному тесті чи в кожному практичному агентному завданні. 1
GLM-5.3-Flash також подається як конкурент ефективних моделей найвищого класу, зокрема DeepSeek V4 Flash і Pro, але наданих даних недостатньо, щоб перевірити точні порівняння за кожним окремим бенчмарком.
Опубліковані тарифи API становлять:
Сучасні публікації описували ціну як приблизно вдесятеро нижчу за GLM-5.3 і приблизно в 40 разів нижчу за Claude Opus 4.8. Однак такі співвідношення залежать від того, які саме напрямки токенів, тарифні рівні та плани порівнювати. 1
Розкриття Ox Alpha показало не лише появу ще однієї дешевої великої мовної моделі. Воно продемонструвало, як анонімний глобальний запуск може стати масштабним тестом інфраструктури ще до офіційної презентації продукту.
Для Zhipu це спосіб підтвердити одразу кілька тез: її модель може конкурувати за увагу розробників, її інференс можна масштабувати на китайських чипах, а оптимізація програмного рівня здатна частково компенсувати обмеження апаратного забезпечення. Наскільки стійкими будуть ці результати за інших навантажень і в довгостроковій експлуатації, покаже подальше використання GLM-5.3-Flash.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
26 серпня Zhipu AI підтвердила: анонімна модель Ox Alpha, яку в китайськомовному середовищі називали «Ню Лай», є GLM 5.3 Flash — моделлю з відкритими вагами та нативною мультимодальністю.
26 серпня Zhipu AI підтвердила: анонімна модель Ox Alpha, яку в китайськомовному середовищі називали «Ню Лай», є GLM 5.3 Flash — моделлю з відкритими вагами та нативною мультимодальністю. Безкоштовне анонімне тестування на OpenRouter і OpenCode залучило понад 50 трлн токенів за п’ять днів, а згодом — понад 60 трлн за шість днів.
За даними Zhipu, сервіс працював на кластері з понад 100 000 чипів китайського виробництва; точні постачальники не називалися.