Ox Alpha був GLM 5.3 Flash від Zhipu AI. Компанія підтвердила це 26 серпня 2026 року після сліпого безкоштовного тестового запуску, що розпочався 20 серпня.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash — це модель, яка стояла за анонімним ендпойнтом Ox Alpha, що з’явився в OpenRouter та інших інструментах для розробників 20 серпня 2026 року. 26 серпня Zhipu AI — компанія, що працює на міжнародному ринку під брендом Z.ai, — підтвердила її справжню назву. За словами компанії, безбрендовий запуск був реальним тестом можливостей моделі в програмуванні, мультимодальній роботі та агентських сценаріях. 3
4
Так тижнева загадка перетворилася на помітний реліз відкритої моделі: GLM-5.3-Flash має 320 мільярдів параметрів загалом, але активує лише 18 мільярдів для кожного токена. Вона підтримує контекст приблизно на один мільйон токенів, нативно працює з різними типами даних, а її ваги випущено за ліцензією MIT. 3
6
8
Ox Alpha запустили без публічної картки моделі, назви виробника чи детальних технічних характеристик. Розробники побачили безкоштовний ендпойнт із довгим контекстом і підтримкою мультимодального вводу, після чого почали перевіряти його в задачах програмування та агентських робочих процесах. Практичні результати привернули достатньо уваги, щоб спровокувати дискусії про походження моделі. 13
16
Zhipu заявила, що навмисно приховала її ідентичність. Компанія хотіла, аби розробники оцінювали систему за результатами, а не за назвою бренду, кількістю параметрів чи рекламною кампанією. Такий запуск дав змогу зібрати реальні дані про використання та відгуки ще до офіційної презентації. 13
15
За повідомленнями, під час тесту щодня було доступно близько 100 трильйонів токенів безкоштовної пропускної здатності. Серед відомих розробників, які позитивно відгукнулися про модель, називали співзасновника Stripe Патріка Коллісона. Такий інтерес допоміг перетворити анонімний ендпойнт на одну з найобговорюваніших подій у середовищі розробників. Водночас публічне захоплення не є заміною контрольованому порівняльному тестуванню. 13
14
Zhipu також повідомила, що сервіс працював на штучних інтелектуальних прискорювачах китайського виробництва. South China Morning Post писала про кластер зі 100 000 таких чипів і про 62 трильйони токенів, які модель опрацювала до офіційного релізу. Ці цифри відрізняються від даних в інших повідомленнях про масштаб тесту, тому їх варто сприймати як заяви компанії або медіа, а не як незалежно перевірені вимірювання. 7
13
GLM-5.3-Flash — це модель із сумішшю експертів (mixture of experts, MoE). Загальний пул становить 320 мільярдів параметрів, але для обробки кожного токена активуються лише 18 мільярдів. Така конструкція має поєднати місткість дуже великої моделі з меншим обсягом обчислень на окремому кроці інференсу. 3
4
Модель має 45 шарів і, за описом Zhipu, є першою нативно мультимодальною моделлю в серії GLM-5. Вона призначена для роботи з текстом, зображеннями, відео, візуальними документами, файлами та комбінованими мультимодальними запитами. Це особливо важливо для агентів, яким потрібно не лише читати текст, а й аналізувати інтерфейс, скриншот, документ або результат виконання коду. 4
11
Zhipu заявляє контекстне вікно обсягом 1 048 576 токенів, яке зазвичай округлюють до одного мільйона. Такий масштаб розрахований на роботу з великими репозиторіями, тривалими сесіями агентів, масивними наборами документів і сценаріями, де код поєднується з візуальними або файловими даними. 3
4
GLM-5.3-Flash навчали з нуля на новій базовій моделі, використовуючи оновлену архітектуру та навчальний рецепт. Zhipu повідомляє про мультимодальний корпус обсягом 30 трильйонів токенів. Тобто Flash позиціонується не просто як зменшена версія GLM-5.3, а як окрема модель, побудована навколо ефективності та мультимодальності. 4
16
Модель поєднує лінійну та розріджену увагу. Лінійна увага має здешевити обробку залежностей на великих відстанях у послідовності, тоді як розріджена увага дає змогу зберігати детальніші взаємодії там, де вони найбільш потрібні. Мета такого підходу — поєднати довгий контекст із прийнятнішими витратами на інференс. 4
16
Zhipu також описує механізм IndexPool, покликаний зменшити витрати пам’яті та затримки під час індексації в контекстах великої довжини. Ще одним елементом масштабування є manifold-constrained hyper-connections — гіперзв’язки з обмеженнями на многовиді. Реальна користь цих технік залежить від конфігурації сервера, довжини послідовності, обладнання та конкретного навантаження. 4
16
Порівняно з GLM-5.3 компанія заявляє про зменшення обчислень уваги в 3,01 раза та використання KV-кешу в 4,44 раза зі збереженням якості роботи з довгим контекстом. Для розробників це важливі показники: обчислення уваги та пам’ять під KV-кеш можуть стати головними обмеженнями під час тривалих агентських сесій. Водночас ці коефіцієнти походять переважно з технічних матеріалів Zhipu і не означають універсального, незалежно підтвердженого прискорення в усіх сценаріях. 4
GLM-5.3-Flash насамперед орієнтована на програмування, візуальну розробку, довгі агентські завдання та використання інструментів. Її нативні візуальні можливості мають дати агенту змогу спостерігати за інтерфейсом, результатами рендерингу й відгуком на взаємодії. Це створює замкнений цикл між кодом, браузером і графічним інтерфейсом. 4
У власних матеріалах Zhipu наводить такі результати:
Ці показники відповідають позиціонуванню моделі як інструмента для програмної інженерії та агентських систем. Але порівнювати їх потрібно обережно: результати агентських бенчмарків можуть істотно змінюватися залежно від промптів, інструментів, додаткової обв’язки, апаратного забезпечення, часових обмежень і версії оцінювання. Тому наведені числа коректніше сприймати як результати, заявлені Zhipu, а не як остаточний рейтинг серед усіх конкурентних моделей. 4
15
Zhipu опублікувала ваги GLM-5.3-Flash на Hugging Face за дозвільною ліцензією MIT, зокрема версію BF16. Документація моделі вказує на підтримку фреймворків для розгортання, серед яких SGLang і vLLM. Це дає організаціям можливість запускати модель локально або на власній інфраструктурі, не покладаючись винятково на API Z.ai. 3
6
8
Відкритість змінює практичну цінність релізу. Розробники можуть перевірити модель на власних репозиторіях, документах, візуальних інтерфейсах і агентських середовищах, а команди інфраструктури — самостійно оцінити витрати на обслуговування та вимоги до обладнання.
Однак 320 мільярдів загальних параметрів усе одно роблять розгортання серйозним інженерним завданням. 18 мільярдів активних параметрів на токен зменшують обсяг обчислень, але не перетворюють повний чекпойнт на легку модель за замовчуванням.
Експеримент Ox Alpha був не лише маркетинговим ходом. Він перевіряв, чи користуватимуться розробники моделлю, якщо приховати її назву, компанію-виробника та кількість параметрів. Такий підхід дав Zhipu змогу отримати реальні робочі навантаження та реакції користувачів ще до офіційного розкриття. 13
15
Втім, у цього експерименту є очевидні обмеження. Безкоштовний доступ міг залучити нетипово великий трафік, публічна похвала могла бути частково зумовлена новизною, а анонімний тест не контролював промпти й не порівнював усі системи в однакових умовах.
Найобережніший висновок такий: GLM-5.3-Flash викликала значний інтерес розробників ще до того, як стало відомо, хто її створив. Zhipu використала цей інтерес як джерело практичного зворотного зв’язку та основу для офіційного запуску.
GLM-5.3-Flash — це справжня назва Ox Alpha: відкрита нативно мультимодальна модель серії GLM, розроблена для ефективного програмування та агентських завдань. Її ключові характеристики — MoE-архітектура на 320 млрд загальних і 18 млрд активних параметрів, 45 шарів, контекстне вікно на 1 мільйон токенів, гібридна лінійно-розріджена увага та ваги за ліцензією MIT. 3
4
11
Найважливіша обіцянка моделі полягає не лише в масштабі. Zhipu намагається поєднати довгий контекст, візуальний ввід, роботу з інструментами та нижчі заявлені витрати на обслуговування в системі, яку розробники можуть завантажити й запускати самостійно. Анонімний реліз дав незвично прямий сигнал від реальних користувачів, але для остаточної оцінки продуктивності в робочих середовищах потрібні незалежні та відтворювані тести.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha був GLM 5.3 Flash від Zhipu AI. Компанія підтвердила це 26 серпня 2026 року після сліпого безкоштовного тестового запуску, що розпочався 20 серпня.
Ox Alpha був GLM 5.3 Flash від Zhipu AI. Компанія підтвердила це 26 серпня 2026 року після сліпого безкоштовного тестового запуску, що розпочався 20 серпня. GLM 5.3 Flash орієнтована на програмування, візуальну розробку, довгі агентські сценарії та роботу з інструментами.
Zhipu заявляє, що гібридна архітектура лінійної та розрідженої уваги зменшує обчислення уваги в 3,01 раза, а використання KV кешу — у 4,44 раза порівняно з GLM 5.3.