Ox Alpha была анонимной предварительной версией GLM 5.3 Flash: модель появилась 20 августа 2026 года, а Zhipu AI подтвердила её происхождение 26 августа. GLM 5.3 Flash рассчитана на программирование и агентные сценарии: она поддерживает текст, изображения, видео и файлы, а её контекстное окно достигает 1 048 576 ток...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash — открытая мультимодальная модель компании Zhipu AI, которая работает на международном рынке под брендом Z.ai. До официального представления она несколько дней распространялась анонимно под названием Ox Alpha на OpenRouter и в других инструментах для разработчиков. 20 августа 2026 года пользователи получили бесплатный доступ к неизвестной модели без публичной карточки, названия производителя и подробных характеристик. 26 августа Zhipu раскрыла её происхождение. 3
4
Так обычный тестовый запуск превратился в заметный релиз открытой модели: GLM-5.3-Flash получила 320 млрд параметров, архитектуру mixture-of-experts с 18 млрд активных параметров на токен, контекстное окно примерно на миллион токенов, нативную поддержку разных типов данных и веса под MIT-лицензией. 3
6
8
Ox Alpha появилась без привычных для запуска ИИ-модели атрибутов — без имени разработчика, model card и подробного списка спецификаций. При этом сервис предлагал длинный контекст и мультимодальный ввод. Разработчики быстро начали проверять его в задачах программирования, автоматизации и агентных сценариях, а качество практических ответов породило догадки о том, какая лаборатория стоит за проектом. 13
16
По словам Zhipu, анонимность была намеренной. Компания хотела, чтобы пользователи оценивали модель по результатам работы, а не по известности бренда, числу параметров или рекламной кампании. Реальные запросы помогли собрать данные о поведении системы в рабочих процессах — от разработки программного обеспечения до длительных задач с инструментами — ещё до официального релиза. 13
15
Во время теста сообщалось примерно о 100 трлн токенов бесплатной пропускной способности в день. Среди заметных разработчиков, положительно отозвавшихся о модели, называли сооснователя Stripe Патрика Коллисона. Такая реакция превратила неизвестный endpoint в один из самых обсуждаемых запусков, хотя публичное восхищение не заменяет контролируемого независимого сравнения. 13
14
Zhipu также заявила, что сервис работал на произведённых в Китае ИИ-ускорителях. South China Morning Post писала о кластере из 100 000 таких чипов и сообщала, что до официального релиза модель обработала 62 трлн токенов. Эти показатели расходятся с другими оценками объёма трафика и доступной мощности, поэтому их корректнее воспринимать как данные компании или СМИ, а не как результаты независимого аудита. 7
13
GLM-5.3-Flash относится к моделям mixture-of-experts (MoE) — архитектуре, в которой общий набор параметров разделён между специализированными экспертами. Всего в модели 320 млрд параметров, однако при обработке каждого токена активируется только 18 млрд. Это позволяет использовать ёмкость очень крупной модели, не задействуя весь её параметрический объём на каждом шаге инференса. 3
4
Модель состоит из 45 слоёв и позиционируется как первая нативно мультимодальная система в линейке GLM-5. Она умеет работать с текстом, изображениями, видео, визуальными документами, файлами и чередующимися мультимодальными данными. На практике это важно для задач, где агенту нужно не только прочитать инструкцию, но и посмотреть на интерфейс, понять скриншот, изучить документ или проверить результат выполнения кода. 4
11
Заявленное контекстное окно составляет 1 048 576 токенов, то есть примерно один миллион токенов. Такой объём рассчитан на большие репозитории, продолжительные сессии агентной разработки, массивы документов и задачи, в которых код сочетается с изображениями, файлами и данными из интерфейса. 3
4
Zhipu подчёркивает, что GLM-5.3-Flash обучалась с нуля на новой базовой модели и использует переработанные архитектуру и методику обучения. Компания сообщает о мультимодальном корпусе объёмом 30 трлн токенов — то есть представляет Flash не как просто уменьшенную версию GLM-5.3, а как отдельную модель, созданную с акцентом на эффективность и работу с разными типами данных. 4
16
В GLM-5.3-Flash объединены линейное и разреженное внимание. Линейное внимание призвано снизить стоимость обработки длинных последовательностей, а разреженное — сохранять более точные связи между теми элементами контекста, где они действительно важны. Идея состоит в том, чтобы совместить работу с длинным контекстом с более умеренными затратами на инференс. 4
16
В архитектуре также используется механизм IndexPool, предназначенный для уменьшения расходов памяти и задержек при индексации контекста длиной до миллиона токенов. Ещё один элемент — manifold-constrained hyper-connections, или гиперсвязи с ограничениями на многообразии, которые Zhipu описывает как способ повысить эффективность масштабирования. Реальный эффект таких решений зависит от оборудования, настроек сервинга, длины последовательности и характера нагрузки. 4
16
По сравнению с GLM-5.3 компания заявляет о снижении вычислений внимания в 3,01 раза и использования KV-кэша в 4,44 раза при сохранении качества на длинном контексте. Для разработчиков это существенно: вычисления внимания и память KV-кэша часто становятся главными ограничителями в продолжительных агентных сессиях. При этом указанные коэффициенты в основном основаны на технических материалах Zhipu и не должны автоматически интерпретироваться как универсальное, независимо подтверждённое ускорение. 4
Главные направления GLM-5.3-Flash — программирование, визуальная разработка, длительные агентные задачи и использование инструментов. Благодаря нативной работе с изображениями модель может анализировать интерфейс, результат рендеринга и обратную связь от взаимодействия. Это создаёт замкнутый цикл между кодом, браузером и графическим интерфейсом: агент пишет код, наблюдает результат и при необходимости корректирует свои действия. 4
Zhipu приводит следующие результаты собственных тестов:
Эти показатели соответствуют позиционированию модели как инструмента для разработки и агентных сценариев. Но сравнивать результаты напрямую нужно осторожно: агентные бенчмарки чувствительны к формулировкам запросов, подключённым инструментам, дополнительной обвязке, лимитам времени и версии теста. Поэтому опубликованные числа следует считать заявленными Zhipu результатами, а не окончательным рейтингом модели относительно всех конкурентов. 4
15
Zhipu опубликовала веса GLM-5.3-Flash на Hugging Face под разрешительной MIT-лицензией, включая версию BF16. В документации также указана поддержка фреймворков для сервинга, в частности SGLang и vLLM. Это даёт организациям возможность запускать модель локально или на собственной инфраструктуре, не ограничиваясь API Z.ai. 3
6
8
Открытый релиз меняет практическую ценность модели. Разработчики могут проверить её на собственных репозиториях, документах, интерфейсах и агентных средах, а инженерные команды — самостоятельно оценить требования к оборудованию и стоимость обслуживания.
Однако MIT-лицензия не делает модель лёгкой для запуска. Полный чекпойнт на 320 млрд параметров остаётся серьёзным инфраструктурным проектом. 18 млрд активных параметров уменьшают вычислительную нагрузку на отдельный токен, но не превращают всю модель в компактный локальный файл по умолчанию.
Эксперимент Ox Alpha был не только маркетинговым ходом. Он проверял, будут ли разработчики пользоваться моделью, если не знают её названия, размера и компании-разработчика. Такой формат дал Zhipu практическую обратную связь от реальных пользователей ещё до официального объявления. 13
15
У подхода есть и ограничения. Бесплатный доступ мог привлечь необычно большой поток запросов, положительные отзывы могли быть отчасти связаны с эффектом новизны, а анонимный тест не контролировал все параметры сравнения — включая промпты, инструменты и окружение. Поэтому наиболее осторожный вывод звучит так: GLM-5.3-Flash вызвала заметный интерес у разработчиков ещё до раскрытия личности, а Zhipu использовала этот интерес для проверки модели и подготовки официального запуска.
GLM-5.3-Flash — это официальное имя модели, ранее известной как Ox Alpha. Перед нами открытая нативно мультимодальная GLM-система для программирования и агентной работы. Её основные характеристики — MoE-архитектура на 320 млрд параметров с 18 млрд активных, 45 слоёв, контекстное окно на 1 048 576 токенов, сочетание линейного и разреженного внимания и веса под MIT-лицензией. 3
4
11
Главная интрига релиза не только в масштабе. Zhipu пытается объединить длинный контекст, визуальное восприятие, работу с инструментами и более низкие заявленные расходы на обслуживание в модели, которую можно скачать и разворачивать самостоятельно. Анонимный запуск дал ценные данные из реальных сценариев, но для окончательной оценки производительности всё ещё нужны независимые и воспроизводимые тесты.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Ox Alpha была анонимной предварительной версией GLM 5.3 Flash: модель появилась 20 августа 2026 года, а Zhipu AI подтвердила её происхождение 26 августа.
Ox Alpha была анонимной предварительной версией GLM 5.3 Flash: модель появилась 20 августа 2026 года, а Zhipu AI подтвердила её происхождение 26 августа. GLM 5.3 Flash рассчитана на программирование и агентные сценарии: она поддерживает текст, изображения, видео и файлы, а её контекстное окно достигает 1 048 576 токенов.
Это MoE модель на 320 млрд параметров, из которых на каждый токен активируются 18 млрд; Zhipu заявляет о снижении вычислений внимания в 3,01 раза и использования KV кэша в 4,44 раза по сравнению с GLM 5.3.