FlashX — доступный через API скоростной вариант открытой GLM 5.3 Flash, а не отдельно представленная модель с новой архитектурой или открытыми весами. Zhipu AI заявляет скорость до 200 выходных токенов в секунду и рост сквозной пропускной способности системы в 3,2 раза.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM 5.3 FlashX, how does it differ from the open sourced GLM 5.3 Flash base model, and what does Zhipu claim about its sp. Article summary: GLM 5.3 FlashX is Zhipu AI’s faster, API served version of its open sourced GLM 5.3 Flash model.. Topic tags: general web, openai, llm, agents, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factua
Если разработчику нужен доступ к весам модели, речь идёт о GLM-5.3-Flash. Если важнее заявленная скорость ответа через API Zhipu AI, компания предлагает GLM-5.3-FlashX. Zhipu описывает FlashX как ускоренный вариант обслуживания той же базовой модели, а не как новую опубликованную архитектуру или отдельный выпуск открытых весов. 1
4
GLM-5.3-Flash — мультимодальная модель с архитектурой «смесь экспертов»: из 320 млрд параметров при работе активируются 18 млрд. Для неё заявлено контекстное окно до 1 млн токенов — объём текста и других данных, который модель может учитывать в одном запросе. Для FlashX Zhipu указывает скорость до 200 выходных токенов в секунду. Это заявленный максимум, а не подтверждённый независимым тестом прирост относительно Flash при одинаковой нагрузке. 1
7
По словам компании, производственные запросы к Flash обслуживает кластер из более чем 100 тысяч ИИ-ускорителей китайского производства. Zhipu также сообщает, что Infra Agent — инструмент на базе GLM-5.3 — помогал находить узкие места, менять код и оптимизировать систему обслуживания запросов. Среди описанных работ — устранение проблемы с параллельной передачей KV-данных, используемых при генерации ответа, и улучшение вычислительного компонента этапа генерации. 6
7
Zhipu связывает развёртывание и оптимизацию с ростом сквозной пропускной способности в 3,2 раза относительно исходного состояния системы менее чем за две недели. Это показатель того, сколько работы выполняет сервис в целом; он не означает, что ответ каждому пользователю стал генерироваться в 3,2 раза быстрее. 13
15
Zhipu утверждает, что загрузка оборудования и себестоимость обслуживания одного токена сопоставимы с показателями распространённых систем на графических ускорителях Nvidia. Независимого сопоставления при одинаковых условиях приведённые материалы не устанавливают. При этом тариф API для клиента выше у FlashX: $0,37 за миллион входных и $1,25 за миллион выходных токенов против $0,15 и $0,50 у Flash. Выходные токены FlashX стоят в 2,5 раза дороже. 7
4
5
Что пока остаётся проверить: удерживается ли скорость 200 токенов в секунду при одновременных запросах и каковы задержки и стабильность; сколько ускорителей действительно задействовано в производственном обслуживании; какую часть улучшений обеспечил Infra Agent, а какую — инженеры; как измерен прирост в 3,2 раза и на какой исходной базе; насколько корректно сравнение затрат с Nvidia. Доступные публикации в основном передают показатели Zhipu, а не результаты независимого аудита этих заявлений. 1
5
6
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
FlashX — доступный через API скоростной вариант открытой GLM 5.3 Flash, а не отдельно представленная модель с новой архитектурой или открытыми весами.
FlashX — доступный через API скоростной вариант открытой GLM 5.3 Flash, а не отдельно представленная модель с новой архитектурой или открытыми весами. Zhipu AI заявляет скорость до 200 выходных токенов в секунду и рост сквозной пропускной способности системы в 3,2 раза.
Компания говорит о более чем 100 тысячах китайских ИИ ускорителей и помощи Infra Agent в оптимизации сервиса.