Доступ до Ox Alpha також надавав OpenCode через безкоштовний тариф. У своєму оголошенні сервіс обіцяв щедрі ліміти та «майже необмежене використання», заявивши про потужність до 100 трильйонів токенів на день. Це твердження оператора, а не результат незалежного аудиту пропускної здатності.
Розробник Бен Девіс протестував Ox Alpha на 10 завданнях із бенчмарку DeepSWE для програмної інженерії. За повідомленнями, модель виконала вісім із них, тобто показала результат близько 80%. У тому самому обмеженому порівнянні Claude Fable 5 набрала 65%, а GPT-5.6 Sol — 52%.
Цифра привертає увагу, але її не слід називати офіційною перемогою в DeepSWE. Версія DeepSWE v1.1 містить 113 оригінальних завдань із довгим ланцюжком міркувань, розподілених між 91 репозиторієм. Отже, експеримент охопив лише невелику частину всього бенчмарку.
Є й інші важливі методологічні обмеження:
У доступному на той момент знімку публічного рейтингу першою була Claude Opus 5 із результатом 73,6%, далі йшли GPT-5.6 Sol із 72,7% і Claude Fable 5 із 69,7%. Обережний висновок звучить так: у десяти завданнях Девіса Ox Alpha показала дуже сильний результат, але це не доводить, що вона є найкращою універсальною моделлю для програмування.
Основна версія пов’язує Ox Alpha із Zhipu AI, також відомою як Z.ai, та її сімейством моделей GLM. Ця гіпотеза ґрунтується не на заяві компанії, а на аналізі поведінкових і технічних «відбитків» моделі.
В одному з описаних тестів порівнювали токенізацію Ox Alpha і GLM-5.3 на 25 запитах. Повідомляється, що базова кількість токенів збігалася після врахування постійної обгортки на 75 токенів. Окремі тести відео також виявили схожу поведінку під час кодування зображень: збіги у виборі кадрів, масштабуванні тривалості та роботі з роздільною здатністю.
Серед інших подібностей називають стиль відповідей, поведінку API та обробку аудіовходу. Кожну окрему ознаку можна пояснити спільною обгорткою, інфраструктурою або наслідуванням. Але разом, стверджують аналітики, ці сигнали утворюють кластер, сумісний з уніфікованою мультимодальною лінійкою GLM від Zhipu.
Додатковим непрямим контекстом є попередні анонімні або «стелс»-релізи Zhipu, зокрема модель під назвою Pony Alpha. Водночас це не доводить, що саме Zhipu створила Ox Alpha.
У період, якого стосуються повідомлення, жодна компанія публічно не взяла на себе відповідальність за Ox Alpha, а Zhipu не підтвердила цю атрибуцію. У мережі обговорювали конкретні версії GLM, однак наявні дані не встановлюють, чи є Ox Alpha невипущеною моделлю, виробничим варіантом, доопрацьованою системою або незалежним продуктом, що використовує споріднену інфраструктуру.
Тож коректний опис такий: Ox Alpha, імовірно, походить від GLM і може бути пов’язана із Zhipu, але її творець та точна ідентичність моделі не підтверджені. Відсотки впевненості, які публікували окремі аналітики, не слід сприймати як офіційну ідентифікацію.
Умови роботи з даними — одна з найважливіших практичних деталей для розробників. На сторінці Ox Alpha в OpenRouter зазначено, що запити й відповіді зберігає кінцевий провайдер, але не використовує їх для навчання.
Це відрізняється від загальної політики OpenRouter: сама платформа не зберігає запити та відповіді, якщо користувач окремо не погодився на журналювання введення й виведення. Крім того, OpenRouter описує політики провайдерів окремо, тож рівень маршрутизації та постачальник моделі можуть мати різні правила зберігання.
OpenCode тим часом рекламував Ox Alpha як модель із «нульовим зберіганням даних». Імовірно, це стосується власної обробки запитів OpenCode, але така обіцянка автоматично не скасовує повідомлення про зберігання даних провайдером на маршруті OpenRouter. Іншими словами, фрази «OpenCode не зберігає дані» та «провайдер моделі зберігає запити й відповіді» можуть описувати різні етапи проходження одного й того самого запиту.
Поки провайдери не опублікують єдину юридично чітку політику обробки даних, розумно виходити з того, що постачальник моделі може зберігати надісланий контент. Не варто передавати туди комерційний код, облікові дані, персональну чи регульовану інформацію лише тому, що сервіс безкоштовний або обіцяє не використовувати запити для навчання.
Ox Alpha привернула увагу з трьох причин: коротке безкоштовне прев’ю, незвично велике контекстне вікно з мультимодальними можливостями та яскравий ранній результат у програмувальному тесті. Але наявні дані закликають до стриманої оцінки, а не до висновку, що невідома лабораторія беззаперечно випередила всіх визнаних лідерів.
Показник 80% у DeepSWE — це вісім успішних завдань із десяти, а не результат повного тесту зі 113 завдань. У публічному рейтингу попереду залишалася Claude Opus 5, а Ox Alpha не проходила офіційну процедуру оцінювання.
Технічні ознаки роблять зв’язок із Zhipu/GLM головним поясненням, але публічного підтвердження авторства немає. Для експериментів Ox Alpha була цікавою моделлю для тестування. Для виробничих систем або роботи з чутливим кодом її анонімний власник, зберігання даних на рівні провайдера та невстановлена ідентичність — вагомі причини діяти обережно.