У GPT 6 Astra нет одного универсального и неизменного места в рейтинге: актуальное сравнение Artificial Analysis показывает 55 баллов у Astra против 57 у Claude Fable 5.1, тогда как ARC AGI 3 публикует для Astra 62,7%... Для выбора модели важнее сопоставить конкретную конфигурацию, набор задач, бюджет на рассуждения...
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How did independent evaluations of OpenAI’s GPT-6 Astra, released September 3, 2026, reach conflicting conclusions about its standing versus. Article summary: The claimed rankings are not directly comparable, and several of the precise figures in the question cannot be independently substantiated from the primary evaluation pages available to me. In particular, the available A. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Заголовки о бенчмарках создают впечатление, будто GPT-6 Astra одновременно безоговорочно лидирует, делит первое место и заметно отстаёт. Противоречия здесь в основном нет: сводный лидерборд, интерактивный тест агентов, проверка формальной математики и API-тарифы измеряют разные свойства системы — в разных условиях.
Главный вывод прост: универсального места модели в рейтинге не существует, пока не названы конкретная работа и правила оценки.
Сводные индексы объединяют результаты нескольких тестов в одно число. Итог зависит от того, какие задания включены, как они взвешены, какую конфигурацию модели проверяли и как учитывались интенсивность рассуждений, инструменты и стоимость. Модель, сильная в широком наборе задач, может возглавлять один агрегатный индекс, но уступать в индексе с упором на программирование или агентные сценарии.
Кроме того, точечные результаты зависят от даты и конфигурации. В предоставленном сравнении Artificial Analysis GPT-6 Astra (max) набирает 55 баллов, а Claude Fable 5.1 — 57, а не 61 и 66, фигурировавшие в ранних сравнительных публикациях. 3 Поэтому важно фиксировать дату, версию и настройки оценки, а не принимать один снимок лидерборда за постоянную и окончательную иерархию.
Заявленное первое место Astra в 169-балльном Capabilities Index от Epoch AI и методология, лежащая в его основе, не подтверждаются доступными первичными материалами Epoch. Использовать этот результат как решающий аргумент нельзя без самого лидерборда, весов бенчмарков, настроек моделей и данных о неопределённости.
ARC-AGI-3 — интерактивный бенчмарк, а не набор статичных вопросов. Агент должен исследовать незнакомую среду, по ходу дела понимать цели, строить адаптируемую модель мира и менять стратегию на основе опыта. 50
ARC Prize опубликовал для GPT-6 Astra два заметных результата на полу-закрытой части оценки (Semi-Private):
| Условие оценки | Лучший опубликованный результат | Указанная стоимость одного прогона |
|---|---|---|
| Standard harness, максимальный уровень рассуждений | 62,7% | $26 098 |
| OpenAI Provider Adapter, высокий уровень рассуждений | 99,9% | $18 817 (около $19 тыс.) |
Разница — не второстепенная техническая деталь. В Standard harness агент работает через минимальный, нейтральный по отношению к поставщику интерфейс и может переносить между шагами только те заметки, которые сам решил сохранить. В режиме Provider Adapter может сохраняться непрозрачное внутреннее состояние рассуждений провайдера, а для длинных диалогов применяется сжатие контекста. 51
53
Следовательно, результат с Provider Adapter измеряет работу Astra вместе с нативной интеграцией управления контекстом OpenAI. Это значимая возможность продукта, но её нельзя автоматически ставить в прямое сравнение с моделями, которые тестировались только через нейтральный интерфейс. ARC Prize прямо рассматривает эти контуры как разные условия, отвечающие на разные вопросы. 53
ARC Prize также сообщил, что Astra совершала меньше действий, чем медианный протестированный человек, на 96% уровней. 52 Это показатель эффективности действий, а не доказательство того, что модель в целом лучше людей в любой работе. Он также не заменяет проверку завершения задач, надёжности и полной стоимости в реальном рабочем процессе.
FrontierMath Erdős состоит из 68 сложных задач, связанных с Эрдёшем и остававшихся открытыми на август 2026 года. Чтобы решить задачу, система должна доказать или опровергнуть гипотезу в Lean — помощнике для формализации доказательств; отправленные доказательства можно механически проверить. 33
37
Такая конструкция делает тест особенно строгим для оценки формальной математической корректности. Но сильный результат по математике не превращается автоматически в общий рейтинг по программированию, агентным системам или рассуждению вообще. Бенчмарк измеряет успех на узкой и крайне сложной задаче формального доказательства при заданном бюджете.
Предоставленные первичные материалы не подтверждают общее число решённых Astra задач, различия между стандартизированными и нестандартными бюджетами прогонов, а также перечень исключённых результатов в FrontierMath Erdős. Такие сведения стоит приводить только по конкретной таблице результатов или отчёту Epoch — вместе с бюджетом и критериями допуска.
Отдельная страница Epoch для FrontierMath: Open Problems указывает, что в предрелизной оценке GPT-6 Astra нашла кривую рода 2 с 648 рациональными точками. Это другой результат и его нельзя смешивать с баллом FrontierMath Erdős. 43
OpenAI указывает для GPT-6 Astra тариф $10 за миллион входных токенов и $50 за миллион выходных токенов. 19 В сравнительных материалах из предоставленных источников сказано, что у Claude Fable 5.1 такие же базовые ставки, но чтение кэшированного ввода стоит $0,25 за миллион токенов против $1,00 у Astra.
4
Из этого следуют два разных вопроса о стоимости:
OpenAI утверждает, что в нескольких собственных оценках Astra достигала меньшей расчётной API-стоимости на задачу за счёт существенно меньшего расхода выходных токенов. 18 Это данные поставщика, а не универсальная гарантия. Ни балл бенчмарка, ни цена токена сами по себе не доказывают, какая модель будет дешевле для конкретной кодовой базы или агентного процесса.
Прежде чем выбирать между Astra, Claude Fable 5.1 и GPT-5.6 Sol, стоит определить задачу и привести условия к общему знаменателю:
Результат Astra в ARC-AGI-3 с Provider Adapter действительно впечатляет, а 62,7% в Standard harness — сильный показатель сам по себе. Но ни один из них не отменяет независимый индекс, в котором другая модель лучше при ином наборе задач и настройках. Полезный вопрос звучит не «какая модель победила?», а «какая проверенная конфигурация ближе всего к работе, которую системе предстоит выполнять?»
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
У GPT 6 Astra нет одного универсального и неизменного места в рейтинге: актуальное сравнение Artificial Analysis показывает 55 баллов у Astra против 57 у Claude Fable 5.1, тогда как ARC AGI 3 публикует для Astra 62,7%...
У GPT 6 Astra нет одного универсального и неизменного места в рейтинге: актуальное сравнение Artificial Analysis показывает 55 баллов у Astra против 57 у Claude Fable 5.1, тогда как ARC AGI 3 публикует для Astra 62,7%... Для выбора модели важнее сопоставить конкретную конфигурацию, набор задач, бюджет на рассуждения, тестовый контур и стоимость успешно выполненной работы, а не ориентироваться на один громкий балл.