NVIDIA сообщает, что AVO в связке с Claude Opus 5 набрала 100,00 RHAE на публичном наборе ARC AGI 3, пройдя все 183 уровня в 25 средах за 6 624 действия. Главный вывод касается не только модели, но и агентской оболочки: постоянная память, инструменты, проверка результатов и пересмотр стратегии помогли превратить рез...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA заявила, что система Agentic Variation Operators (AVO) в связке с Claude Opus 5 получила идеальный результат 100,00 RHAE на публичном наборе интерактивного теста ARC-AGI-3. Агент прошёл все 183 уровня в 25 средах, выполнив 6 624 действия.
Самое интересное здесь не в том, что новая базовая модель внезапно научилась решать весь бенчмарк. Ключевой фактор — агентская архитектура, созданная для длительной работы с программным кодом и оптимизации GPU-ядер, но затем перенесённая на совершенно другую задачу: исследование незнакомых интерактивных сред.
В опубликованном сравнительном срезе Claude Opus 5 показывал 30,2%, а GPT-5.6 Sol — 7,8% при использовании стандартного тестового контура.
Результат AVO получен с использованием той же общей базовой модели, но внутри системы, рассчитанной на длительные цепочки действий. Она умеет изучать и изменять рабочие объекты, запускать инструменты и команды, обращаться к документации, оценивать результат и менять подход на основе внешней обратной связи.
На практике AVO заменяет одношаговую схему «вопрос — ответ» циклом:
Для ARC-AGI-3 такой цикл особенно важен: агенту приходится исследовать незнакомые интерактивные среды и самостоятельно выводить их правила и цели по ходу взаимодействия, а не отвечать на полностью сформулированный запрос.
Сила AVO — в координации нескольких функций, каждая из которых по отдельности выглядит привычно, но вместе позволяет модели работать на длинном горизонте.
Постоянная память сохраняет обнаруженные закономерности, неудачные подходы и важное состояние задачи. Агенту не приходится воспринимать каждый новый шаг как отдельный обмен сообщениями. В тесте, построенном на исследовании, это помогает не повторять уже совершённые ошибки и формировать рабочую модель незнакомой среды.
AVO создавалась как система для работы с кодом: агент может изучать проект, вносить изменения, выполнять команды и проверять результат. Поэтому его рассуждения связаны с наблюдаемыми последствиями: предложенное изменение можно протестировать и измерить, а затем принять или отклонить на основании фактов, а не правдоподобия формулировки.
Слой супервизии координирует длительный процесс. Вместо того чтобы бесконечно передавать управление одному вызову модели, система может отслеживать прогресс, замечать непродуктивное направление и помогать восстановиться после неверной гипотезы. В описаниях NVIDIA AVO представлена как сочетание памяти, инструментов выполнения, внешней обратной связи и надзора для продолжительной автономной работы.
Вместе эти компоненты создают структурированный цикл «исследовать — действовать — наблюдать — исправлять». Модель по-прежнему выполняет значительную часть рассуждений, однако именно агентский контур определяет, как эти рассуждения воплощаются во взаимодействии со средой.
Сопоставление показателей полезно, но его необходимо рассматривать с учётом разных настроек оценки.
| Система или конфигурация | Заявленный результат ARC-AGI-3 | Контекст оценки |
|---|---|---|
| AVO с Claude Opus 5 | 100,00 RHAE | Публичный набор; пройдено 183 из 183 уровней |
| Claude Opus 5 без AVO | 30,2% | Опубликованный срез таблицы лидеров и стандартная конфигурация сравнения |
| GPT-5.6 Sol | 7,8% | Стандартное или проверенное полузакрытое сравнение |
| GPT-5.6 Sol с сохранением рассуждений и компактификацией | 38,3% | Отдельный запуск OpenAI на публичных задачах |
Показатели AVO и отдельной модели нельзя считать полностью одинаковыми измерениями. В первом случае речь идёт о результате полноценной агентской системы на публичном наборе, во втором — о показателе модели в рамках конкретного бенчмарк-контура. Именно эта разница и является центральной частью истории.
GPT-5.6 Sol демонстрирует тот же эффект с другой стороны. В опубликованных ARC Prize результатах Sol получил 7,78% при максимальном уровне рассуждений, тогда как OpenAI отдельно сообщила о показателе 38,3% на публичных задачах после сохранения рассуждений между ходами и использования компактификации. Это не является прямой заменой официального результата в таблице лидеров, но показывает, насколько память и управление состоянием могут влиять на показатели агента.
Наиболее осторожный вывод звучит так: ни одна модель не становится автоматически лучшей во всех сценариях. Автономная производительность заметно зависит от сочетания модели, политики памяти, интерфейса инструментов, управления состоянием и тестового контура.
Изначально AVO применялась в сложной разработке программного обеспечения и оптимизации GPU-ядер. В такой работе агент должен изучить реализацию, предложить изменение, запустить тесты на реальном оборудовании, интерпретировать данные о производительности и решить, что пробовать дальше. Успех требует повторяющихся экспериментов, а не одной удачной генерации кода.
NVIDIA сообщает, что в работе с GPU-ядрами AVO исследовала более 500 направлений, зафиксировала 40 версий ядер и получила прирост производительности до 10,5% по сравнению с FlashAttention-4 на системах DGX B200.
Переносимый навык здесь — не обязательно знания о GPU. Важнее сам экспериментальный процесс: создать вариант, выполнить его, измерить результат, сохранить полученные сведения и сменить направление, если факты расходятся с исходной гипотезой. ARC-AGI-3 использует другой интерфейс, но также вознаграждает способность находить структуру через последовательное взаимодействие.
По данным NVIDIA, AVO решила весь публичный набор за 6 624 действия среды, тогда как для VISTA сообщалось о 7 542 действиях. Это примерно на 12% меньше при прохождении тех же 183 уровней.
Показатель важен потому, что метрика ARC-AGI-3 RHAE учитывает не только достижение успешного состояния, но и эффективность действий относительно человеческого результата. Долгосрочная система должна поэтому контролировать исследование: чрезмерные попытки могут сделать даже способного агента медленным, дорогим и непрактичным.
Для бизнеса главный урок связан с архитектурой. Надёжная автономная система, вероятно, не будет просто большой языковой моделью, подключённой к нескольким инструментам. Вокруг модели нужен управляемый слой выполнения.
В него могут входить:
Результат AVO также усиливает аргументы в пользу модульных агентских стеков. Если значительная часть прироста производительности обеспечивается оболочкой, организациям выгодно отделять память, адаптеры инструментов, наборы тестов, политики и наблюдаемость от базовой модели. Тогда модель можно заменить или сравнить с другой без перестройки всей системы.
Однако показатель 100% нельзя считать доказательством корпоративной надёжности. Речь идёт о заявленном NVIDIA результате на публичном наборе ARC-AGI-3. Он не подтверждает аналогичную работу на закрытых задачах, производственных данных или бизнес-процессах с высоким риском. Нужны независимое воспроизведение, тестирование на скрытом наборе, оценка стоимости и задержек, проверка безопасности и отдельная оценка рисков.
AVO переводит разговор с вопроса «Какая модель умнее?» к более практичному вопросу: какая система умеет сохранять контекст, пользоваться инструментами, учиться на обратной связи и надёжно восстанавливаться в ходе длинного процесса?
Базовая модель остаётся важной, но ARC-AGI-3 наглядно показывает: именно окружающий её агентский контур может определить, сохранится ли способность рассуждать при столкновении с незнакомой средой. Для компаний, создающих автономный ИИ, конкурентное преимущество всё чаще может быть связано с качеством системы выполнения, а не только с отдельным вызовом модели.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
NVIDIA сообщает, что AVO в связке с Claude Opus 5 набрала 100,00 RHAE на публичном наборе ARC AGI 3, пройдя все 183 уровня в 25 средах за 6 624 действия.
NVIDIA сообщает, что AVO в связке с Claude Opus 5 набрала 100,00 RHAE на публичном наборе ARC AGI 3, пройдя все 183 уровня в 25 средах за 6 624 действия. Главный вывод касается не только модели, но и агентской оболочки: постоянная память, инструменты, проверка результатов и пересмотр стратегии помогли превратить результат отдельной модели примерно в 30% в результат пол...