NVIDIA повідомляє, що AVO у зв’язці з Claude Opus 5 набрала 100,00 RHAE у публічному наборі ARC AGI 3: система пройшла всі 183 рівні у 25 середовищах, виконавши 6 624 дії. Головний висновок стосується не лише моделі, а й агентної оболонки: постійна пам’ять, використання інструментів, перевірка результатів, коригуван...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA заявляє, що її система Agentic Variation Operators (AVO) набрала ідеальні 100,00 RHAE у публічному наборі інтерактивного тесту ARC-AGI-3. Працюючи на базі Claude Opus 5, AVO пройшла всі 183 рівні у 25 середовищах, виконавши 6 624 дії.
Найцікавіше тут не те, що нова фундаментальна модель раптом навчилася розв’язувати ARC-AGI-3. Суть у тому, що архітектура довготривалого агента, створена для програмної інженерії та оптимізації GPU-ядер, виявилася придатною для зовсім іншого типу інтерактивного міркування.
У доступному знімку таблиці результатів Claude Opus 5 окремо показала 30,2%, тоді як GPT-5.6 Sol набрала 7,8% у стандартному або перевіреному порівняльному налаштуванні.
Результат NVIDIA отримано завдяки поєднанню тієї самої базової моделі з виконувальним середовищем, розрахованим на роботу впродовж багатьох кроків. AVO може аналізувати й змінювати артефакти, запускати інструменти та команди, звертатися до документації, оцінювати результат і переглядати свій підхід на основі зовнішнього зворотного зв’язку.
На практиці це не одноразова схема «запит — відповідь», а замкнений цикл:
Такий цикл особливо важливий для ARC-AGI-3. У цьому тесті агент має досліджувати незнайомі інтерактивні середовища й самостійно виводити правила та цілі через взаємодію, а не просто відповідати на повністю сформульоване завдання.
Заявлена архітектура поєднує кілька можливостей, кожна з яких окремо може здаватися очевидною, але разом вони значно посилюють агента на довгій дистанції.
Постійна пам’ять дає змогу зберігати відкриття, невдалі підходи та корисний стан, а не розглядати кожен крок як окремий обмін повідомленнями. У тесті, побудованому на дослідженні, це може зменшувати кількість повторних помилок і допомагати системі створювати робочу модель незнайомого середовища.
AVO створювали як систему для агентної роботи з кодом: вона може перевіряти результати, вносити зміни, запускати команди та підтверджувати успіх виконанням. Тому міркування агента прив’язані до спостережуваних наслідків: запропоновану зміну можна протестувати, виміряти й переглянути, а не прийняти лише тому, що вона звучить переконливо.
Окремий supervisory-рівень допомагає координувати тривалий процес. Замість того щоб один виклик моделі безкінечно керував усіма рішеннями, система може контролювати прогрес, виявляти непродуктивні напрямки й допомагати відновитися після хибного припущення. NVIDIA та пов’язані з нею описи характеризують AVO як поєднання пам’яті, інструментів виконання, зовнішнього зворотного зв’язку й нагляду для тривалої автономної роботи.
У сукупності ці елементи дають моделі структурований спосіб досліджувати, діяти, спостерігати та виправлятися. Модель і надалі забезпечує значну частину міркувань, але саме агентська оболонка визначає, як ці міркування реалізуються в середовищі.
Порівнювати результати корисно, але їх потрібно розглядати разом із налаштуваннями оцінювання.
| Система або конфігурація | Заявлений результат ARC-AGI-3 | Контекст оцінювання |
|---|---|---|
| AVO з Claude Opus 5 | 100,00 RHAE | Публічний набір; пройдено 183 із 183 рівнів |
| Claude Opus 5 без AVO | 30,2% | Опублікований знімок таблиці та стандартне порівняльне налаштування |
| GPT-5.6 Sol | 7,8% | Стандартне або перевірене напівзакрите порівняння |
| GPT-5.6 Sol зі збереженням міркувань і компактуванням | 38,3% | Окремий запуск OpenAI на публічних завданнях |
Показники AVO та окремого Opus 5 — це не повністю однакові вимірювання. Перший є результатом повної агентної системи на публічному наборі, а другий — оцінкою моделі в межах тестового середовища. Саме ця різниця є центральною для всієї історії.
GPT-5.6 Sol демонструє те саме з іншого боку. Опубліковані ARC Prize результати показують 7,78% для Sol за максимального рівня міркувань, тоді як OpenAI окремо повідомила про 38,3% на публічних завданнях після збереження міркувань між ходами та використання компактування. Це не є прямою заміною офіційного результату таблиці, але показує, наскільки пам’ять і робота зі станом можуть впливати на підсумок агентного тесту.
Найобережніший висновок полягає не в тому, що якась одна модель універсально краща. Важливо, що автономна ефективність істотно залежить від моделі, політики пам’яті, інтерфейсу інструментів, стратегії керування станом і тестового середовища, які працюють разом.
Початковим середовищем AVO були складні завдання програмної інженерії та оптимізації GPU-ядер. У такій роботі агент має проаналізувати реалізацію, запропонувати зміну, запустити апаратно орієнтовані тести, інтерпретувати дані про продуктивність і вирішити, що спробувати далі. Успіх потребує багаторазових експериментів, а не однієї правильної генерації.
NVIDIA повідомляє, що під час роботи з GPU-ядрами AVO дослідила понад 500 напрямків, зафіксувала 40 версій ядер і досягла приросту продуктивності до 10,5% порівняно з FlashAttention-4 на системах DGX B200.
Переносна здатність тут — не обов’язково спеціальні знання про GPU-ядра. Радше йдеться про експериментальний процес: створити кандидата, виконати його, виміряти результат, зберегти отримані дані та змінити напрямок, якщо докази суперечать початковій гіпотезі. ARC-AGI-3 має інший інтерфейс завдань, але також винагороджує агентів, які можуть відкривати структуру через повторну взаємодію.
За повідомленнями, AVO пройшла весь публічний набір за 6 624 дії середовища, тоді як для VISTA повідомлялося про 7 542 дії. Це приблизно на 12% менше за умови проходження тих самих 183 рівнів.
Це важливо, оскільки метрика ARC-AGI-3 RHAE враховує не лише досягнення успішного стану, а й ефективність дій порівняно з людським виконанням. Отже, довготривала система має розумно керувати дослідженням: надмірні спроби й помилки можуть зробити навіть здібного агента повільним, дорогим або непрактичним.
Для бізнесу найкорисніший висновок має архітектурний характер. Надійна автономна система навряд чи буде просто великою мовною моделлю, підключеною до кількох інструментів. Навколо моделі потрібен керований виконувальний рівень.
До нього можуть входити:
Результат AVO також посилює аргументи на користь модульних агентних стеків. Якщо значна частина приросту продуктивності походить від оболонки, організаціям вигідно відокремлювати пам’ять, адаптери інструментів, набори оцінювання, політики доступу та спостережуваність від самої фундаментальної моделі. Це спрощує порівняння моделей, заміну постачальника або налаштування системи під конкретний робочий процес без перебудови всього стека.
Водночас результат тесту не можна сприймати як доказ корпоративної надійності. Показник 100% від NVIDIA — це заявлений результат на публічному наборі ARC-AGI-3. Він не підтверджує аналогічну ефективність на закритих завданнях, виробничих даних або ризикованих бізнес-процесах. Потрібні незалежне відтворення, перевірка на прихованих наборах, аналіз вартості й затримок, аудит безпеки та окреме оцінювання ризиків.
AVO зміщує фокус із питання «Яка модель найрозумніша?» до практичнішого: Яка система здатна зберігати контекст, користуватися інструментами, навчатися на зворотному зв’язку та надійно відновлюватися під час тривалого робочого процесу?
Модель залишається важливою, але ARC-AGI-3 наочно демонструє: агентська оболонка може визначити, чи збережеться потенціал моделі під час взаємодії з незнайомим середовищем. Для компаній, які створюють автономний ШІ, конкурентна перевага дедалі частіше може бути не в одному виклику моделі, а в якості всієї системи виконання.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
NVIDIA повідомляє, що AVO у зв’язці з Claude Opus 5 набрала 100,00 RHAE у публічному наборі ARC AGI 3: система пройшла всі 183 рівні у 25 середовищах, виконавши 6 624 дії.
NVIDIA повідомляє, що AVO у зв’язці з Claude Opus 5 набрала 100,00 RHAE у публічному наборі ARC AGI 3: система пройшла всі 183 рівні у 25 середовищах, виконавши 6 624 дії. Головний висновок стосується не лише моделі, а й агентної оболонки: постійна пам’ять, використання інструментів, перевірка результатів, коригування стратегії та нагляд допомогли перетворити результат окремого Opus 5 н...