NVIDIA afirma que AVO, ejecutado con Claude Opus 5, obtuvo 100,00 RHAE en el conjunto público de ARC AGI 3 y completó los 183 niveles de 25 entornos con 6.624 acciones. La principal lección no es solo la capacidad del modelo: la memoria persistente, el uso de herramientas, la revisión basada en resultados y la super...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s Agentic Variation Operators (AVO) agent achieve a perfect 100% score on the ARC-AGI-3 interactive reasoning benchmark, and. Article summary: NVIDIA reports that AVO achieved 100.00 RHAE on ARC-AGI-3’s public set by pairing Claude Opus 5 with a long-horizon agent harness—not by relying on a stronger base model alone. It completed all 183 levels in 25 environme. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
NVIDIA afirma que su sistema Agentic Variation Operators (AVO) logró una puntuación perfecta de 100,00 RHAE en el conjunto público del benchmark interactivo ARC-AGI-3. Ejecutado con Claude Opus 5, AVO completó los 183 niveles de 25 entornos utilizando 6.624 acciones.
Lo llamativo no es que haya aparecido de repente un modelo fundacional capaz de resolver por sí solo todo el benchmark. La clave está en que una arquitectura de agentes creada para ingeniería de software y optimización de núcleos de GPU se trasladó a una tarea de razonamiento interactivo muy distinta.
En la instantánea publicada de la clasificación de ARC-AGI-3, Claude Opus 5 aparecía con un 30,2%, mientras que GPT-5.6 Sol registraba un 7,8% bajo el sistema de evaluación estándar.
El resultado de NVIDIA combina el modelo subyacente con un sistema de ejecución diseñado para mantener el trabajo durante muchos pasos. AVO puede inspeccionar y modificar artefactos, ejecutar herramientas y comandos, consultar documentación, evaluar resultados y cambiar de estrategia a partir de la información recibida del entorno.
En la práctica, sustituye el patrón de pregunta y respuesta de un solo intento por un ciclo continuo:
Este ciclo es especialmente relevante en ARC-AGI-3. En este benchmark, los agentes deben explorar entornos desconocidos e inferir sus reglas y objetivos mediante la interacción, en lugar de responder a una instrucción completamente especificada.
El sistema combina varias capacidades que, por separado, pueden parecer sencillas, pero que adquieren fuerza cuando se coordinan durante tareas largas.
La memoria persistente permite conservar descubrimientos, intentos fallidos y datos relevantes, en vez de tratar cada movimiento como una conversación aislada. En una prueba basada en la exploración, esto puede reducir la repetición de errores y ayudar al agente a construir un modelo operativo de un entorno desconocido.
AVO nació como un sistema de agentes de programación capaz de inspeccionar código, introducir cambios, ejecutar comandos y validar resultados. Su razonamiento queda conectado a consecuencias observables: una propuesta puede probarse, medirse y revisarse, no simplemente aceptarse porque parece convincente.
Una capa supervisora ayuda a coordinar el proceso prolongado. En lugar de dejar que una única llamada al modelo controle indefinidamente todas las decisiones, el sistema puede vigilar el progreso, detectar líneas de trabajo improductivas y facilitar la recuperación cuando falla una suposición. Las descripciones de NVIDIA presentan AVO como una combinación de memoria, herramientas de ejecución, retroalimentación externa y supervisión para sostener un trabajo autónomo de larga duración.
En conjunto, estos elementos proporcionan una estructura para explorar, actuar, observar y corregir. El modelo sigue aportando buena parte del razonamiento, pero el harness —la infraestructura que lo envuelve— determina cómo se aplica ese razonamiento dentro del entorno.
La comparación resulta útil, aunque las cifras deben leerse junto con las condiciones de evaluación.
| Sistema o configuración | Resultado comunicado en ARC-AGI-3 | Contexto de evaluación |
|---|---|---|
| AVO con Claude Opus 5 | 100,00 RHAE | Conjunto público; 183 de 183 niveles completados |
| Claude Opus 5 por sí solo | 30,2% | Instantánea publicada de la clasificación y configuración estándar de comparación |
| GPT-5.6 Sol | 7,8% | Comparación estándar o semiprivada verificada |
| GPT-5.6 Sol con razonamiento conservado y compactación | 38,3% | Ejecución personalizada comunicada por OpenAI sobre tareas públicas |
Las cifras de AVO y de Opus 5 sin el sistema no miden exactamente lo mismo. La primera corresponde al resultado de un sistema de agentes completo sobre el conjunto público; la segunda, a la puntuación de un modelo bajo un harness de benchmark. Esa diferencia es fundamental para entender el caso.
GPT-5.6 Sol ofrece otra demostración de la misma sensibilidad. Los resultados publicados por ARC Prize sitúan a Sol en 7,78% con el máximo esfuerzo de razonamiento, mientras que OpenAI informó por separado de un 38,3% en tareas públicas al conservar el razonamiento entre turnos y utilizar compactación. Estas cifras no sustituyen a la puntuación oficial de la clasificación ni constituyen una comparación idéntica, pero sí muestran cuánto pueden influir la memoria y la gestión del estado en un benchmark de agentes.
La conclusión más prudente no es que un modelo sea universalmente superior al otro. Es que el rendimiento autónomo depende en gran medida de la combinación de modelo, política de memoria, interfaz de herramientas, gestión del estado y sistema de evaluación.
El entorno original de AVO era la ingeniería de software compleja y la optimización de núcleos de GPU. Allí, un agente debe inspeccionar una implementación, proponer un cambio, ejecutar pruebas basadas en el hardware, interpretar los datos de rendimiento y decidir qué probar a continuación. El éxito exige experimentar repetidamente, no generar una única respuesta correcta.
NVIDIA informa de que AVO exploró más de 500 direcciones, registró 40 versiones de núcleos y alcanzó una mejora de hasta el 10,5% frente a FlashAttention-4 en sistemas DGX B200.
La capacidad transferible no es necesariamente el conocimiento específico de las GPU. Es el proceso experimental: generar una alternativa, ejecutarla, medir el resultado, conservar lo aprendido y cambiar de rumbo cuando las evidencias contradicen la hipótesis. ARC-AGI-3 utiliza una interfaz diferente, pero también premia a los agentes capaces de descubrir estructuras mediante interacciones repetidas.
Según los datos comunicados, AVO resolvió el conjunto público completo en 6.624 acciones de entorno, frente a las 7.542 atribuidas a VISTA. Eso supone una reducción aproximada del 12% mientras completaba los mismos 183 niveles.
El dato importa porque la métrica RHAE de ARC-AGI-3 incorpora la eficiencia de las acciones en relación con el rendimiento humano, no solo la capacidad de alcanzar finalmente un estado correcto. Un sistema de larga duración debe, por tanto, explorar con criterio: demasiados intentos pueden volverlo ineficiente, caro o poco práctico.
Para las empresas, la lección más útil es arquitectónica. Un sistema autónomo fiable probablemente no será simplemente un modelo de lenguaje conectado a unas cuantas herramientas. Necesitará una capa de ejecución gobernada alrededor del modelo.
Esa capa puede incluir:
El resultado de AVO también refuerza la apuesta por las arquitecturas modulares de agentes. Si una parte importante de la mejora procede del harness, las organizaciones pueden beneficiarse de mantener separadas la memoria, las adaptaciones de herramientas, las pruebas de evaluación, los controles de políticas y la observabilidad del modelo fundacional. Así resulta más sencillo comparar modelos, cambiar de proveedor o ajustar el sistema a un flujo de trabajo concreto sin reconstruir toda la plataforma.
Pero el 100% no debe interpretarse como una prueba de fiabilidad empresarial. La cifra de NVIDIA corresponde a un resultado comunicado sobre el conjunto público de ARC-AGI-3. No demuestra un rendimiento equivalente en tareas privadas del benchmark, datos de producción o procesos empresariales de alto riesgo. Aún son necesarias la replicación independiente, las pruebas con conjuntos ocultos, el análisis de costes y latencia, las revisiones de seguridad y las evaluaciones de protección.
El resultado de AVO desplaza la pregunta de «¿qué modelo es más inteligente?» hacia otra mucho más operativa: ¿qué sistema puede conservar el contexto, utilizar herramientas, aprender de la retroalimentación y recuperarse de los errores durante un flujo de trabajo largo?
El modelo sigue siendo importante, pero ARC-AGI-3 ofrece una demostración clara de que la infraestructura que lo rodea puede decidir si sus capacidades sobreviven al contacto con un entorno desconocido. Para las organizaciones que desarrollan IA autónoma, la ventaja competitiva podría estar cada vez más en la calidad del sistema de ejecución y no únicamente en la llamada al modelo.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
NVIDIA afirma que AVO, ejecutado con Claude Opus 5, obtuvo 100,00 RHAE en el conjunto público de ARC AGI 3 y completó los 183 niveles de 25 entornos con 6.624 acciones.
NVIDIA afirma que AVO, ejecutado con Claude Opus 5, obtuvo 100,00 RHAE en el conjunto público de ARC AGI 3 y completó los 183 niveles de 25 entornos con 6.624 acciones. La principal lección no es solo la capacidad del modelo: la memoria persistente, el uso de herramientas, la revisión basada en resultados y la supervisión transformaron un rendimiento independiente de alrededor del 30...