Keputusan AVO menggunakan model asas yang sama, tetapi dengan sistem pelaksanaan yang direka untuk mengekalkan kerja sepanjang banyak langkah. Sistem ini boleh memeriksa dan mengubah suai artifak, menjalankan alatan serta arahan, merujuk dokumentasi, menilai hasil dan menyemak semula pendekatan berdasarkan maklum balas luaran.
Secara mudah, AVO menggantikan corak soal jawab sekali lalu dengan gelung kerja seperti berikut:
Gelung ini amat penting dalam ARC-AGI-3. Dalam ujian tersebut, ejen perlu meneroka persekitaran interaktif yang tidak dikenali dan memahami peraturan serta objektif melalui interaksi—bukan sekadar menjawab arahan yang sudah lengkap.
Memori berterusan membolehkan ejen menyimpan penemuan, percubaan yang gagal dan keadaan penting, bukannya menganggap setiap tindakan sebagai pertukaran yang terasing. Dalam ujian berasaskan penerokaan, ciri ini boleh mengurangkan kesilapan berulang dan membantu ejen membina gambaran kerja tentang persekitaran yang belum dikenali.
AVO asalnya dibangunkan sebagai sistem ejen pengekodan yang boleh memeriksa kerja, membuat perubahan, menjalankan arahan dan mengesahkan hasil. Oleh itu, penaakulan ejen sentiasa dihubungkan kepada keputusan yang boleh diperhatikan: cadangan boleh diuji, diukur dan diperbaiki, bukannya diterima hanya kerana kedengarannya munasabah.
Lapisan penyelia membantu menyelaraskan proses yang panjang. Daripada membiarkan satu panggilan model mengawal setiap keputusan tanpa henti, sistem boleh memantau kemajuan, mengenal pasti arah yang tidak produktif dan membantu ejen pulih apabila sesuatu andaian ternyata salah. NVIDIA dan penerangan berkaitan menggambarkan AVO sebagai gabungan memori, alatan pelaksanaan, maklum balas luaran dan penyeliaan untuk kerja autonomi yang berterusan.
Secara keseluruhan, komponen ini menyediakan cara yang tersusun untuk ejen meneroka, bertindak, memerhati dan membetulkan kesilapan. Model masih menyumbang sebahagian besar penaakulan, tetapi harness menentukan sejauh mana penaakulan itu dapat diteruskan dalam persekitaran sebenar.
| Sistem atau konfigurasi | Keputusan ARC-AGI-3 yang dilaporkan | Konteks penilaian |
|---|---|---|
| AVO dengan Claude Opus 5 | 100.00 RHAE | Set awam; 183 daripada 183 tahap diselesaikan |
| Claude Opus 5 sahaja | 30.2% | Gambaran papan pendahulu yang diterbitkan dan tetapan perbandingan standard |
| GPT-5.6 Sol | 7.8% | Perbandingan standard atau separa persendirian yang disahkan |
| GPT-5.6 Sol dengan penaakulan dikekalkan dan pemampatan konteks | 38.3% | Ujian tersuai OpenAI pada tugasan awam |
Perbandingan ini perlu dibaca dengan berhati-hati kerana semua angka tersebut tidak semestinya mengukur perkara yang sama. Skor AVO ialah keputusan sistem ejen lengkap pada set awam, manakala skor model secara bersendirian diperoleh melalui harness penanda aras.
GPT-5.6 Sol turut menunjukkan betapa pentingnya konfigurasi. Keputusan yang diterbitkan ARC Prize meletakkan Sol pada 7.78% dengan usaha penaakulan maksimum, sementara OpenAI melaporkan 38.3% pada tugasan awam selepas mengekalkan penaakulan merentas giliran dan menggunakan pemampatan konteks. Angka itu bukan pengganti setara kepada skor papan pendahulu rasmi, tetapi ia menunjukkan bahawa pengurusan memori dan keadaan boleh mengubah prestasi dengan ketara dalam penanda aras ejen.
Kesimpulan paling selamat bukanlah bahawa satu model secara mutlak lebih baik daripada yang lain. Prestasi autonomi bergantung pada gabungan model, dasar memori, antara muka alatan, pengurusan keadaan, strategi penilaian dan harness.
Persekitaran asal AVO ialah kejuruteraan perisian yang sukar serta pengoptimuman kernel GPU. Dalam situasi ini, ejen perlu memeriksa pelaksanaan, mencadangkan perubahan, menjalankan ujian berasaskan perkakasan, mentafsir maklum balas prestasi dan menentukan percubaan seterusnya. Kejayaan memerlukan eksperimen berulang, bukan satu hasil kod yang betul pada percubaan pertama.
NVIDIA melaporkan bahawa AVO meneroka lebih daripada 500 arah, menghasilkan 40 versi kernel dan mencapai peningkatan prestasi sehingga 10.5% berbanding FlashAttention-4 pada sistem DGX B200.
Kemahiran yang boleh dipindahkan ke ARC-AGI-3 bukan semestinya pengetahuan khusus tentang kernel GPU. Yang lebih penting ialah proses eksperimen: menghasilkan calon penyelesaian, melaksanakannya, mengukur keputusan, menyimpan perkara yang dipelajari dan menukar arah apabila bukti bercanggah dengan hipotesis.
ARC-AGI-3 menggunakan antara muka tugasan yang berbeza, tetapi tetap memberi ganjaran kepada ejen yang mampu menemui struktur melalui interaksi berulang.
AVO dilaporkan menyelesaikan keseluruhan set awam menggunakan 6,624 tindakan persekitaran, berbanding 7,542 tindakan yang dilaporkan untuk VISTA. Ini bermakna pengurangan kira-kira 12% sambil menyelesaikan 183 tahap yang sama.
Perkara ini penting kerana metrik RHAE ARC-AGI-3 mengambil kira kecekapan tindakan berbanding prestasi manusia, bukan sekadar sama ada ejen akhirnya mencapai keadaan yang berjaya.
Sistem ejen jangka panjang perlu mengurus penerokaan dengan cermat. Terlalu banyak percubaan dan kesilapan boleh menjadikan ejen yang berkemampuan kurang cekap, lebih mahal dan sukar digunakan dalam operasi sebenar.
Untuk kegunaan perusahaan, pengajaran paling praktikal daripada keputusan ini ialah kepentingan seni bina. Sistem autonomi yang boleh dipercayai mungkin bukan sekadar model bahasa besar yang disambungkan kepada beberapa alatan. Ia memerlukan lapisan pelaksanaan yang dikawal selia di sekeliling model.
Lapisan itu boleh merangkumi:
Keputusan AVO juga mengukuhkan hujah untuk menggunakan susunan ejen yang modular. Jika sebahagian besar peningkatan datang daripada harness, organisasi boleh memisahkan lapisan memori, penyambung alatan, suite penilaian, kawalan dasar dan pemerhatian daripada model asas. Dengan cara ini, model atau pembekal boleh dibandingkan dan diganti tanpa perlu membina semula keseluruhan sistem.
Namun, keputusan penanda aras ini tidak boleh dianggap sebagai bukti bahawa AVO sudah terbukti boleh dipercayai untuk perusahaan. Angka 100% NVIDIA ialah keputusan yang dilaporkan pada set awam ARC-AGI-3. Ia tidak membuktikan prestasi yang sama pada tugasan tersembunyi, data produksi atau proses perniagaan berisiko tinggi.
Ulangan bebas, ujian pada set tersembunyi, analisis kos dan kependaman, semakan keselamatan serta penilaian risiko masih diperlukan.
AVO mengalihkan perhatian daripada soalan “Model mana yang paling pintar?” kepada soalan yang lebih praktikal: Sistem mana yang mampu mengekalkan konteks, menggunakan alatan, belajar daripada maklum balas dan pulih dengan boleh dipercayai sepanjang aliran kerja yang panjang?
Model asas tetap penting. Tetapi keputusan ARC-AGI-3 menunjukkan bahawa harness di sekeliling model boleh menentukan sama ada keupayaannya bertahan apabila berdepan persekitaran yang asing.
Bagi organisasi yang membina AI autonomi, kelebihan daya saing pada masa depan mungkin terletak pada kualiti sistem pelaksanaan—bukan pada panggilan model semata-mata.