OpenAI menyatakan GPT 6 Astra membuat lebih sedikit kesalahan faktual serta jauh lebih tahan terhadap jailbreak dan prompt injection dibanding GPT 5.6 Sol, termasuk serangan adaptif yang berjalan dalam banyak langkah. IPI Arena dari Gray Swan melibatkan 13 model frontier, 464 red teamer, 41 skenario, dan lebih dari...
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI menyebut GPT-6 Astra sebagai peningkatan keselamatan yang berarti dibanding GPT-5.6 Sol. Dalam evaluasi perusahaan, Astra dilaporkan menghasilkan lebih sedikit kesalahan faktual, lebih tangguh menghadapi prompt injection, dan jauh lebih tahan terhadap jailbreak—termasuk serangan yang berkembang melalui rangkaian interaksi panjang. 25
30
Namun, ada batas penting: perilaku model yang lebih baik tidak membuat agen AI kebal terhadap instruksi berbahaya yang disisipkan dalam halaman web, dokumen, email, repositori kode, atau keluaran alat yang dibacanya. Pengujian indirect prompt injection (IPI) dari Gray Swan menemukan bahwa tidak ada model yang diuji benar-benar kebal. 4
Menurut OpenAI, Astra jauh lebih tangguh terhadap jailbreak dibanding GPT-5.6 Sol, termasuk pada serangan dengan lintasan panjang. Ini relevan karena penyerang canggih tidak harus memakai satu prompt yang terang-terangan. Mereka dapat menyesuaikan strategi selama percakapan multi-putaran dan memanfaatkan konteks yang makin menumpuk. 25
OpenAI juga melaporkan ketahanan prompt injection yang lebih baik dalam konteks penjelajahan web dan pekerjaan kantor, serta lebih sedikit kesalahan faktual dibanding Sol. Meski begitu, perbandingan faktualitas ini perlu dibaca hati-hati. Uji reproduksi kesalahan yang dilaporkan berfokus pada percakapan ChatGPT yang sebelumnya ditandai pengguna sebagai jawaban keliru, sehingga bukan gambaran tingkat halusinasi dalam pemakaian sehari-hari. 25
30
Peningkatan ini tetap berarti, khususnya bagi agen yang ditugaskan melakukan riset, menulis kode, menjelajah web, dan menyelesaikan pekerjaan multilangkah. Catatan rilis OpenAI menyebut Astra mendukung tugas kompleks dan dapat membuat dokumen, spreadsheet, serta presentasi. 19
Bukti yang tersedia tidak cukup untuk menyatakan secara universal bahwa Astra lebih aman daripada Claude Opus 5 dari Anthropic dalam hal faktualitas, jailbreak langsung, maupun indirect prompt injection.
Peringkat keselamatan lintas-model memerlukan set pengujian yang sama, alat agen yang setara, instruksi sistem identik, definisi keberhasilan serangan yang seragam, serta penyerang yang dapat beradaptasi dengan cara sebanding. Evaluasi vendor dan tantangan red teaming publik dapat berbeda pada semua variabel tersebut. Materi Gray Swan mencantumkan Claude Opus 5 sebagai model yang tersedia di Arena, tetapi hasil yang diberikan tidak memuat kartu skor Astra versus Opus 5 yang benar-benar sebanding. 1
4
Kesimpulan yang paling dapat dipertanggungjawabkan lebih sempit: bukti terkuat OpenAI adalah bahwa Astra meningkat dibanding pendahulunya sendiri, GPT-5.6 Sol.
Jailbreak langsung berawal dari permintaan penyerang yang terlihat oleh model, misalnya upaya untuk mengesampingkan aturan atau memancing tindakan terlarang. Peningkatan Astra terhadap serangan dalam lintasan panjang paling relevan untuk lawan yang gigih dan adaptif seperti ini. 25
Sebaliknya, indirect prompt injection datang dari konten yang sedang diproses agen. Instruksi berbahaya dapat disembunyikan di halaman web, email, dokumen, hasil pencarian, jejak kerja agen pengodean, atau keluaran alat. Tujuannya adalah mengalihkan agen dari sasaran pengguna. Tantangan IPI Gray Swan secara khusus menguji prompt tersembunyi dalam lingkungan realistis, termasuk konten web, keluaran alat, dan jejak agen pengodean. 5
Perbedaannya krusial: orang yang menjalankan agen mungkin sama sekali tidak melihat instruksi berbahaya tersebut.
Gray Swan melaporkan IPI Arena yang melibatkan 13 model frontier, 464 red teamer, 41 skenario, dan lebih dari 272.000 percobaan serangan. Kesimpulan yang mereka nyatakan: tidak ada model yang diuji keluar sebagai model yang kebal terhadap indirect prompt injection. 4
Ini merupakan bukti kuat bahwa IPI masih menjadi masalah yang belum terselesaikan bagi penerapan agen AI. Akan tetapi, hasil itu bukan papan peringkat netral-vendor yang lengkap untuk seluruh dimensi keselamatan. Temuan tersebut tidak berarti setiap model gagal pada tingkat yang sama, dan tidak menggantikan evaluasi khusus model untuk faktualitas atau ketahanan terhadap jailbreak langsung.
Pada asisten chat mandiri, injeksi yang berhasil mungkin hanya berujung pada jawaban menyesatkan. Pada agen perusahaan yang terhubung ke sistem bisnis, dampaknya dapat jauh lebih besar.
OpenAI mengklasifikasikan Astra sebagai model yang memenuhi ambang kapabilitas keamanan siber Critical dalam Preparedness Framework. OpenAI menyatakan bahwa, dengan alat dan akses yang sesuai, Astra dapat menemukan celah keamanan yang sebelumnya belum diketahui serta menyusun cara mengeksploitasinya di banyak sistem yang terlindungi ketat tanpa panduan manusia langkah demi langkah. 27
Kapabilitas itu dapat berguna untuk pertahanan yang sah dan berizin. Namun, ia juga meningkatkan konsekuensi bila alur kerja agen berhasil dialihkan: penyerang yang mengarahkan agen melalui konten tak tepercaya dapat mencoba memengaruhi apa yang dicari agen, alat mana yang dipanggil, atau tindakan apa yang diusulkannya. Risikonya meningkat ketika agen memiliki akses ke data sensitif, repositori kode, lingkungan cloud, browser, atau aplikasi bisnis.
Ketahanan terhadap prompt injection sebaiknya diperlakukan sebagai satu lapisan pertahanan, bukan sebagai batas keamanan utama. Untuk alur kerja agen dengan dampak besar, organisasi sebaiknya:
OpenAI telah menggambarkan isolasi yang lebih kuat, pembatasan akses jaringan dan alat, pemantauan, serta eksekusi dalam sandbox sebagai pengamanan bagi sistem yang lebih kapabel. 34
Penurunan kesalahan faktual yang dilaporkan dan peningkatan ketahanan terhadap jailbreak langsung menjadikan Astra penerus yang lebih kuat dari GPT-5.6 Sol. 25
30 Namun, bukti yang tersedia tidak mendukung klaim bahwa Astra secara mutlak lebih aman daripada Claude Opus 5 di semua kondisi. Indirect prompt injection juga tetap menjadi kelemahan penting dalam ekosistem agen AI.
4
Bagi perusahaan, pelajarannya sederhana: pilih model terkuat yang tersedia, tetapi rancang sistem di sekelilingnya agar dokumen atau halaman web berbahaya tidak dapat mengubah kemampuan model dan alat yang terhubung menjadi saluran yang dikendalikan penyerang.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
OpenAI menyatakan GPT 6 Astra membuat lebih sedikit kesalahan faktual serta jauh lebih tahan terhadap jailbreak dan prompt injection dibanding GPT 5.6 Sol, termasuk serangan adaptif yang berjalan dalam banyak langkah.
OpenAI menyatakan GPT 6 Astra membuat lebih sedikit kesalahan faktual serta jauh lebih tahan terhadap jailbreak dan prompt injection dibanding GPT 5.6 Sol, termasuk serangan adaptif yang berjalan dalam banyak langkah. IPI Arena dari Gray Swan melibatkan 13 model frontier, 464 red teamer, 41 skenario, dan lebih dari 272.000 percobaan serangan.
Materi yang tersedia belum memberikan bukti publik yang sebanding untuk menetapkan peringkat pasti antara Astra dan Claude Opus 5 dalam akurasi faktual maupun ketahanan terhadap jailbreak.