OpenAI menyatakan GPT 6 Astra menghasilkan lebih sedikit kesilapan fakta serta jauh lebih tahan terhadap jailbreak dan suntikan arahan berbanding GPT 5.6 Sol, termasuk serangan adaptif merentasi interaksi yang panjang. Arena IPI Gray Swan mendapati tiada model yang diuji kebal terhadap suntikan arahan tersembunyi, m...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI menyifatkan GPT-6 Astra sebagai peningkatan keselamatan yang bermakna berbanding GPT-5.6 Sol dalam penilaiannya sendiri. Menurut syarikat itu, Astra menghasilkan lebih sedikit kesilapan fakta, lebih tahan terhadap suntikan arahan (prompt injection) dan jauh lebih kukuh menghadapi jailbreak — termasuk serangan yang berkembang sepanjang rentetan interaksi yang panjang. 25
30
Namun, batas pentingnya ialah konteks penggunaan. Model yang lebih baik tidak menjadikan ejen AI kebal apabila ia membaca arahan berniat jahat yang disorokkan dalam laman web, dokumen, e-mel, repositori kod atau output alat. Ujian suntikan arahan tidak langsung (indirect prompt injection, IPI) oleh Gray Swan mendapati tiada model yang diuji benar-benar kebal. 4
OpenAI menyatakan Astra jauh lebih tahan terhadap jailbreak berbanding GPT-5.6 Sol, termasuk dalam serangan yang bergerak melalui trajektori lebih panjang. Ini penting kerana penyerang yang canggih tidak semestinya bergantung pada satu arahan yang jelas mencurigakan. Mereka boleh menyesuaikan taktik sepanjang perbualan berbilang giliran dan cuba mengeksploitasi konteks yang terkumpul. 25
OpenAI turut melaporkan ketahanan suntikan arahan yang lebih baik dalam persekitaran pelayaran web dan kerja pejabat, di samping lebih sedikit kesilapan fakta berbanding Sol. Namun, perbandingan ketepatan fakta itu perlu ditafsir dengan berhati-hati: ujian pengulangan ralat menggunakan perbualan yang telah ditandakan pengguna sebagai salah, bukannya kadar halusinasi dalam penggunaan harian. 25
30
Peningkatan ini penting khususnya untuk ejen yang menjalankan penyelidikan, menulis kod, melayari web dan menyiapkan tugasan berbilang langkah. Nota keluaran OpenAI menyatakan Astra menyokong kerja kompleks berbilang langkah serta boleh menghasilkan dokumen, hamparan dan pembentangan. 19
Bukti yang ada tidak menyokong dakwaan umum bahawa Astra lebih selamat daripada Claude Opus 5 keluaran Anthropic dalam semua aspek — sama ada ketepatan fakta, jailbreak langsung atau suntikan arahan tidak langsung.
Perbandingan keselamatan rentas model memerlukan set ujian yang sama, alat ejen yang sepadan, arahan sistem yang serupa, takrif kejayaan serangan yang dikongsi, serta penyerang yang boleh menyesuaikan tindakan dengan cara setara. Penilaian vendor dan cabaran pasukan merah awam boleh berbeza bagi semua pemboleh ubah tersebut. Bahan Gray Swan menyenaraikan Claude Opus 5 sebagai antara model dalam Arenanya, tetapi keputusan yang dibekalkan tidak menyediakan kad skor Astra berbanding Opus 5 secara setara. 1
4
Kesimpulan yang boleh dipertahankan lebih sempit: bukti paling kukuh OpenAI ialah bahawa Astra bertambah baik berbanding pendahulunya sendiri, GPT-5.6 Sol.
Jailbreak langsung bermula dengan permintaan penyerang yang dapat dilihat oleh model — misalnya cubaan mengatasi peraturan model atau memaksanya melakukan tindakan yang dilarang. Peningkatan Astra terhadap trajektori serangan panjang paling berkaitan dengan penyerang yang berterusan dan adaptif seperti ini. 25
Sebaliknya, suntikan arahan tidak langsung tiba melalui kandungan yang sedang digunakan oleh ejen. Arahan berniat jahat boleh diselitkan dalam laman web, e-mel, dokumen, hasil carian, jejak kerja pengekodan atau output alat untuk memesongkan ejen daripada matlamat sebenar pengguna. Cabaran IPI Gray Swan memberi tumpuan kepada arahan tersembunyi dalam persekitaran realistik seperti kandungan web, output alat dan jejak ejen pengekodan. 5
Perbezaan ini kritikal: pengguna yang mengendalikan ejen mungkin langsung tidak nampak arahan berbahaya tersebut.
Gray Swan melaporkan IPI Arena yang melibatkan 13 model AI hadapan, 464 peserta pasukan merah, 41 senario dan lebih 272,000 cubaan serangan. Kesimpulannya: tiada model yang diuji kebal terhadap suntikan arahan tidak langsung. 4
Ini ialah petunjuk kukuh bahawa IPI masih masalah yang belum diselesaikan bagi pelaksanaan ejen AI. Namun, ia bukan papan kedudukan lengkap dan berkecuali vendor untuk setiap dimensi keselamatan. Dapatan itu tidak bermaksud setiap model gagal pada kadar sama, dan tidak menggantikan penilaian khusus model tentang ketepatan fakta atau ketahanan terhadap jailbreak langsung.
Bagi pembantu sembang yang berdiri sendiri, suntikan yang berjaya mungkin menghasilkan jawapan mengelirukan. Tetapi bagi ejen perusahaan yang disambungkan kepada sistem perniagaan, kesannya boleh jauh lebih besar.
OpenAI mengklasifikasikan Astra sebagai mencapai ambang keupayaan keselamatan siber Kritikal di bawah Preparedness Framework-nya. Dengan alat dan akses yang sesuai, OpenAI menyatakan Astra boleh mencari kelemahan keselamatan yang belum diketahui dan membangunkan cara mengeksploitasinya merentasi banyak sistem yang dilindungi rapi tanpa panduan manusia langkah demi langkah. 27
Keupayaan itu boleh bermanfaat untuk pertahanan yang dibenarkan. Namun, ia turut meningkatkan akibat sekiranya aliran kerja ejen dikompromi: penyerang yang berjaya mengalih hala ejen melalui kandungan tidak dipercayai mungkin cuba mempengaruhi apa yang dicari ejen, alat yang dipanggilnya atau tindakan yang dicadangkannya. Risiko meningkat apabila ejen mempunyai akses kepada data sensitif, repositori kod, persekitaran awan, pelayar atau aplikasi perniagaan.
Anggap ketahanan terhadap suntikan arahan sebagai satu lapisan pertahanan, bukannya sempadan keselamatan utama. Untuk aliran kerja ejen yang berimpak tinggi, organisasi patut:
OpenAI sendiri menerangkan pengasingan yang lebih kukuh, akses rangkaian dan alat yang disekat, pemantauan serta pelaksanaan dalam kotak pasir sebagai langkah perlindungan untuk sistem yang lebih berkeupayaan. 34
Pengurangan kesilapan fakta yang dilaporkan dan ketahanan lebih baik terhadap jailbreak langsung menjadikan Astra pengganti yang lebih kukuh kepada GPT-5.6 Sol. 25
30 Namun, tiada bukti yang dibekalkan menyokong dakwaan bahawa Astra secara mutlak lebih selamat daripada Claude Opus 5 dalam semua keadaan, manakala suntikan arahan tidak langsung kekal sebagai kelemahan penting dalam ekosistem ejen AI.
4
Bagi perusahaan, pengajarannya mudah: pilih model terkuat yang tersedia, tetapi bina sistem sekelilingnya supaya dokumen atau laman web berniat jahat tidak dapat menjadikan keupayaan model dan alat yang disambungkan sebagai saluran kawalan penyerang.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI menyatakan GPT 6 Astra menghasilkan lebih sedikit kesilapan fakta serta jauh lebih tahan terhadap jailbreak dan suntikan arahan berbanding GPT 5.6 Sol, termasuk serangan adaptif merentasi interaksi yang panjang.
OpenAI menyatakan GPT 6 Astra menghasilkan lebih sedikit kesilapan fakta serta jauh lebih tahan terhadap jailbreak dan suntikan arahan berbanding GPT 5.6 Sol, termasuk serangan adaptif merentasi interaksi yang panjang. Arena IPI Gray Swan mendapati tiada model yang diuji kebal terhadap suntikan arahan tersembunyi, melibatkan 13 model hadapan, 41 senario ejen dan lebih 272,000 cubaan serangan.
Bahan yang dibekalkan tidak menyediakan bukti perbandingan setara untuk menentukan kedudukan muktamad antara Astra dan Claude Opus 5 dari segi ketepatan fakta atau ketahanan terhadap jailbreak.