OpenAI заявляє, що GPT 6 Astra робить менше фактичних помилок і значно краще протистоїть джейлбрейкам та prompt injection, ніж GPT 5.6 Sol, зокрема під час тривалих багатокрокових атак. У IPI Arena від Gray Swan жодна з 13 протестованих передових моделей не виявилася імунною до прихованих ін’єкцій у 41 сценарії; уча...
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI називає GPT-6 Astra помітно безпечнішим наступником GPT-5.6 Sol: модель, за даними компанії, рідше припускається фактичних помилок, краще розпізнає prompt injection і значно стійкіша до джейлбрейків — зокрема до атак, що розгортаються впродовж довгої послідовності кроків. 25
30
Але це не означає імунітету. Коли ШІ-агент читає вебсторінки, листи, документи, репозиторії коду або відповіді інструментів, у цих матеріалах можуть бути приховані ворожі інструкції. За результатами тестування непрямих ін’єкцій підказок (indirect prompt injection, IPI) від Gray Swan, жодна перевірена модель не була від них повністю захищена. 4
OpenAI повідомляє, що Astra суттєво стійкіша до джейлбрейків, ніж GPT-5.6 Sol, включно з атаками на довгих траєкторіях взаємодії. Це важливо, бо зловмисник може не обмежуватися одним очевидно шкідливим запитом: він здатен змінювати тактику протягом багатьох повідомлень і використовувати накопичений контекст. 25
Також OpenAI заявляє про кращу стійкість Astra до ін’єкцій підказок у сценаріях перегляду вебу та офісної роботи, а також про меншу кількість фактичних помилок порівняно із Sol. Водночас ці результати не варто трактувати як звичайний «рівень галюцинацій» у повсякденному використанні: тести відтворення помилок були побудовані на розмовах ChatGPT, які користувачі вже позначили як помилкові. 25
30
Ці покращення особливо важливі для агентів, що мають шукати інформацію, писати код, працювати в браузері та виконувати складні багатокрокові завдання. У примітках до релізу OpenAI зазначає, що Astra може створювати документи, електронні таблиці та презентації за шаблонами й інструкціями користувача. 19
Наявні дані не дають підстав стверджувати, що Astra в усіх умовах безпечніша за Anthropic Claude Opus 5 — чи то за фактичністю, протидією прямим джейлбрейкам, чи стійкістю до непрямих ін’єкцій.
Для чесного міжмодельного порівняння потрібні спільний набір атак, однакові інструменти агента та системні інструкції, єдине визначення успішної атаки й зіставні можливості зловмисника адаптуватися. Оцінки постачальників і публічні red-team-змагання можуть суттєво відрізнятися за всіма цими параметрами. Матеріали Gray Swan вказують Claude Opus 5 серед моделей Arena, однак не надають зіставної таблиці результатів Astra проти Opus 5. 1
4
Отже, коректний висновок вужчий: найсильніші оприлюднені докази OpenAI стосуються переваги Astra над її власною попередницею — GPT-5.6 Sol.
Прямий джейлбрейк починається з видимого запиту атакувальника до моделі — наприклад, зі спроби змусити її проігнорувати правила або виконати заборонену дію. Заявлене OpenAI посилення захисту від атак на довгих траєкторіях найбільше стосується саме такого наполегливого, адаптивного противника. 25
Непряма ін’єкція підказки надходить через контент, який споживає агент. Шкідлива інструкція може бути захована у вебсторінці, електронному листі, документі, результаті пошуку, сліді роботи агента з кодом або відповіді інструмента. IPI Challenge від Gray Swan зосереджувався саме на прихованих підказках у реалістичних середовищах — вебконтенті, виводі інструментів і трасах кодових агентів. 5
Ключова відмінність: людина, яка користується агентом, може взагалі не побачити ворожої інструкції.
Gray Swan повідомила про результати IPI Arena за участю 13 передових моделей, 464 red-team-дослідників, у 41 сценарії та з понад 272 000 спроб атак. Висновок організації: жодна протестована модель не виявилася імунною до непрямих ін’єкцій підказок. 4
Це вагоме свідчення, що IPI досі є невирішеною проблемою для агентних систем. Однак це не повний нейтральний рейтинг усіх аспектів безпеки. Результат не означає, що всі моделі ламаються з однаковою частотою, і не замінює окремих оцінок фактичності чи стійкості до прямих джейлбрейків.
Для звичайного чатбота успішна ін’єкція може обернутися хибною або маніпулятивною відповіддю. Для корпоративного агента, підключеного до бізнес-систем, наслідки потенційно значно серйозніші.
OpenAI віднесла Astra до рівня Critical за кібербезпековими можливостями у своїй Preparedness Framework. За твердженням компанії, за наявності потрібних інструментів і доступу модель може знаходити раніше невідомі вразливості та розробляти способи їх експлуатації в багатьох добре захищених системах без покрокового супроводу людини. 27
Це може бути корисним для авторизованого захисту. Водночас така спроможність підвищує ціну помилки в скомпрометованому агентному процесі: атакувальник, який перенаправив агента через недовірений контент, може намагатися вплинути на його пошук, виклики інструментів або запропоновані дії. Ризик зростає, якщо агент має доступ до чутливих даних, репозиторіїв коду, хмарної інфраструктури, браузера чи корпоративних застосунків.
Стійкість моделі до prompt injection слід вважати лише одним із шарів захисту, а не межею безпеки. Для високоризикових агентних процесів варто:
OpenAI також описувала посилену ізоляцію, обмеження мережевого й інструментального доступу, моніторинг і виконання в пісочниці як запобіжники для потужніших систем. 34
Заявлене зменшення фактичних помилок і кращий захист від прямих джейлбрейків роблять GPT-6 Astra сильнішим наступником GPT-5.6 Sol. 25
30 Проте надані дані не дозволяють категорично назвати її безпечнішою за Claude Opus 5 у всіх сценаріях, а непрямі ін’єкції підказок лишаються суттєвою слабкістю екосистеми ШІ-агентів.
4
Для компаній практичний висновок простий: обирати сильнішу модель недостатньо. Систему потрібно будувати так, щоб шкідливий документ чи вебсторінка не могли перетворити можливості моделі та підключені до неї інструменти на канал контролю з боку атакувальника.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI заявляє, що GPT 6 Astra робить менше фактичних помилок і значно краще протистоїть джейлбрейкам та prompt injection, ніж GPT 5.6 Sol, зокрема під час тривалих багатокрокових атак.
OpenAI заявляє, що GPT 6 Astra робить менше фактичних помилок і значно краще протистоїть джейлбрейкам та prompt injection, ніж GPT 5.6 Sol, зокрема під час тривалих багатокрокових атак. У IPI Arena від Gray Swan жодна з 13 протестованих передових моделей не виявилася імунною до прихованих ін’єкцій у 41 сценарії; учасники здійснили понад 272 000 спроб атак.
Надані матеріали не містять зіставних незалежних даних, які дозволяли б остаточно ранжувати GPT 6 Astra та Claude Opus 5 за фактичністю чи стійкістю до джейлбрейків.