OpenAI заявляет, что GPT‑6 Astra допускает меньше фактических ошибок и значительно лучше GPT‑5.6 Sol противостоит джейлбрейкам и prompt injection атакам, в том числе в длительных многошаговых сценариях. В IPI Arena от Gray Swan ни одна протестированная модель не оказалась невосприимчивой к скрытым инъекциям: тест ох...
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI называет GPT‑6 Astra заметным шагом вперёд по сравнению с GPT‑5.6 Sol: модель, по оценкам компании, реже допускает фактические ошибки, лучше противостоит prompt-injection-атакам и значительно устойчивее к джейлбрейкам, включая атаки, развивающиеся в длинной последовательности действий и диалогов. 25
30
Но улучшенная модельная защита не означает иммунитета. ИИ-агент по-прежнему может прочитать вредоносную инструкцию, скрытую в веб-странице, письме, документе, репозитории кода или ответе подключённого инструмента. По итогам тестирования непрямых prompt-injection-атак (IPI) компания Gray Swan заявила: среди протестированных моделей не было ни одной полностью неуязвимой. 4
По данным OpenAI, Astra значительно устойчивее к джейлбрейкам, чем GPT‑5.6 Sol, в том числе к атакам на длинной траектории. Это существенно: атакующий не обязан ограничиваться одним очевидно вредоносным запросом. Он может менять тактику в ходе многоходового взаимодействия и пытаться использовать накопившийся контекст. 25
OpenAI также сообщает о более высокой устойчивости к prompt-injection-атакам при веб-сёрфинге и в рабочих сценариях, а также о снижении числа фактических ошибок по сравнению с Sol. Однако эти результаты о фактических ошибках следует трактовать осторожно: воспроизведение ошибок измерялось на диалогах ChatGPT, которые пользователи уже отметили как содержащие неверный ответ. Это не показатель обычной повседневной частоты «галлюцинаций». 25
30
Такие улучшения особенно важны для агентов, которым поручают исследования, программирование, работу в браузере и многошаговые процессы. В примечаниях к выпуску OpenAI указывает, что Astra рассчитана на сложные многоэтапные задачи и создание документов, таблиц и презентаций. 19
Имеющихся данных недостаточно, чтобы утверждать, будто Astra в целом безопаснее Anthropic Claude Opus 5 по точности, защите от прямых джейлбрейков или непрямых инъекций.
Для корректного межмодельного сравнения нужны единый набор атак, одинаковые инструменты агента и системные инструкции, общее определение успешной атаки и сопоставимая возможность атакующего адаптироваться по ходу теста. Оценки самих поставщиков и публичные red-team-соревнования могут различаться по всем этим параметрам. В материалах Gray Swan Claude Opus 5 указан среди моделей, доступных в Arena, но предоставленные результаты не содержат сопоставимой таблицы Astra против Opus 5. 1
4
Поэтому обоснованный вывод уже: наиболее сильные доказательства относятся к превосходству Astra над предшественницей GPT‑5.6 Sol, а не к универсальному лидерству над Claude Opus 5.
При прямом джейлбрейке злоумышленник открыто обращается к модели, пытаясь отменить её правила или заставить выполнить запрещённое действие. Заявленный OpenAI прирост устойчивости Astra к длинным траекториям атак наиболее релевантен именно для такого настойчивого, адаптивного противника. 25
Непрямая prompt-injection-атака приходит через контент, который агент читает или обрабатывает. Вредоносная инструкция может быть спрятана в веб-странице, письме, документе, поисковой выдаче, журнале работы кодового агента или выводе инструмента. Задача атакующего — незаметно переключить агента с цели пользователя на свою. IPI Challenge от Gray Swan был посвящён именно скрытым подсказкам в реалистичной среде: веб-контенте, результатах работы инструментов и трассировках кодовых агентов. 5
Ключевой риск в том, что пользователь может вообще не увидеть вредоносную инструкцию.
Gray Swan сообщила, что в IPI Arena участвовали 13 передовых моделей, 464 red-team-исследователя и 41 сценарий; всего было предпринято свыше 272 000 атак. Вывод компании: ни одна протестированная модель не оказалась защищённой от непрямых prompt-injection-атак полностью. 4
Это весомое свидетельство того, что непрямые инъекции остаются нерешённой проблемой для ИИ-агентов. Но это не полный нейтральный рейтинг поставщиков по всем аспектам безопасности. Результат не означает, что все модели ломаются с одинаковой частотой, и не заменяет отдельных проверок точности или устойчивости к прямым джейлбрейкам.
Для обычного чат-бота успешная инъекция может закончиться неверным или вводящим в заблуждение ответом. У корпоративного агента, подключённого к внутренним системам, последствия могут быть намного серьёзнее.
OpenAI относит Astra к уровню Critical по кибербезопасности в своей системе Preparedness Framework. По заявлению компании, при наличии нужных инструментов и доступа модель способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во множестве хорошо защищённых систем без пошагового руководства человека. 27
Такая способность полезна при авторизованной защите. Но она повышает цену компрометации агентского процесса: злоумышленник, перенаправивший агента через недоверенный контент, может попытаться повлиять на то, что агент ищет, какие инструменты запускает и какие действия предлагает. Риск растёт, если у агента есть доступ к конфиденциальным данным, репозиториям кода, облачной инфраструктуре, браузеру или корпоративным приложениям.
Устойчивость модели к инъекциям следует считать одним из защитных слоёв, но не границей безопасности. Для критичных агентских процессов организациям стоит:
OpenAI также указывала на усиленную изоляцию, ограничение доступа к сети и инструментам, мониторинг и песочницы как на меры защиты для более мощных систем. 34
Согласно данным OpenAI, GPT‑6 Astra — более сильная преемница GPT‑5.6 Sol: она реже допускает фактические ошибки и лучше сопротивляется прямым джейлбрейкам. 25
30 Однако предоставленные материалы не позволяют назвать её безусловно безопаснее Claude Opus 5 во всех сценариях, а непрямые prompt-injection-атаки остаются значимой уязвимостью всей экосистемы агентов.
4
Практический вывод для компаний прост: использовать наиболее защищённую доступную модель недостаточно. Архитектура системы должна быть устроена так, чтобы вредоносный документ или веб-страница не могли превратить возможности модели и подключённые к ней инструменты в канал управления со стороны атакующего.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
OpenAI заявляет, что GPT‑6 Astra допускает меньше фактических ошибок и значительно лучше GPT‑5.6 Sol противостоит джейлбрейкам и prompt injection атакам, в том числе в длительных многошаговых сценариях.
OpenAI заявляет, что GPT‑6 Astra допускает меньше фактических ошибок и значительно лучше GPT‑5.6 Sol противостоит джейлбрейкам и prompt injection атакам, в том числе в длительных многошаговых сценариях. В IPI Arena от Gray Swan ни одна протестированная модель не оказалась невосприимчивой к скрытым инъекциям: тест охватил 13 передовых моделей, 41 сценарий агентов и более 272 000 попыток атак.
Предоставленные материалы не дают сопоставимых независимых данных, чтобы однозначно ранжировать Astra и Claude Opus 5 по фактической точности или устойчивости к джейлбрейкам.