OpenAI podaje, że GPT 6 Astra popełnia mniej błędów faktycznych oraz jest wyraźnie bardziej odporny na jailbreaki i prompt injection niż GPT 5.6 Sol — także podczas dłuższych, adaptacyjnych ataków. W IPI Arena firmy Gray Swan żaden z testowanych modeli nie okazał się odporny na ukryte prompt injection; badanie objęł...
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does OpenAI’s GPT-6 Astra, released September 3, compare with GPT-5.6 Sol and Anthropic’s Claude Opus 5 on factual-error reduction, resi. Article summary: GPT‑6 Astra is a substantial improvement over GPT‑5.6 Sol on OpenAI’s internal factuality and jailbreak-robustness evaluations, including longer, multi-turn attack trajectories. But this is not evidence of immunity: inde. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI przedstawia GPT-6 Astra jako istotnie bezpieczniejszego następcę GPT-5.6 Sol. Według firmowych ocen model rzadziej popełnia błędy faktyczne, lepiej opiera się prompt injection i jest znacząco odporniejszy na jailbreaki — również wtedy, gdy atak rozwija się przez wiele kolejnych kroków rozmowy. 25
30
Nie należy jednak mylić poprawy z odpornością absolutną. Model lub agent AI nadal może zetknąć się z wrogimi instrukcjami ukrytymi w stronie WWW, dokumencie, e-mailu, repozytorium kodu albo odpowiedzi narzędzia. W testach pośredniego prompt injection (IPI) przeprowadzonych przez Gray Swan żaden badany model nie był na takie ataki całkowicie odporny. 4
OpenAI twierdzi, że Astra jest znacząco bardziej odporna na jailbreaki niż GPT-5.6 Sol, także w dłuższych trajektoriach ataku. To istotne, ponieważ zaawansowany napastnik nie musi ograniczać się do jednego, łatwego do wykrycia polecenia. Może zmieniać taktykę w kolejnych turach i wykorzystywać kontekst nagromadzony podczas pracy modelu. 25
Firma informuje także o większej odporności na prompt injection w scenariuszach przeglądania internetu i pracy biurowej oraz o mniejszej liczbie błędów faktycznych niż w Sol. Porównania dotyczące faktograficzności wymagają jednak ostrożności: test odtwarzania zgłoszonych błędów opierał się na rozmowach ChatGPT oznaczonych wcześniej przez użytkowników jako błędne. Nie jest to więc miara typowego, codziennego poziomu halucynacji. 25
30
Te ulepszenia mają znaczenie zwłaszcza dla agentów wykonujących research, pracujących z kodem, przeglądających sieć i realizujących zadania wieloetapowe. Z informacji o wydaniu wynika, że Astra ma wspierać złożoną pracę wieloetapową oraz tworzenie dokumentów, arkuszy kalkulacyjnych i prezentacji. 19
Dostępne materiały nie uzasadniają uniwersalnego stwierdzenia, że Astra jest bezpieczniejsza od Anthropic Claude Opus 5 pod względem błędów faktycznych, bezpośrednich jailbreaków czy pośredniego prompt injection.
Rzetelny ranking między modelami wymagałby wspólnego zestawu testowego, identycznych narzędzi agenta, takich samych instrukcji systemowych, jednolitej definicji sukcesu ataku oraz porównywalnej możliwości dostosowywania strategii przez atakującego. Ewaluacje dostawców i publiczne ćwiczenia red-teamowe mogą różnić się pod każdym z tych względów. Materiały Gray Swan wymieniają Claude Opus 5 wśród modeli dostępnych w Arena, ale nie zawierają porównywalnej tabeli wyników Astra kontra Opus 5. 1
4
Wniosek, który można obronić na podstawie tych źródeł, jest węższy: najmocniejsze dowody dotyczą poprawy Astry względem własnego poprzednika OpenAI, GPT-5.6 Sol.
Bezpośredni jailbreak zaczyna się od widocznej prośby atakującego skierowanej do modelu — na przykład próby obejścia jego zasad albo nakłonienia go do niedozwolonego działania. Deklarowana przez OpenAI poprawa w dłuższych trajektoriach ataku jest szczególnie istotna wobec takiego uporczywego, adaptacyjnego przeciwnika. 25
Pośredni prompt injection trafia do agenta w treści, którą agent właśnie czyta lub przetwarza. Złośliwa instrukcja może być ukryta w stronie WWW, e-mailu, dokumencie, wyniku wyszukiwania, śladzie pracy nad kodem albo danych zwróconych przez narzędzie. Wyzwanie IPI firmy Gray Swan dotyczyło właśnie ukrytych poleceń w realistycznych środowiskach, m.in. w treściach internetowych, wynikach narzędzi i śladach agentów programistycznych. 5
Kluczowa różnica jest taka, że osoba korzystająca z agenta może w ogóle nie zobaczyć złośliwego polecenia.
Gray Swan podał, że IPI Arena objęła 13 modeli frontierowych, 464 uczestników red teamingu, 41 scenariuszy oraz ponad 272 tys. prób ataku. Wniosek organizacji był jasny: żaden z testowanych modeli nie okazał się odporny na pośredni prompt injection. 4
To mocny sygnał, że IPI pozostaje nierozwiązanym problemem przy wdrażaniu agentów AI. Nie jest to jednak pełny, neutralny wobec dostawców ranking wszystkich wymiarów bezpieczeństwa. Wyniku nie należy odczytywać ani jako dowodu, że wszystkie modele zawodzą równie często, ani jako zastępstwa dla ocen konkretnego modelu dotyczących faktograficzności czy odporności na bezpośrednie jailbreaki.
W samodzielnym czacie udane wstrzyknięcie instrukcji może skończyć się mylącą odpowiedzią. W agencie podłączonym do systemów firmy skutki mogą być znacznie poważniejsze.
OpenAI klasyfikuje Astrę jako model spełniający próg Critical w obszarze cyberbezpieczeństwa w ramach swojego Preparedness Framework. Według firmy, przy odpowiednich narzędziach i dostępie Astra może znajdować wcześniej nieznane luki oraz opracowywać sposoby ich wykorzystania w wielu dobrze zabezpieczonych systemach bez prowadzenia jej krok po kroku przez człowieka. 27
Taka zdolność może być wartościowa w autoryzowanej obronie. Zwiększa jednak potencjalne konsekwencje przejęcia przepływu pracy agenta: atakujący, który przekieruje agenta przez niezaufaną treść, może próbować wpływać na to, czego agent szuka, jakich narzędzi używa i jakie działania proponuje. Ryzyko rośnie, gdy agent ma dostęp do poufnych danych, repozytoriów kodu, środowisk chmurowych, przeglądarki lub aplikacji biznesowych.
Odporność modelu na prompt injection powinna być jedną z warstw zabezpieczeń, a nie granicą bezpieczeństwa. W procesach agentowych o dużym znaczeniu organizacje powinny:
OpenAI wskazywało silniejszą izolację, ograniczony dostęp do sieci i narzędzi, monitorowanie oraz wykonywanie w piaskownicy jako zabezpieczenia dla systemów o większych możliwościach. 34
Deklarowane ograniczenie błędów faktycznych i większa odporność na bezpośrednie jailbreaki sprawiają, że Astra jest mocniejszym następcą GPT-5.6 Sol. 25
30 Brakuje jednak danych, które pozwalałyby uznać ją za kategorycznie bezpieczniejszą od Claude Opus 5 w każdym zastosowaniu, a pośredni prompt injection nadal jest istotną słabością całego ekosystemu agentów.
4
Dla firm praktyczna lekcja jest prosta: warto wybierać najsilniejszy dostępny model, ale jeszcze ważniejsze jest zaprojektowanie otaczającego go systemu tak, by złośliwy dokument lub strona WWW nie mogły zamienić możliwości modelu i podłączonych narzędzi w kanał sterowany przez atakującego.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI podaje, że GPT 6 Astra popełnia mniej błędów faktycznych oraz jest wyraźnie bardziej odporny na jailbreaki i prompt injection niż GPT 5.6 Sol — także podczas dłuższych, adaptacyjnych ataków.
OpenAI podaje, że GPT 6 Astra popełnia mniej błędów faktycznych oraz jest wyraźnie bardziej odporny na jailbreaki i prompt injection niż GPT 5.6 Sol — także podczas dłuższych, adaptacyjnych ataków. W IPI Arena firmy Gray Swan żaden z testowanych modeli nie okazał się odporny na ukryte prompt injection; badanie objęło 13 modeli, 41 scenariuszy agentowych i ponad 272 tys.
Dostarczone materiały nie pozwalają uczciwie ustalić jednoznacznego rankingu Astry i Claude Opus 5 pod względem faktograficzności, jailbreaków ani pośredniego prompt injection.