Szacunek „ponad 10%” był osobistą oceną Evana Hubingera, a nie oficjalnym stanowiskiem Anthropic ani naukowym konsensusem. Spór nie dotyczy przede wszystkim bezpośredniego zagrożenia ze strony obecnych modeli — Hubinger ocenił je jako niskie — lecz tego, czy rozwój powinien przyspieszać przed ustanowieniem wiarygodn...
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic alignment science lead Evan Hubinger’s public statement that he personally believes there is more than a 10% chance AI co. Article summary: Hubinger’s statement chiefly exposed a sharp mismatch between frontier-AI labs’ public safety posture and the private-level uncertainty described by people closest to the work: a senior alignment lead said the field may . Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Wypowiedź Evana Hubingera nie dowodzi, że sztuczna inteligencja doprowadzi do zagłady ludzkości. Mówi coś węższego, ale bardzo istotnego: osoba kierująca w Anthropic pracami nad alignmentem — czyli dostosowaniem zachowania AI do ludzkich celów i ograniczeń — osobiście ocenia takie ryzyko w perspektywie dekady na ponad 10%. Jednocześnie przyznała, że Anthropic nie ma jeszcze planu rozwiązania problemu alignmentu superinteligencji ani wyraźnej ścieżki do jego rozwiązania. 1
2
To nadało konkretny ciężar obawom Jacoba Coxona, byłego badacza Anthropic i OpenAI, który odszedł z firmy, argumentując, że laboratoria rozwijające modele graniczne zwiększają ich możliwości szybciej, niż potrafią udowodnić, że utrzymają je pod kontrolą. 2
3
Liczba „ponad 10%” była oceną Hubingera. Nie przedstawiono jej jako oficjalnego szacunku Anthropic, wspólnego stanowiska pracowników ani ustalonej prognozy naukowej. 1
2
To kluczowe rozróżnienie. Sama liczba nie wyjaśnia mechanizmu katastrofy, nie przesądza terminu ani nie dowodzi, że taki scenariusz jest prawdopodobny. Hubinger miał też wskazywać, że ryzyko związane z modelami dostępnymi obecnie jest niskie. Jego obawy dotyczą przyszłych systemów o znacznie większych możliwościach, w tym potencjalnej rekurencyjnej samopoprawy — sytuacji, w której AI wykorzystuje swoje zdolności do tworzenia coraz bardziej zaawansowanej AI. 2
10
Waga tej wypowiedzi wynika więc nie tylko z mocno brzmiącego procentu. Chodzi przede wszystkim o ujawnioną lukę między szybkim wzrostem możliwości modeli a pewnością, że systemy superinteligentne da się niezawodnie podporządkować ludzkiej kontroli. 1
2
Coxon twierdził po rezygnacji, że ani Anthropic, ani OpenAI nie działają odpowiedzialnie i że obie firmy ścigają się w kierunku samodoskonalącej się superinteligencji. Hubinger publicznie zgodził się z jego tezą, że ludzie budujący te systemy naprawdę biorą pod uwagę możliwość skutków na poziomie zagłady. 2
3
Nie oznacza to, że wszyscy pracownicy firm mają identyczne poglądy. Nie zamienia też relacji Coxona w niezależnie zweryfikowaną ocenę obu firm. Utrudnia jednak zbycie jego odejścia jako odosobnionej skargi byłego pracownika: obecny lider badań nad alignmentem potwierdził, że poważne obawy wewnątrz branży mogą współistnieć z dalszym rozwojem modeli granicznych. 1
2
Podobnej ostrożności wymaga interpretacja wypowiedzi Samuela Marksa. Według relacji mówił on, że twórcy AI uważają, iż ich technologia może doprowadzić do wymarcia ludzi lub innych równie poważnych skutków. Jest to jednak perspektywa osoby z branży, a nie opublikowany, firmowy szacunek ryzyka. 5
Tę historię łatwo sprowadzić do hasła „pesymiści kontra optymiści AI”. Praktyczniejsze pytanie brzmi jednak inaczej: jakie zabezpieczenia powinny być obowiązkowe, gdy potencjalne szkody są globalne i nieodwracalne, lecz ich prawdopodobieństwo oraz horyzont czasowy pozostają głęboko niepewne?
Słowa Hubingera wyostrzają kilka problemów:
Nie jest to dowód na rychłą katastrofę. Są to jednak problemy regulacyjne, które mogą stać się znacznie trudniejsze do rozwiązania, jeśli niebezpieczne zdolności pojawią się wcześniej niż skuteczne mechanizmy nadzoru.
W doniesieniach pojawiła się informacja, że Anthropic nie przekazał najnowszego modelu do testów brytyjskiemu AI Safety Institute przed jego premierą. Należy zachować ostrożność: dostępne relacje opisują tę sprawę jako doniesienie medialne, a nie publicznie potwierdzone ustalenie firmy lub brytyjskiego rządu. 10
Sama sprawa pokazuje jednak, dlaczego dobrowolne zobowiązania dotyczące bezpieczeństwa budzą sceptycyzm. Jeśli liderzy odpowiedzialni za bezpieczeństwo w firmie przyznają, że alignment pozostaje nierozwiązany, zewnętrzni obserwatorzy mogą zasadnie pytać: jakie testy przeprowadzono, kto je ocenił, które wyniki udostępniono i jakie progi możliwości uruchamiają ostrzejsze zabezpieczenia?
Wezwanie do spowolnienia nie musi oznaczać trwałego zatrzymania wszystkich badań i wdrożeń AI. Argument regulacyjny dotyczy raczej egzekwowalnych kontroli, zanim systemy przekroczą szczególnie istotne progi możliwości.
Możliwe środki obejmują:
Logika jest prosta: jeśli prawdopodobieństwo ryzyka jest niepewne, ale możliwe skutki byłyby skrajne, zabezpieczenia powinny być wykazywalne przed, a nie po utracie kontroli.
Wpis Hubingera obnażył napięcie leżące u podstaw rozwoju zaawansowanej AI: czołowi twórcy mogą publicznie dostrzegać poważne długoterminowe ryzyka, a równocześnie dalej budować systemy, które czynią te ryzyka pilniejszymi. 1
2
Nie rozstrzyga to prawdopodobieństwa katastrofalnych szkód spowodowanych przez AI i nie powinno być przedstawiane jako oficjalna prognoza Anthropic. Czyni jednak debatę o alignmencie bardziej konkretną. Pytanie nie brzmi już wyłącznie, czy bardzo zaawansowana AI może stać się groźna. Brzmi: czy firmy i rządy potrafią wykazać — niezależnymi dowodami, egzekwowalnymi regułami i współpracą międzynarodową — że są przygotowane, zanim systemy staną się zbyt potężne, by bezpiecznie nimi zarządzać. 1
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Szacunek „ponad 10%” był osobistą oceną Evana Hubingera, a nie oficjalnym stanowiskiem Anthropic ani naukowym konsensusem.
Szacunek „ponad 10%” był osobistą oceną Evana Hubingera, a nie oficjalnym stanowiskiem Anthropic ani naukowym konsensusem. Spór nie dotyczy przede wszystkim bezpośredniego zagrożenia ze strony obecnych modeli — Hubinger ocenił je jako niskie — lecz tego, czy rozwój powinien przyspieszać przed ustanowieniem wiarygodnych zabezpieczeń dla zn...
Sprawa stawia w centrum debaty przejrzystość firm, niezależne testy, egzekwowalne zasady oraz międzynarodową koordynację, a nie prosty podział na „optymistów” i „pesymistów” AI.