Оцінка Губінгера «понад 10%» є його особистим прогнозом, а не офіційною позицією Anthropic чи науковим консенсусом. Він вважає ризик від нинішніх моделей низьким, але побоюється майбутніх систем, здатних допомагати створювати ще потужніший ШІ.
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic alignment science lead Evan Hubinger’s public statement that he personally believes there is more than a 10% chance AI co. Article summary: Hubinger’s statement chiefly exposed a sharp mismatch between frontier-AI labs’ public safety posture and the private-level uncertainty described by people closest to the work: a senior alignment lead said the field may . Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Заява Евана Губінгера не доводить, що ШІ неодмінно спричинить вимирання людства. Вона означає дещо конкретніше — і тому важливе: керівник напряму науки про узгодження цілей ШІ (alignment science) в Anthropic особисто оцінює ймовірність такого сценарію в понад 10% упродовж наступного десятиліття. Він також визнав, що Anthropic досі не має плану розв’язання проблеми узгодження надінтелекту з людськими цілями й не має чітко підтвердженого шляху до такого рішення. 1
2
Це надало ваги занепокоєнню, висловленому колишнім дослідником Anthropic і OpenAI Джейкобом Коксоном після звільнення: лабораторії передового ШІ можуть рухатися до значно потужніших систем, хоча методи надійного утримання таких систем у межах людських намірів досі не доведені. 2
3
Цифра «понад 10%» — це персональна оцінка Губінгера. Він не подавав її як офіційний прогноз Anthropic, думку всіх працівників компанії або усталений науковий висновок. 1
2
Це принципово важливо. Сама по собі ймовірнісна оцінка не пояснює механізму катастрофи, не встановлює точного горизонту подій і не доводить, що катастрофа є найбільш імовірним результатом. За повідомленнями, Губінгер також сказав, що ризик від доступних нині моделей є низьким. Його тривога стосується майбутніх систем, які можуть стати істотно сильнішими, зокрема через рекурсивне самовдосконалення — використання можливостей ШІ для створення ще спроможнішого ШІ. 2
10
Утім, заява привернула увагу саме тому, що прозвучала від людини, яка очолює роботу з alignment у великій лабораторії передового ШІ. Ключовим тут є не лише гучне число, а розрив між нарощуванням можливостей моделей і впевненістю, що надінтелектуальні системи можна буде втримати під людським контролем. 1
2
Коксон, який працював і в OpenAI, і в Anthropic, звільнився, заявивши, що жодна з компаній не діє достатньо відповідально, а обидві рухаються до самовдосконалюваного надінтелекту. Губінгер публічно погодився з основною тезою Коксона: люди, які створюють такі системи, щиро допускають ризик наслідків рівня вимирання. 2
3
Це не означає, що всі співробітники поділяють одну й ту саму думку, і не перетворює слова Коксона на незалежно підтверджену оцінку обох компаній. Проте після реакції чинного керівника напряму alignment його звільнення важче списати на одиничну претензію колишнього працівника. Серйозне внутрішнє занепокоєння може співіснувати з подальшою розробкою передових моделей. 1
2
До пов’язаних коментарів Семюела Маркса слід ставитися з такою ж обережністю. У повідомленнях йдеться, що він казав: розробники ШІ вважають можливими вимирання людства або інші настільки ж тяжкі наслідки. Однак це погляд інсайдера, а не опублікований доказ загальнокорпоративної оцінки ризику. 5
Цю історію легко звести до схеми «прихильники апокаліпсису проти оптимістів». Практичніше поставити інше питання: які запобіжники мають бути обов’язковими, якщо потенційна шкода є глобальною та незворотною, а її імовірність і строки залишаються глибоко невизначеними?
Коментарі Губінгера загострюють кілька питань:
Ці питання не є доказом неминучої катастрофи. Але саме такі проблеми стає набагато важче розв’язати після того, як системи набудуть небезпечних можливостей.
За повідомленнями, Anthropic відмовилася надати свою новітню модель для тестування британському AI Safety Institute перед релізом. До цієї інформації варто ставитися обережно: доступні матеріали описують це як повідомлення медіа, а не як публічно підтверджений висновок самої компанії чи уряду Великої Британії. 10
Проте сама ця історія пояснює скепсис щодо добровільних зобов’язань із безпеки. Якщо керівники безпекових напрямів компанії визнають нерозв’язані проблеми alignment, зовнішні спостерігачі закономірно запитають: які випробування проводилися, хто їх оцінював, які результати були оприлюднені та за яких порогів можливостей мають запускатися суворіші обмеження.
Заклик «уповільнитися» не обов’язково передбачає безстрокову зупинку всіх досліджень або впроваджень ШІ. Ідеться радше про примусові та перевірювані бар’єри до того, як системи перетнуть особливо небезпечні пороги можливостей.
Серед можливих заходів:
Логіка проста: коли ризик невизначений, але потенційна шкода може бути надзвичайною, запобіжники мають бути продемонстровані до, а не після втрати контролю.
Дописи Губінгера висвітлили суперечність у центрі розвитку передового ШІ: провідні розробники можуть публічно визнавати серйозні довгострокові ризики, водночас продовжуючи створювати системи, через які ці ризики стають нагальнішими. 1
2
Його слова не визначають імовірність катастрофічної шкоди від ШІ та не повинні сприйматися як офіційний прогноз Anthropic. Однак вони роблять дискусію про alignment значно предметнішою. Питання тепер не лише в тому, чи може просунутий ШІ стати небезпечним. Воно також у тому, чи здатні компанії та уряди підтвердити незалежними доказами, обов’язковими правилами й міжнародною координацією, що вони готові діяти до того, як такі системи стануть надто потужними для безпечного управління. 1
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Оцінка Губінгера «понад 10%» є його особистим прогнозом, а не офіційною позицією Anthropic чи науковим консенсусом.
Оцінка Губінгера «понад 10%» є його особистим прогнозом, а не офіційною позицією Anthropic чи науковим консенсусом. Він вважає ризик від нинішніх моделей низьким, але побоюється майбутніх систем, здатних допомагати створювати ще потужніший ШІ.
Історія зміщує фокус дискусії з протиставлення «паніка або оптимізм» до перевірюваних запобіжників, прозорості та міжнародної координації.