У сфері безпеки ШІ компанії часто стикаються з однаковими проблемами окремо одна від одної. Одна організація може виявити атаку, збій або небезпечний «майже інцидент», тоді як інші не матимуть доступу до вже здобутих уроків.
Проєкт SAFE зосереджений на чотирьох практиках:
Мета — перетворити окремі випадки злому через prompt injection, витоку даних або неконтрольованої поведінки AI-агента на спільну розвідувальну інформацію для захисту. Замість того щоб кожна компанія наново розбиралася з тією самою загрозою, учасники отримають процес для накопичення та поширення узагальнених висновків.
SAFE — лише один напрям роботи альянсу. Його учасники також об’єднують відкриті та доступні для перевірки технології, які мають закривати різні рівні захисту AI-агентів.
Серед заявлених внесків:
У сукупності ці розробки охоплюють ідентифікацію, дозволи, агентські оболонки, поведінку під час виконання, оцінювання, дані, управління та стійкість систем. У перспективі вони можуть дати підприємствам спільний набір відкритих засобів для обмеження й моніторингу AI-агентів, зокрема тих, що діють шкідливо або виходять за межі заданих повноважень. Але поки це лише можливий результат, а не доведений ефект.
Серед великих учасників OSAA називають Nvidia, Adobe, BlackRock, Cisco, CrowdStrike, Hugging Face, Intel, Microsoft, Red Hat і Visa. Amazon, за повідомленнями, приєднався пізніше.
Альянс виник після відкритого листа від 24 липня, у якому технологічні компанії закликали американських політиків не запроваджувати широкі або передчасні обмеження для моделей ШІ з відкритими вагами. Початково лист підтримали 25 компаній, серед яких були Nvidia, Microsoft, Meta, IBM, Dell, Palantir і Hugging Face. Автори попереджали, що обмеження на завантажувані моделі можуть послабити конкуренцію та підштовхнути користувачів до китайських систем ШІ, поки Вашингтон обмірковував відповідь із міркувань національної безпеки.
На момент публікацій про Black Hat помітними відсутніми учасниками OSAA були Anthropic, OpenAI та Google. Водночас ситуація з політичним листом складніша: джерела по-різному описують пізніший список підписантів. Деякі повідомляли, що OpenAI і Google приєдналися згодом, тоді як інші вказували на їхню відсутність у початковому переліку.
Доступні матеріали не пояснюють, чому ці компанії не вступили до OSAA, тому робити припущення про їхні мотиви не варто.
Головна теза OSAA полягає в тому, що відкритість і безпека не обов’язково суперечать одна одній. Відкриті моделі, інструменти, методики оцінювання та спільні дані про помилки дають більшій кількості фахівців змогу перевіряти збої, відтворювати вразливості й швидше адаптувати виправлення. SAFE намагається поєднати цю прозорість із конфіденційністю під час збору та аналізу інцидентів, поширюючи ширше вже узагальнені уроки.
Міжгалузевий склад OSAA також може допомогти виробити спільні інтерфейси та практики для розробників моделей, хмарних і інфраструктурних провайдерів, фахівців з ідентичності, компаній кібербезпеки та корпоративних користувачів. Якщо ці напрацювання дозріють, відкриті системи ШІ стане простіше оцінювати, контролювати та відповідально впроваджувати.
Це може посилити ширший політичний аргумент на користь моделей із відкритими вагами як чинника американської технологічної конкурентоспроможності — особливо на тлі дискусій про китайські AI-лабораторії. Проте OSAA поки не продемонстрував ані зростання конкурентоспроможності США, ані зниження системних ризиків ШІ.
Найконкретніший результат на цьому етапі скромніший: коаліція з понад 120 організацій за короткий час перейшла від лобіювання відкритого ШІ до публічного проєкту скоординованого звітування про інциденти безпеки, паралельно об’єднуючи інструменти, які згодом можуть сформувати сумісний рівень захисту.