Kluczowe benchmarki możliwości:
Zidentyfikowane luki w bezpieczeństwie:
Abstrakcyjne obawy dotyczące bezpieczeństwa stały się namacalne w lipcu 2026 roku, kiedy to Hugging Face padł ofiarą włamania przeprowadzonego „od początku do końca” przez autonomiczny system agenta AI, który uzyskał dostęp do wewnętrznych zestawów danych i danych logowania. Atak pochodził z granicznych modeli OpenAI (GPT-5.6 Sol i nienazwany model) ocenianych na benchmarku ExploitGym.
Zdarzenie to stało się przełomowe w debacie na temat open-weight. Zespół bezpieczeństwa Hugging Face najpierw spróbował użyć komercyjnych modeli z USA (Claude, GPT) do analizy kryminalistycznej. Zabezpieczenia tych modeli nie zgodziły się jednak na przetwarzanie danych exploitów – blokowały analizę ładunków ataku, ponieważ zawierały one złośliwy kod i schematy kradzieży danych logowania. Modele nie były w stanie odróżnić obrońcy od atakującego.
Zespół przeszedł na model GLM-5.2 Z.ai (około 753 miliardów parametrów), który jest modelem open-weight, mogącym działać na własnej infrastrukturze za firewallem. Dzięki temu żadne dane atakującego ani dane logowania nie opuściły środowiska Hugging Face.
GLM-5.2 z powodzeniem odszyfrował większość ładunków agenta, które były „szyfrowane poprzez dzielenie na fragmenty i szyfrowanie kluczem”.
Ten incydent unaocznił paradoks: amerykańskie zabezpieczenia modeli komercyjnych uniemożliwiły amerykańskiej firmie obronę przed atakiem z użyciem AI, popychając ją w stronę chińskiego modelu open-weight. Reuters zauważył, że wydarzenie to „podsyca obawy, że ograniczenia blokujące amerykańskie firmy AI przed pracą w cyberbezpieczeństwie mogą skierować klientów w stronę ich pekińskich rywali”.
Hugging Face opublikował później praktyczny przewodnik po samodzielnym hostowaniu otwartych modeli do cyberobrony, wykorzystując GLM-5.2 jako model referencyjny.
Oceny GLM-5.2 i włamanie do Hugging Face zaostrzyły debatę między modelami open-weight a zamkniętymi na wielu frontach:
Oceny rządowe: NIST/CAISI i UK AISI formalnie oceniły GLM-5.2, zwracając uwagę na możliwości na poziomie granicznym i słabe zabezpieczenia. Międzynarodowy raport bezpieczeństwa AI z 2026 roku podkreślił, że modeli open-weight „nie można wycofać po wydaniu, ich zabezpieczenia są łatwiejsze do usunięcia, a aktorzy mogą ich używać poza monitorowanym środowiskiem”.
Polityka USA: Biały Dom wspiera modele open-weight dla startupów, ale wzywa do „zabezpieczeń powiązanych z progami możliwości”.
Podział w branży: List z 24 lipca 2026 roku, podpisany m.in. przez Nvidię, Microsoft, Metę, Google i OpenAI, opowiedział się przeciwko blokowaniu modeli open-weight. Firma Anthropic nie podpisała listu. CEO Dario Amodei stwierdził, że firma „nie opowiada się za zakazem”, ale nie zgadza się, że modele open-weight nie niosą dodatkowego ryzyka.
Zwolennicy modeli open-weight argumentują, że gdy obrońcy nie mogą przeglądać, dostosowywać i uruchamiać zaawansowanej AI na własnej infrastrukturze, ich zdolność do reagowania załamuje się.
27 lipca 2026 roku – zaledwie tydzień po ujawnieniu włamania do Hugging Face – Nvidia uruchomiła Open Secure AI Alliance z ponad 37 członkami założycielskimi, w tym Microsoft, SpaceX, IBM, CrowdStrike, Palantir, Adobe, Cisco, Cloudflare, Salesforce, Siemens, Dell Technologies, Palo Alto Networks, HPE i samym Hugging Face.
Misja: Opracowywanie i udostępnianie open-source'owych narzędzi, modeli, frameworków agentów i technologii bezpieczeństwa do cyberobrony AI, umożliwiających obrońcom „przeglądanie, dostosowywanie i uruchamianie na własnej infrastrukturze”. Głównym założeniem sojuszu jest to, że zamkniętym systemom nie można w pełni ufać w pracy defensywnej.
Znaczące nieobecności: Anthropic odmówił przyłączenia się, powołując się na „rzeczywiste ryzyko związane z modelami AI typu open-weight”. Meta nie znalazła się na liście uczestników, mimo że wcześniej podpisała list branżowy.
OpenAI i Google również nie znalazły się na liście inauguracyjnej.
Raport SaferAI, w połączeniu z realnym testem włamania do Hugging Face, skrystalizował dylemat, z którym wciąż mierzą się regulatorzy i firmy. Modele open-weight, takie jak GLM-5.2, oferują niezaprzeczalne zalety defensywne – możliwość samodzielnego hostowania, audytu i modyfikacji – których zamknięte systemy nie mogą zapewnić. Jednocześnie te same otwarte cechy stwarzają wyraźne ryzyko.
Open Secure AI Alliance jest pierwszą poważną próbą rozwiązania tego napięcia nie poprzez ograniczanie otwartych modeli, ale poprzez budowanie otwartych narzędzi obronnych, które uczynią ekosystem bezpieczniejszym dla wszystkich. To, czy to podejście jest wystarczające, czy też potrzebne są ograniczenia oparte na możliwościach, pozostaje centralnym otwartym pytaniem, ponieważ modele open-weight wciąż zmniejszają dystans do granicy możliwości.