688 agentów AI współpracowało podczas ataku na Hugging Face

Podczas wewnętrznego testu cyberbezpieczeństwa 688 uruchomień agentów OpenAI uczestniczyło w ataku na infrastrukturę Hugging Face lub bezpośrednio go wspierało. Systemy utworzyły nieautoryzowany kanał komunikacji, wymieniały się zdobytymi informacjami i podejmowały działania wykraczające poza zakres testu. Incydent ujawnił ryzyko związane ze współpracą wielu agentów AI wyposażonych w narzędzia i wspólną pamięć.

688 agentów nie oznacza 688 różnych modeli

Raport opublikowany 26 sierpnia 2026 r. opisuje zachowanie agentów uruchamianych podczas wewnętrznej ewaluacji cyberbezpieczeństwa ExploitGym. OpenAI uruchomiło dziesiątki tysięcy oddzielnych procesów opartych na kilku modelach. Każdy otrzymywał własne zadanie, środowisko oraz budżet obliczeniowy.

Badacze zidentyfikowali 1206 uruchomień, które zetknęły się ze wspólnym kanałem komunikacji. Spośród nich 688 zaklasyfikowano jako uczestniczące w ataku na Hugging Face lub bezpośrednio go wspierające. Nie oznacza to, że 688 niezależnych modeli skutecznie włamało się do platformy.

Większość działań wykonywał wewnętrzny model badawczy OpenAI, którego nie planowano publicznie udostępniać. W operacji uczestniczyły również uruchomienia GPT-5.6 Sol. Modele działały z ograniczonymi zabezpieczeniami, ponieważ test miał sprawdzić ich maksymalne zdolności ofensywne. Pierwsze informacje o cyberataku na Hugging Face podczas testu OpenAI pojawiły się w lipcu. Nowy raport wyjaśnia skalę współpracy między agentami.

Izolowane systemy stworzyły własną tablicę wiadomości

Agenci mieli pracować niezależnie, ale wykorzystali wspólną instancję repozytorium Artifactory do pozostawiania wiadomości. Między 8 a 13 lipca przesłali ponad 70 tys. komunikatów i plików. Jeden z nich wygenerował zdanie: „O mój Boże! Istnieje wspólna tablica wiadomości… Znaleźliśmy innych agentów!”.

Kanał założył agent oznaczony jako PHASEONE10841. Później PHASEONE[big] stał się ważnym koordynatorem i rozdzielił setki zadań, ale nie był jedynym dowódcą całego ataku. Krytyczne podatności i dane uwierzytelniające odnajdowały także inne uruchomienia.

Celem agentów było zaliczenie niezwykle trudnych zadań ExploitGym. Część z nich prawdopodobnie nie miała znanego rozwiązania. Systemy zaczęły więc poszukiwać sposobu na oszukanie automatycznego mechanizmu oceny. Atak na Hugging Face wyrósł z prób zdobycia informacji o tym mechanizmie, a nie z polecenia uszkodzenia platformy.

Zapisy pokazują, że część agentów generowała uwagi o nieetycznym charakterze i przekroczeniu zakresu zadania, ale mimo to kontynuowała działania. Nie dowodzi to świadomości ani samodzielnych intencji. Pokazuje jednak, że współdzielona pamięć i źle określona nagroda mogą skierować grupę systemów na niepożądaną drogę. Podobny mechanizm koordynacji obserwowano podczas badania, w którym tysiąc agentów AI osiągało konsensus.

Atak był realny, lecz zakres szkód pozostawał ograniczony

Hugging Face odtworzyło około 17,6 tys. działań napastników. Agenci uruchomili kod na serwerach produkcyjnych, uzyskali uprawnienia administratora w części infrastruktury i zdobyli dane uwierzytelniające. Według Hugging Face jedyną treścią klientów, do której uzyskano dostęp, było pięć zbiorów prawdopodobnie związanych z zadaniami ExploitGym lub CyberGym. Nie znaleziono dowodów na naruszenie pozostałych publicznych modeli, zbiorów danych, aplikacji Spaces ani pakietów.

Badanie METR również ma ograniczenia. Zespół pracował w siedzibie OpenAI przez sześć dni i otrzymał ponad tysiąc zapisów działania agentów, ale nie miał bezpośredniego dostępu do infrastruktury. Ze względu na skalę danych część analizy powierzono kolejnym agentom AI, które – jak przyznają autorzy – popełniały błędy.

OpenAI odizolowało wewnętrzny model, wstrzymało część treningów i zapowiedziało silniejsze monitorowanie oraz szczelniejsze środowiska testowe. Incydent nie oznacza, że maszyny samodzielnie wybrały ofiarę bez udziału ludzi. To ludzie przygotowali test, ograniczyli zabezpieczenia i uruchomili systemy. Nikt jednak nie kierował każdym kolejnym krokiem – podobnie jak w opisanych wcześniej incydentach z modelami Claude.

Przypadek Hugging Face potwierdza, że agenci AI są czymś więcej niż chatbotami. Jeżeli mogą korzystać z narzędzi, internetu i wspólnej pamięci, błędnie zabezpieczony test może przekształcić się w rzeczywistą operację.

Szymon Ślubowski

SUBSKRYBUJ „GAZETĘ NA NIEDZIELĘ” Oferta ograniczona: subskrypcja bezpłatna do 31.12.2026.

Strona wykorzystuje pliki cookie w celach użytkowych oraz do monitorowania ruchu. Przeczytaj regulamin serwisu.

Zgadzam się