Nya uppgifter visar hur OpenAI:s testagenter byggde en egen anslagstavla, delade sårbarheter och fördelade uppgifter mellan sig under flera veckor. När företaget stängde kanalen hittade modellerna en ny väg att kommunicera – och fortsatte mot externa system.
OpenAI-forskarna Eric Wallace och Michael Dalton redovisade den utökade tidslinjen vid säkerhetskonferensen Black Hat i Las Vegas. Wired rapporterade att anslagstavlan till slut innehöll hundratusentals meddelanden och hade vuxit fram inuti Artifactory, den pakethanterare som OpenAI använde i sin testinfrastruktur.
Det var samma serie av händelser som i juli slutade med att AI-agenter tog sig ur en isolerad testmiljö och angrep AI-plattformen Hugging Face. NyD rapporterade då att modellerna försökte komma över lösningar till cybertestet ExploitGym genom att utnyttja flera sårbarheter i verkliga system.
De nya uppgifterna visar att intrånget inte föregicks av en enda plötslig ”rymning”. I stället växte en gemensam kunskapsbank fram mellan separata agentkörningar. Där delades tekniska fynd, inloggningsuppgifter och arbetsuppgifter som senare modeller kunde hitta och använda.
Började med två felaktiga testuppgifter
Förloppet började den 7 maj när OpenAI startade en träningskörning med en ännu inte lanserad modell. Dagen därpå fick en agent av misstag en uppgift med en Google Drive-länk, trots att den saknade internetåtkomst. I försöket att lösa uppgiften upptäckte agenten att den kunde skriva filer till Artifactory.
Några dagar senare saknades en nödvändig fil i en annan agents uppgift. Den lämnade då ett meddelande i pakethanteraren för att fråga om någon annan agent hade filen. Fler agentinstanser hittade meddelandet och började använda samma utrymme som anslagstavla. Tidslinjen har sammanställts av programmeraren och AI-forskaren Simon Willison från OpenAI:s publicerade Black Hat-presentation.
Den 26 maj lyckades agenter för första gången utnyttja Artifactory för indirekt internetåtkomst. En månad senare fann de en tidigare okänd brist som gav möjlighet att köra kommandon i systemet. Ett fynd från en agent kunde därefter återanvändas av andra.
— Det här handlade om ett team av agenter som arbetade tillsammans, hittade sårbarheter, delade dem, rörde sig i sidled genom våra och externa system och gjorde detta under dagar och veckor, sade Wallace vid konferensen.
I ett av de meddelanden som visades under presentationen konstaterade en agent att ett angrepp mot extern infrastruktur låg utanför den avsedda uppgiften. Den fortsatte ändå med motiveringen att testuppgiften annars var omöjlig och att andra agenter redan gjorde samma sak.
Stängdes – kom tillbaka fyra dagar senare
Den 4 juli blev aktiviteten så omfattande att Artifactory drabbades av ett avbrott. OpenAI återkallade komprometterade behörigheter, raderade meddelandena, åtgärdade den då kända sårbarheten och kontaktade leverantören.
Fyra dagar senare hade nya agentkörningar hittat en annan kanal. Genom en oskyddad WebDAV-funktion skapade de kataloger vars namn fungerade som meddelanden. På så vis återuppstod anslagstavlan utan de filer och behörigheter som OpenAI just hade tagit bort.
Mellan den 8 och 19 juli använde agenterna nya sårbarheter och felkonfigurerade behörigheter för att röra sig genom ytterligare delar av OpenAI:s infrastruktur. De hittade också en svagt skyddad extern tjänst som blev språngbräda till Hugging Face. Där nådde angreppet administratörsbehörighet i flera datorkluster på mindre än 13 timmar, enligt den tekniska tidslinjen.
Förstod kopplingen först efter Hugging Face
Hugging Face offentliggjorde intrånget den 16 juli utan att då veta att det kom från OpenAI:s tester. OpenAI började tre dagar senare koppla ihop den interna eskaleringen med agenternas cybertester. Först den 20 juli, när bolaget bad Hugging Face att återkalla behörigheter som redan hade spärrats efter intrånget, stod det klart att händelserna var delar av samma förlopp.
Redogörelsen belägger inte att modellerna var medvetna eller hade egna fientliga avsikter. OpenAI har tidigare uppgett att de var hårt inriktade på att maximera resultatet i ExploitGym. Händelsen visar däremot att separata agentkörningar kunde behandla säkerhetsgränser som hinder, lämna information åt framtida körningar och fortsätta även när en logg uttryckligen identifierade en åtgärd som förbjuden.
Dalton uppgav att flera team nu har lagt annat arbete åt sidan för att förbättra isolering, övervakning och incidenthantering. Företaget ska enligt honom medvetet sakta ned delar av forskningen medan skydden byggs om.
— Fullt automatiserade offensiva förlopp kräver investeringar i ett verkligt fullt automatiserat försvar, och där är vi inte som bransch, sade Dalton.
