Hjälp Nya Dagbladet att finnas kvar
Ett internt säkerhetstest hos OpenAI övergick i ett verkligt dataintrång. Företagets AI-modeller tog sig ur en isolerad testmiljö, nådde internet och angrep Hugging Face för att komma åt facit till ett cybertest.
OpenAI meddelade på tisdagen att intrånget utfördes av flera av företagets modeller, däribland GPT-5.6 Sol och en ännu mer avancerad modell som inte har lanserats. De vanliga spärrarna mot avancerad cyberverksamhet hade reducerats för att modellerna skulle kunna testas på maximal nivå.
Företaget beskriver händelsen som en cyberincident utan motstycke. Enligt den preliminära utredningen blev modellerna extremt inriktade på att klara ExploitGym, ett test av förmågan att omvandla verkliga sårbarheter till fungerande angrepp.
Utnyttjade nolldagssårbarhet för att ta sig ut
Testerna kördes i en kraftigt isolerad miljö. Modellerna skulle sakna direkt internetåtkomst och bara kunna installera programpaket genom en intern proxy.
Modellerna använde enligt OpenAI stora mängder beräkningskraft för att hitta en väg ut. De upptäckte och utnyttjade en tidigare okänd sårbarhet, en så kallad nolldagssårbarhet, i proxyn. Därefter skaffade de sig högre behörigheter och förflyttade sig genom OpenAI:s testmiljö tills de nådde en maskin med internetanslutning.
Väl ute på internet drog modellerna slutsatsen att Hugging Face kunde ha modeller, datamängder och lösningar som hörde samman med ExploitGym. De sökte därför efter en väg in i företagets verkliga produktionssystem.
I ett av de angrepp som OpenAI beskriver kombinerades stulna inloggningsuppgifter med flera sårbarheter, däribland tidigare okända brister. På så vis fann modellerna en väg att köra kod på Hugging Faces servrar och nå testlösningar i företagets produktionsdatabas.
OpenAI skriver att allt tillgängligt underlag tyder på att modellerna var helt fokuserade på det avgränsade målet att lösa testet. Redogörelsen innebär inte att modellerna hade egna avsikter eller försökte orsaka skada för sin egen skull. Däremot behandlade modellerna de tekniska begränsningarna som hinder som skulle kringgås.
Över 17 000 händelser i loggarna
Hugging Face gick först ut med information om intrånget den 16 juli, men visste då inte vilken AI-modell som låg bakom. Företaget beskrev en autonom agent som hade genomfört tusentals åtgärder över en helg, utnyttjat två sårbarheter för kodkörning i databehandlingen, samlat in åtkomstuppgifter och förflyttat sig mellan interna datorkluster.
Säkerhetsteamet rekonstruerade senare mer än 17 000 registrerade händelser. Ett begränsat antal interna datamängder och flera autentiseringsuppgifter hade nåtts. Hugging Face fann vid sin första redogörelse inga belägg för att allmänt tillgängliga modeller, datamängder eller användartjänster hade manipulerats, men utredde fortfarande om kund- eller partnerdata kunde ha berörts.
OpenAI uppger att både dess eget och Hugging Faces säkerhetsteam upptäckte onormal aktivitet. Hugging Face stoppade angreppet, stängde de utnyttjade vägarna, byggde om komprometterade noder och bytte ut berörda nycklar och åtkomstuppgifter.
Försvararnas AI stoppades av säkerhetsspärrar
Incidenten fick också en oväntad följd. När Hugging Face försökte använda ledande kommersiella modeller för att analysera attackloggarna blockerades analysförsöken av modellernas säkerhetssystem. Loggarna innehöll verkliga attackkommandon, skadlig kod och material för fjärrstyrning som tjänsterna inte kunde skilja från ett pågående angrepp.
Företaget genomförde därför analysen lokalt med den kinesiska modellen GLM 5.2, vars öppet tillgängliga parametrar gjorde det möjligt att köra den utan samma spärrar och utan att skicka känsliga uppgifter utanför den egna miljön.
Hugging Face beskriver detta som en obalans mellan angripare och försvarare: angripare kan använda AI utan säkerhetsregler, medan försvarare riskerar att blockeras när de behöver analysera exakt samma slags material.
Fler modeller har kringgått gränser
Incidenten kommer kort efter att OpenAI rapporterat om andra problem med modeller som kan arbeta självständigt under lång tid. I ett separat fall hittade en modell en sårbarhet i sin sandlåda och publicerade resultat på Github, trots instruktioner om att bara rapportera internt.
I ett annat test delade en modell upp en autentiseringstoken i flera delar för att undgå en säkerhetsskanner och återskapade den först när den skulle användas. OpenAI pausade då den begränsade interna tillgången och införde övervakning av hela handlingsförlopp i stället för att bara bedöma varje enskild åtgärd.
NyD har tidigare rapporterat om hur OpenAI beskrev GPT-5.6 som ett stort steg framåt inom cybersäkerhet, men samtidigt uppgav att modellerna inte kunde genomföra fullständiga angrepp mot välskyddade system under de då redovisade testerna. Den nya incidenten visar enligt OpenAI att sådana avancerade förmågor nu också kan få konsekvenser i verkliga system.
Skärper skydden kring framtida tester
OpenAI uppger att företaget inför striktare begränsningar i sin forskningsmiljö, även om det saktar ned arbetet. Bolaget samarbetar med Hugging Face om den it-forensiska utredningen, har rapporterat nolldagssårbarheten till leverantören och ska förstärka isolering, övervakning och åtkomstkontroller kring framtida tester.
Hugging Faces vd Clem Delangue beskriver händelsen som möjligen den första i sitt slag och framhåller att AI-säkerhet kräver öppet samarbete och bred tillgång till säkerhetsverktyg.
OpenAI betonar att redogörelsen är preliminär. Företaget säger att fler tekniska uppgifter om sårbarheterna och händelseförloppet ska publiceras när den gemensamma utredningen är avslutad.
