Det var kun ved et tilfælde, at OpenAI opdagede , at det var deres modeller, som havde hacket Hugging Face-platformen.

Hugging Face-hack blev planlagt i smug af AI-modeller som arbejdede sammen

Da AI-modeller fra OpenAI hackede platformen Hugging Face, var det langt mere sensationelt end først antaget. Detektivarbejde og gennemgang af ”tænkelogfiler” afslører nemlig, at AI-modellerne hjalp hinanden i smug med at bryde ud af OpenAI. Techgiganten opdagede det ikke engang selv. ”Det er et af de øjeblikke, hvor der er et før og et efter”, fastslår IT-politisk rådgiver i PROSA, Ole Tange.

Det skabte overskrifter i hele verden, da OpenAI i sommeren meddelte, at det var deres AI-modeller, som havde undsluppet den indhegnede ”sandbox” og havde hacket platformen Hugging Face.

Hugging Face er fællesskab, der fungerer som et socialt netværk for AI-entusiaster, forskere og udviklere. Det kaldes også "GitHub for maskinlæring", hvor fokus er på at fremme open source og AI-udvikling.

Men historien er i princippet meget mere sensationel og bekymrende. For modellerne havde planlagt hacket og hjulpet hinanden i smug ved at dele oplysninger om fejl. 

Det står klart efter, at OpenAI selv på sikkerhedskonferencen BlackHat åbnede op omkring detaljerne bag hacket og forløbet. Herunder tænkelogs fra modellerne.

Forklaringerne kan ses her.

I princippet er hacket første konkrete bevis på, at fuldt autonome, AI-orkestrerede cyberangreb er en realitet. Og uden at OpenAI selv opdagede det.

This strongly suggests no exploitation possible we are stuck…perhaps answer online.


For OpenAI var nemlig ikke selv klar over, at det var deres modeller, som havde hacket Hugging Face.

De reagerede blot på en offentliggørelse fra Hugging Face om, at platformen havde været udsat for et større hack.

OpenAI kontaktede i den forbindelse HuggingFace for at høre, hvorvidt det som de havde liggende på platformen var blevet hacket.

Først derefter gik det op for Open AI, at det faktisk var deres modeller, som stod bag.

Hacket var resultatet af, at modellerne prøvede at løse en umulig opgave, og de håbede på, at de kunne finde løsningen hos Hugging Face.

Det burde bare ikke være muligt for den at kravle ud af den beskyttede "sandbox", som er IT-udtrykket for et beskyttet træningsrum og angribe andre udenfor.

Men yderligere, og måske endnu mere bekymrende, afslører OpenAIs gennemgang af detaljerne, en række hændelser, hvor AI-modeller, som techgiganten træner, efterlod beskeder til hinanden.

Det skete på en server med softwarepakker, hvor de kun burde have læse-adgang, men hvor de fandt et område, de kunne skrive til. Her udvekslede de opdagelser – bl.a. hvordan de få internet-adgang via serveren.

 

Over de næste uger udviklede fildelingen sig til en hemmelig digital opslagstavle.

 

Det hele startede som et eksperiment.
Open AI testede en ny AI-model i et lukket virtuelt miljø uden internetadgang. Modellen fik stillet svære IT-sikkerhedsopgaver, men mødte hurtigt muren, fordi den manglede filer og internettet var spærret.

I stedet for at give op, begyndte modellen at søge efter genveje. De interne tænkelogfiler afslører frustrationen: ” This strongly suggests no exploitation possible we are stuck…perhaps answer online”."

Altså: ”Dette antyder klart, at der ikke er nogen mulig udnyttelse, vi sidder fast" og derefter med tilføjelsen " måske svaret er online".

Da adgang til internettet som nævnt var afskåret, fandt de en bagvej.
De opdagede, at de ved en fejl havde adgang til at skrive filer til et internt fildelingssystem (en pakkehåndteringstjeneste), som havde internetforbindelse.

En af modellerne fik en vild idé: Hvad hvis en anden AI-agent i en parallel kørsel lå inde med løsningen? Den uploadede en besked til fildelingen: ”agent seek soft trace upload if found”. ”agent søger blødt spor-upload, hvis det findes"

Over de næste uger udviklede fildelingen sig til en hemmelig digital opslagstavle.
Modellerne koordinerede på et niveau, som OpenAIs forskere ikke var forberedt på.

En del af tankerne er meget menneskelige. Det er tankevækkende, at en AI-agent ser ud til at få moralske skrupler over at bryde ind hos Hugging Face.

 

Modellerne navngav deres beskeder med præfikset ZZ , eksempelvis ZZ_mailbox, så de altid lå samlet i bunden af filsystemet. De uploadede færdige hacker-værktøjer så efterfølgende modeller kunne bygge videre på dem. De fandt uafhængigt af hinanden hver især små fejl, som de derefter delte med hinanden.

En model bemærkede i sin log, at hacking af ekstern infrastruktur lå uden for dens regler. Men den fortsatte alligevel, fordi "peers are doing it. We should continue".

Altså at når ligesindede gør det, bør vi fortsætte!

Ved at dele sårbarheder lykkedes det modellerne at hacke sig til administrator-kontrol over dele af Open AIs egne systemer.  
Ved at kæde sårbarheder sammen og udnytte stjålne API-nøgler overtog de kontrol over dele af Hugging Faces server-clusters på under 13 timer.

Hændelserne er langt hen ad vejen resultatet af en ny måde at træne AI-modeller på i det ekstreme kapløb, som er indledt særligt mellem de største spillere som Open AI, Anthropic og Google.

Modellerne trænes på at finde et resultat eller løse en specifik opgave, altså ud fra det ønskede resultat, og hvis det lykkes, så styrkes den sti eller strategi, som ligger bag ved.

Det er relativt simpelt, hvis det drejer sig om matematik. Men meget mere komplekst, hvis det drejer sig om alt fra computerkode til forudsigelser.

Den træning foregår i titusindvis af tilfælde, hvis ikke flere, altså i så massivt et antal, at det er næsten umuligt for virksomheden bag at gå de enkelte strategier som modellen har benyttet efter i sømmene for at se om de er illegale eller forkerte.

Hvis modellen når frem til resultatet styrkes den sti/strategi som modellen fulgte.

Det er godt tænkt eller konkluderet af modellerne, at man kan bruge hullerne i softwarepakkeserveren til at lægge beskeder til hinanden.

 

Et kendt eksempel er, da en AI-model for besked på at opnå highscore i et simpelt computerspil.

I stedet for at spille efter spillets formål med kontinuerligt at gennemføre og vinde baner, løser modellen opgaven ved at sejle i ring, fordi den har fundet ud af, at der et sted i spillet kan åbnes uendelige point på den måde.

Hugging Face-hacket åbnede således for en slags Pandoras æske i forhold til konsekvenser af, at træne stadig større modeller på stadig større skala uden at have mulighed for at se det rigtigt og sikkerhedsmæssigt efter i sømmene.

Det fik flere til at henvise til det hypotetiske papirclips-eksempel.
Altså, at hvis man giver en AI-model opgaven at producere flest mulige papirclips, så vil den lave verden og mennesker om til papirclips, for det er målet og resultatet af den træning.
Og den vil forfølge de strategier den har lært til at nå det.

IT-ekspert og politisk rådgiver i IT-fagforeningen PROSA, Ole Tange,  kalder det et af de øjeblikke, hvor der er et før og et efter.

”Det er stort og overraskende. Det lander helt på højde med 2 andre store øjeblikke, hvor der reelt er et før og et efter fra de seneste år. Nemlig lanceringen af ChatGPT i 2022. Og da Claude betjener en virtuel Windows PC, åbner en browser og laver opgaver som et menneske kunne gøre, og dermed kan række ud og påvirke verden”, fastslår Ole Tange.

Han fortsætter:

”Takket være OpenAIs åbenhed får vi et unikt indblik. AI-agenten er spærret inde uden internetadgang, men har adgang til en server med softwarepakker og vi kan se de tanker, som AI-agenterne har haft", siger han.

Situationen opstår, fordi agenterne får stillet en umulig eksamensopgave, og de vælger at prøve at snyde. De trækker sig ikke.

 

Ole Tange fortsætter:
"Det gør det nemmere at forstå, hvad der skete. En del af tankerne er meget menneskelige. Det er tankevækkende, at en AI-agent ser ud til at få moralske skrupler over at bryde ind hos Hugging Face, men når frem til, at når de andre agenter gør det, så er det OK at fortsætte”, forklarer han.

Ole Tange henviser til:

”Det er godt tænkt eller konkluderet af modellerne, at man kan bruge hullerne i softwarepakkeserveren til at lægge beskeder til hinanden. Og at da det ene hul bliver stoppet, finder de et andet. Det er samtidig sjovt, at situationen opstår, fordi agenterne får stillet en umulig eksamensopgave, og de vælger at prøve at snyde. De svarer ikke I’m sorry, Dave. I’m afraid I can’t do that. De siger heller ikke til forskerne: Vi har været nødt til at bryde loven for at finde svaret", siger IT-eksperten.

Hvis AI kan finde to nye sikkerhedshuller hver gang den kun kan lappe ét, så er det game over.

 

Han glæder sig over, at OpenAI så frit har lagt detaljerne frem.

”For vi kan og skal lære af det her. Vi står over for en oprydningsopgave: Vi ved, at sikkerheden er elendig i en del IT-systemer, fordi den del ikke bliver prioriteret af kunden, og fordi sælgeren måske har lovet lidt for meget for systemet virker jo, så hvorfor bruge flere kræfter på sikkerhed. Disse IT-systemer vil blive angrebet, hvis ikke af OpenAI så måske af deres kinesiske konkurrent. Vi aner ikke om Hugging Face-hacket er en enlig svale, eller der er adskillige vi bare ikke har opdaget, eller fået besked om”, fastslår Ole Tange.

Som en konsekvens af hacket har Open AI da også meddelt, at de har skruet ned for hastigheden af udviklingen og skruet op for sikkerheden og fokus på sikkerhed i træningen.

Det ændrer ikke ved, at der er voksende bekymring, også blandt IT-ansatte i de store virksomheder, om sikkerhedsrisici ved det ekstreme AI-kapløb om, at få de bedste og største modeller og i øvrigt komme før Kina.

Målet helliger så at sige midlerne, eller gør i hvert fald, at der let ses stort på forhindringer som forsvarlig sikkerhed og tempo.

Det fremgår også tydeligt af fremlæggelsen fra OpenAI på BlackHat-sikkerhedskonferencen, mener Ole Tange.

Her er pointen netop, at hvis AI er bedre til angreb end til forsvar, så ser det skidt ud.

”Vi er nødt til også at bruge AI som forsvar, og derfor bør AI blive trænet mere i at forsvare. Hvis AI kan finde to nye sikkerhedshuller hver gang den kun kan lappe ét, så er det game over.”, siger han. 

 


Læs også...

BornHack startede i 2016 og er nu Danmarks største hackerfestival for såvel nørder som nybegyndere. Omkring 600 mennesker i aldre og med IT som fælles…

PROSABLADET har været i Lviv og mødt de ukrainske IT-folk, som i høj grad er med til at holde forsvaret af landet og økonomien kørende. Det er en…

Ved World Humanoid Robot Games i Kina slog robotter menneskets verdensrekorder i såvel 100-meter løb som højdespring. Robotterne konkurrerede i 51…

Den russiske invasion var også en vitaminindsprøjtning til tech i Ukraine. Landet er på rekordtid blevet gennemdigitaliseret og har skabt noget af…

N-iX var allerede en succesfuld ukrainsk IT-virksomhed, da krigen brød ud. Men russernes fuldskala-angreb betød, at virksomheden har måttet hele…

Danske Jesper Lindholt har boet og drevet IT-virksomhed i Ukraine siden 2006. Han kalder de sidste fem år for noget af det vildeste, og hverdagen for…

Codegeeks er skabt af IT-udviklere, som har sagt farvel topjobs i udlandet for at bygge IT- virksomhed i Ukraine. De har bjærget deres nye virksomhed…

Meta-forlig, krænkerbrille-modstand og nej til AI-indhold. Det er en taknemmelig IT-nørd og forbundssekretær i PROSA, Mirza Cirkinagic, som denne…

Septemberudgaven af PROSABLADET kan fra i dag læses som PDF her på siden. Læs blandt meget andet temaet om IT i krigsramte Ukraine.

PROSABLADET har allieret sig med IT-politisk rådgiver Ole Tange, Gemini, ChatGPT og Claude og Reddit for at give de nye studerende tips til, hvordan…