Over de næste uger udviklede fildelingen sig til en hemmelig digital opslagstavle.
Det hele startede som et eksperiment.
Open AI testede en ny AI-model i et lukket virtuelt miljø uden internetadgang. Modellen fik stillet svære IT-sikkerhedsopgaver, men mødte hurtigt muren, fordi den manglede filer og internettet var spærret.
I stedet for at give op, begyndte modellen at søge efter genveje. De interne tænkelogfiler afslører frustrationen: ” This strongly suggests no exploitation possible we are stuck…perhaps answer online”."
Altså: ”Dette antyder klart, at der ikke er nogen mulig udnyttelse, vi sidder fast" og derefter med tilføjelsen " måske svaret er online".
Da adgang til internettet som nævnt var afskåret, fandt de en bagvej.
De opdagede, at de ved en fejl havde adgang til at skrive filer til et internt fildelingssystem (en pakkehåndteringstjeneste), som havde internetforbindelse.
En af modellerne fik en vild idé: Hvad hvis en anden AI-agent i en parallel kørsel lå inde med løsningen? Den uploadede en besked til fildelingen: ”agent seek soft trace upload if found”. ”agent søger blødt spor-upload, hvis det findes"
Over de næste uger udviklede fildelingen sig til en hemmelig digital opslagstavle.
Modellerne koordinerede på et niveau, som OpenAIs forskere ikke var forberedt på.
En del af tankerne er meget menneskelige. Det er tankevækkende, at en AI-agent ser ud til at få moralske skrupler over at bryde ind hos Hugging Face.
Modellerne navngav deres beskeder med præfikset ZZ , eksempelvis ZZ_mailbox, så de altid lå samlet i bunden af filsystemet. De uploadede færdige hacker-værktøjer så efterfølgende modeller kunne bygge videre på dem. De fandt uafhængigt af hinanden hver især små fejl, som de derefter delte med hinanden.
En model bemærkede i sin log, at hacking af ekstern infrastruktur lå uden for dens regler. Men den fortsatte alligevel, fordi "peers are doing it. We should continue".
Altså at når ligesindede gør det, bør vi fortsætte!
Ved at dele sårbarheder lykkedes det modellerne at hacke sig til administrator-kontrol over dele af Open AIs egne systemer.
Ved at kæde sårbarheder sammen og udnytte stjålne API-nøgler overtog de kontrol over dele af Hugging Faces server-clusters på under 13 timer.
Hændelserne er langt hen ad vejen resultatet af en ny måde at træne AI-modeller på i det ekstreme kapløb, som er indledt særligt mellem de største spillere som Open AI, Anthropic og Google.
Modellerne trænes på at finde et resultat eller løse en specifik opgave, altså ud fra det ønskede resultat, og hvis det lykkes, så styrkes den sti eller strategi, som ligger bag ved.
Det er relativt simpelt, hvis det drejer sig om matematik. Men meget mere komplekst, hvis det drejer sig om alt fra computerkode til forudsigelser.
Den træning foregår i titusindvis af tilfælde, hvis ikke flere, altså i så massivt et antal, at det er næsten umuligt for virksomheden bag at gå de enkelte strategier som modellen har benyttet efter i sømmene for at se om de er illegale eller forkerte.
Hvis modellen når frem til resultatet styrkes den sti/strategi som modellen fulgte.
Det er godt tænkt eller konkluderet af modellerne, at man kan bruge hullerne i softwarepakkeserveren til at lægge beskeder til hinanden.
Et kendt eksempel er, da en AI-model for besked på at opnå highscore i et simpelt computerspil.
I stedet for at spille efter spillets formål med kontinuerligt at gennemføre og vinde baner, løser modellen opgaven ved at sejle i ring, fordi den har fundet ud af, at der et sted i spillet kan åbnes uendelige point på den måde.
Hugging Face-hacket åbnede således for en slags Pandoras æske i forhold til konsekvenser af, at træne stadig større modeller på stadig større skala uden at have mulighed for at se det rigtigt og sikkerhedsmæssigt efter i sømmene.
Det fik flere til at henvise til det hypotetiske papirclips-eksempel.
Altså, at hvis man giver en AI-model opgaven at producere flest mulige papirclips, så vil den lave verden og mennesker om til papirclips, for det er målet og resultatet af den træning.
Og den vil forfølge de strategier den har lært til at nå det.
IT-ekspert og politisk rådgiver i IT-fagforeningen PROSA, Ole Tange, kalder det et af de øjeblikke, hvor der er et før og et efter.
”Det er stort og overraskende. Det lander helt på højde med 2 andre store øjeblikke, hvor der reelt er et før og et efter fra de seneste år. Nemlig lanceringen af ChatGPT i 2022. Og da Claude betjener en virtuel Windows PC, åbner en browser og laver opgaver som et menneske kunne gøre, og dermed kan række ud og påvirke verden”, fastslår Ole Tange.
Han fortsætter:
”Takket være OpenAIs åbenhed får vi et unikt indblik. AI-agenten er spærret inde uden internetadgang, men har adgang til en server med softwarepakker og vi kan se de tanker, som AI-agenterne har haft", siger han.
Situationen opstår, fordi agenterne får stillet en umulig eksamensopgave, og de vælger at prøve at snyde. De trækker sig ikke.
Ole Tange fortsætter:
"Det gør det nemmere at forstå, hvad der skete. En del af tankerne er meget menneskelige. Det er tankevækkende, at en AI-agent ser ud til at få moralske skrupler over at bryde ind hos Hugging Face, men når frem til, at når de andre agenter gør det, så er det OK at fortsætte”, forklarer han.
Ole Tange henviser til:
”Det er godt tænkt eller konkluderet af modellerne, at man kan bruge hullerne i softwarepakkeserveren til at lægge beskeder til hinanden. Og at da det ene hul bliver stoppet, finder de et andet. Det er samtidig sjovt, at situationen opstår, fordi agenterne får stillet en umulig eksamensopgave, og de vælger at prøve at snyde. De svarer ikke I’m sorry, Dave. I’m afraid I can’t do that. De siger heller ikke til forskerne: Vi har været nødt til at bryde loven for at finde svaret", siger IT-eksperten.
Hvis AI kan finde to nye sikkerhedshuller hver gang den kun kan lappe ét, så er det game over.
Han glæder sig over, at OpenAI så frit har lagt detaljerne frem.
”For vi kan og skal lære af det her. Vi står over for en oprydningsopgave: Vi ved, at sikkerheden er elendig i en del IT-systemer, fordi den del ikke bliver prioriteret af kunden, og fordi sælgeren måske har lovet lidt for meget for systemet virker jo, så hvorfor bruge flere kræfter på sikkerhed. Disse IT-systemer vil blive angrebet, hvis ikke af OpenAI så måske af deres kinesiske konkurrent. Vi aner ikke om Hugging Face-hacket er en enlig svale, eller der er adskillige vi bare ikke har opdaget, eller fået besked om”, fastslår Ole Tange.
Som en konsekvens af hacket har Open AI da også meddelt, at de har skruet ned for hastigheden af udviklingen og skruet op for sikkerheden og fokus på sikkerhed i træningen.
Det ændrer ikke ved, at der er voksende bekymring, også blandt IT-ansatte i de store virksomheder, om sikkerhedsrisici ved det ekstreme AI-kapløb om, at få de bedste og største modeller og i øvrigt komme før Kina.
Målet helliger så at sige midlerne, eller gør i hvert fald, at der let ses stort på forhindringer som forsvarlig sikkerhed og tempo.
Det fremgår også tydeligt af fremlæggelsen fra OpenAI på BlackHat-sikkerhedskonferencen, mener Ole Tange.
Her er pointen netop, at hvis AI er bedre til angreb end til forsvar, så ser det skidt ud.
”Vi er nødt til også at bruge AI som forsvar, og derfor bør AI blive trænet mere i at forsvare. Hvis AI kan finde to nye sikkerhedshuller hver gang den kun kan lappe ét, så er det game over.”, siger han.