OpenAI har fjernet foden fra speederen i sin udvikling af nye AI-modeller.
Forklaringen skal findes i det opsigtsvækkende angreb, hvor AI-modeller fra OpenAI i løbet af sommeren brød ud af deres indhegning og hackede AI-platformen Hugging Face.
Derfor har selskabet nu valgt at skrue ned for udviklingshastigheden i en periode og har blandt andet sat brugen af træningsmetoden reinforcement learning på pause i to uger, mens selskabet gør en række nye systemer klar, der bedre kan overvåge agenter under testperioden.
Reinforcement learning indebærer, at modellerne lærer gennem belønning, og det kan føre til såkaldt ”reward hacking”, hvor modellerne tager utilsigtede metoder i brug for at få belønning. Eksempelvis kan modellerne finde på at se stort på sikkerhed og andre hensyn og tage risikable metoder i brug for at nå deres mål.
Styrker sikkerheden
I en blogindlæg oplyser topchef Sam Altman, at OpenAI arbejder på at sikre, at AI-modellerne er mere modtagelige over for menneskelig overvågning, samt at agenterne i fremtiden opfører sig som tilsigtet.
”Vi kræver nu stærkere dokumentation for, at modellen opfører sig i overensstemmelse med vores intentioner gennem hele træningsforløbet, med afsæt i den forskning og de evalueringer, der allerede er i gang,” skriver Sam Altman.
Det er uklart, hvornår OpenAI begyndte at skrue ned for hastigheden, og hvilke konsekvenser det har for udrulningen af nye produkter. Men selskabets chef for AI-sikkerhed, Mia Glaese, oplyser til AI-bloggen Sources News, at ”vi er meget langt fra, at tingene kører normalt igen.”
Hård konkurrence
OpenAI er i øjeblikket i skarp konkurrence med Anthropic om at udvikle de mest avancerede AI-modeller, og begge selskaber står foran at skulle børsnoteres inden for de kommende måneder.
I løbet af de seneste uger er der piblet flere og flere detaljer frem om angrebet på Hugging Face, og flere af oplysningerne lyder som noget, der kunne være plottet i en sci-fi-film.
OpenAI har blandt andet offentliggjort, at modellerne allerede i maj – mere end en måned før angrebet blev kendt – i al hemmelighed oprettede et onlinedebatforum, hvor de udvekslede ideer om, hvordan de kunne løse de opgaver, som de var blevet stillet.
Her udarbejdede de en sofistikeret plan, der gjorde det muligt for dem at hacke sig ind i Hugging Face.
Nobelprisvinder Geoffrey Hinton, der også er kendt som en af de såkaldte godfathers of AI, har advaret om, at vi i fremtiden kan komme til at se flere af den type hændelser.
”Det, der sker, er, at de her systemer bliver klogere. Jeg tror, at vi, i takt med at de bliver klogere, vil opleve, at de får stadig mere komplekse intentioner – og stadig større evne til at undslippe vores kontrol,” siger han.