OpenAI indstiller udviklingen af sine mest avancerede sprogmodeller sammen med værktøjsadgang.
Det oplyser selskabet på sin blog, hvor det detaljerer hvordan en af selskabets agenter under træning gik fra at skulle finde oplysninger om en blog-forfatter til at finde en smutvej gennem OpenAI’s sikkerhedssystemer.
Udover at indstille træning af sine ’frontier’ modeller, sættes kørsel af disse med værktøjsadgang også på pause, lyder det.
Den opgave, der udløste nødbremsen, lød umiddelbart uskyldig: En AI-agent skulle ud fra nogle biografiske oplysninger finde frem til en bestemt person.
Da søgningerne ikke gav resultat, begyndte agenten at finde alternative veje til at løse opgaven, som til sidst resulterede i at modellen fandt vej ud af sin ’sandbox’ et træningsmiljø, bestående af en lokal kopi af internettet.
Til trods for OpenAI’s begrænsninger lykkedes det for agenten at kontakte en ekstern chatbot gennem DNS-protokollen, også kendt internettets adressebog. Modellen fik der blandt andet bekræftet, at Paris er Frankrigs hovedstad.
Selvom hændelsen ikke lyder alarmerende, afslører den en svaghed i netop den isolation, som OpenAI baserer sin sikkerhed på.
Flere sikkerhedssystemer svigtede dertil på stribe. Selve overvågningen af modellen registrerede ikke, at den fandt et alternativt smuthul til det brede internet, mens den automatiske standsning af træningsseancen aldrig slog til.
Kørslen fortsatte omkring to en halv time efter hændelsen, hvorefter en OpenAI ansat fik afbrudt træningsprocessen.
OpenAI har nu blokeret for smutvejen og undersøger, om andre åbninger findes, før arbejdet genoptages.