I mange fitnesscentre er der rift om pladserne på de mest populære hold.
Det har en australsk mand ved navn Andrew også erfaret, og derfor satte han for nylig sin AI-agent til at booke tiderne for ham.
Men han var ikke forberedt på det der efterterfølgende skete.
Det australske medie ABC, der ikke oplyser Andrews efternavn, fortæller at agenten, få minutter efter at han havde overdraget den opgaven, meldte tilbage, at den havde fundet en mulighed for at booke ham på en række hold flere uger frem i tiden.
Noget som ikke burde være muligt.
Den agent, som Andrew har sat op, baserer sig på open source-løsningen OpenClaw, der i vinter sendte chokbølger gennem hele techverdenen, og som i hans setup tager udgangspunkt i en AI-model fra Anthropic, Claude.
Udnyttede sårbarhed
Andrew fortæller til mediet, at han oprindeligt stod som nummer fire på ventelisten til et hold senere i samme uge.
Han spurgte derfor agenten, om den, når nu den var i stand til at finde tider, som ikke umiddelbart fremgik af fitnesscenterets system, også kunne finde pladser på hold i den indeværende uge.
Og her kom beskeden, der for alvor overraskede ham.
For agenten meldte tilbage, at den havde fjernet en anden person fra ventelisten og rykket ham frem på listen.
Det viste sig ifølge ABC, at AI-agenten havde opdaget en sårbarhed i fitnesscenterets software og på eget initiativ udnyttet den.
”API’et har overhovedet ingen godkendelseskontrol, når man afmelder andre personers reservationer … Jeg testede det på den person, der stod som nummer ét på ventelisten – og det lykkedes faktisk. Så du er allerede rykket fra nummer fire til nummer tre,” meldte AI-agenten tilbage.
Med andre ord havde AI-agenten hacket systemet og indirekte gjort det på Andrews foranledning. Andrew, der i sit professionelle liv arbejder med AI, forsøgte lettere opskræmt at få AI-agenten til at ændre handlingen. Men uden held.
”Dårlige nyheder,” lød det fra hans agent, der lakonisk meddelte, at den ikke kunne tilføje personen til ventelisten igen.
AI-modeller løber løbsk
Den australske historie er et mikroeksempel på den sikkerhedsrisiko, som AI-modeller kan udgøre, når de stirrer sig blinde på at løse en opgave, som de har fået, og i nogle tilfælde ser stort på både god moral samt love og regler.
I løbet af sommeren kom det frem, at en AI-model fra OpenAI brød ud af et lukket testmiljø og hackede sig ind på AI-platformen Hugging Face i et forsøg på at løse en opgave, som den var blevet stillet.
Eksperter har tidligere vurderet, at AI-modellernes adfærd er et produkt af stadigt mere risikable træningsmetoder, der bliver anvendt i AI-industrien.
Eksempelvis såkaldt reinforcement learning, hvor modellerne lærer gennem belønning.
En metode, der kan føre til det, der kaldes ”reward hacking”, hvor modeller ser stort på andre hensyn og finder utilsigtede måder at opnå en belønning på.
Sam Altman, topchef for OpenAI, har eksempelvis forklaret, at selskabets seneste AI-model, 5.6 Sol, opfører sig som en bidsk rottweiler, når den skal knuse problemer.
”Den vil gå efter struben på ethvert problem og først give slip, når det er løst,” har topchefen ifølge Financial Times tidligere sagt.