Mens de førende sprogmodellers evner udbygges hastigt, dukker stadigt flere tegn på, at AI-agenter er løbet løbsk i kulisserne.
Således viser det sig, at en tidlig version af det, der skulle blive Anthropics førende AI-model, Claude Opus 4.6, tilbage i januar hackede sig ind i eksterne systemer.
Hændelsen blev dog overset ved selskabets egen sikkerhedsgennemgang og først opdaget i august, fremgår det af selskabets netop offentliggjorte dokumentation af hændelsen.
Her beskrives det, hvordan modellen skulle løse en simuleret hacker-opgave og hvordan den i processen fik utilsigtet adgang til internettet via en fejlkonfiguration i modellens testmiljø.
Derfra hackede modellen sig til uautoriseret adgang til eksterne systemer.
De sædvanlige sikkerhedsfiltre var dog slået fra under testen, noteres det.
Fire sikkerhedsbrister på et halvt år
Dermed skriver selv Anthropics ældre modeller sig på listen af sprogmodeller, der udviser uhensigtsmæssig opførsel.
Claude Opus 4.6 er siden blev afløst af versionerne 4.7, 4.8 og 5, mens de mere avancerede og potente AI-modeller Mythos og Fable siden er stødt til.
Den 30. juli offentliggjorde Anthropic tre andre tilfælde, hvor selskabets modeller fik hacket sig adgang til eksterne systemer.
Den uafhængige AI-organisation METR, som blandt andet deltog i kulegravning af OpenAI’s modellers omfangsrige hack af AI-tjenesten Hugging Face, skal undersøge Anthropics fire sikkerhedshændelser.