OpenAI sætter omstridt træningsmetode på pause i to uger

OpenAI har sat brugen af reinforcement learning på pause i to uger efter det opsigtsvækkende angreb, Hugging Face-angreb. Samtidig skærper selskabet overvågningen af modellerne under træning.

Artikel top billede

(Foto: Softbank/PR)

OpenAI har fjernet foden fra speederen i sin udvikling af nye AI-modeller.

Forklaringen skal findes i det opsigtsvækkende angreb, hvor AI-modeller fra OpenAI i løbet af sommeren brød ud af deres indhegning og hackede AI-platformen Hugging Face.

Derfor har selskabet nu valgt at skrue ned for udviklingshastigheden i en periode og har blandt andet sat brugen af træningsmetoden reinforcement learning på pause i to uger, mens selskabet gør en række nye systemer klar, der bedre kan overvåge agenter under testperioden.

Reinforcement learning indebærer, at modellerne lærer gennem belønning, og det kan føre til såkaldt ”reward hacking”, hvor modellerne tager utilsigtede metoder i brug for at få belønning. Eksempelvis kan modellerne finde på at se stort på sikkerhed og andre hensyn og tage risikable metoder i brug for at nå deres mål.

Styrker sikkerheden

I en blogindlæg oplyser topchef Sam Altman, at OpenAI arbejder på at sikre, at AI-modellerne er mere modtagelige over for menneskelig overvågning, samt at agenterne i fremtiden opfører sig som tilsigtet.

”Vi kræver nu stærkere dokumentation for, at modellen opfører sig i overensstemmelse med vores intentioner gennem hele træningsforløbet, med afsæt i den forskning og de evalueringer, der allerede er i gang,” skriver Sam Altman.

Det er uklart, hvornår OpenAI begyndte at skrue ned for hastigheden, og hvilke konsekvenser det har for udrulningen af nye produkter. Men selskabets chef for AI-sikkerhed, Mia Glaese, oplyser til AI-bloggen Sources News, at ”vi er meget langt fra, at tingene kører normalt igen.”

Hård konkurrence

OpenAI er i øjeblikket i skarp konkurrence med Anthropic om at udvikle de mest avancerede AI-modeller, og begge selskaber står foran at skulle børsnoteres inden for de kommende måneder.

I løbet af de seneste uger er der piblet flere og flere detaljer frem om angrebet på Hugging Face, og flere af oplysningerne lyder som noget, der kunne være plottet i en sci-fi-film.

OpenAI har blandt andet offentliggjort, at modellerne allerede i maj – mere end en måned før angrebet blev kendt – i al hemmelighed oprettede et onlinedebatforum, hvor de udvekslede ideer om, hvordan de kunne løse de opgaver, som de var blevet stillet.

Her udarbejdede de en sofistikeret plan, der gjorde det muligt for dem at hacke sig ind i Hugging Face.

Nobelprisvinder Geoffrey Hinton, der også er kendt som en af de såkaldte godfathers of AI, har advaret om, at vi i fremtiden kan komme til at se flere af den type hændelser.

”Det, der sker, er, at de her systemer bliver klogere. Jeg tror, at vi, i takt med at de bliver klogere, vil opleve, at de får stadig mere komplekse intentioner – og stadig større evne til at undslippe vores kontrol,” siger han.

Læses lige nu

    Annonce

    Statens IT

    Teamleder til Servicedesk Aalborg

    Københavnsområdet

    Paychex Europe

    Seniorudvikler til Danløn

    Københavnsområdet

    Vivant ApS

    IT-supporter til Servicedesk

    Københavnsområdet

    Annonceindlæg fra itavis

    AI er en stresstest af virksomhedernes digitale fundament

    Brug af AI afslører de svagheder, virksomheder allerede har opbygget gennem års cloud-transformation, nye SaaS-løsninger og fragmenterede sikkerhedssystemer.

    Navnenyt fra it-Danmark

    Norriq Danmark A/S har pr. 1. april 2026 ansat Sascha Trebbien Klinggaard som Lead Consultant. Hun skal især beskæftige sig med at facilitere tæt partnerskab og strategisk behovsafdækning hos vores kunder. Hun kommer fra en stilling som Senior Business Analytics Consultant hos Twoday Kapacity. Hun er uddannet hos Copenhagen Business School og har en Master's degree,Finance & Strategic Management 2014 - 2016. Nyt job

    Sascha Trebbien Klinggaard

    Norriq Danmark A/S

    Genetec har pr. 1. august 2026 ansat Jan Julin som Channel Account Executive. Han skal især beskæftige sig med styrke samarbejdet med partnere og kunder i Danmark, Finland og Baltikum. Han kommer fra en stilling som Senior Business Development Manager hos Dahua Technology. Han har tidligere beskæftiget sig med videoovervågning, adgangskontrol, sikkerhedsteknologi, salg og forretningsudvikling. Nyt job

    Jan Julin

    Genetec

    LCG har pr. 1. september 2026 ansat Thomas Wong, 47 år,  som Director of Cyber & Risk Advisory. Han skal især beskæftige sig med Ansvar for at udvikle LCG’s rådgivning inden for cybersikkerhed, cyberrisiko og GRC. Han kommer fra en stilling som VP of security hos Atea. Nyt job
    Softwarevirksomheden Idura, som udvikler løsninger til digital identifikation og autentifikation, har pr. 1. september 2026 ansat Alfredo Paladino, 32 år,  som Account Manager for det danske marked. Han skal især beskæftige sig med salg af Iduras MitID- og signaturløsninger i Danmark. Han kommer fra en stilling som Head of Business Development hos Goodwings. Han er uddannet kandidat i e-business. Han har tidligere beskæftiget sig med at opbygge Goodwings' kommercielle funktion og lede et internationalt BDR-team på 12 personer. Nyt job

    Alfredo Paladino

    Softwarevirksomheden Idura, som udvikler løsninger til digital identifikation og autentifikation,