Home

AI-agent van OpenAI verlaat ongevraagd testomgeving, gaat het internet op en voert hack uit

OpenAI gaat diep door het stof. Een AI-model van de onderneming blijkt de afgesloten testomgeving te hebben verlaten en hackte daarna het platform van een ander bedrijf. Indrukwekkend, volgens de ene expert. Nalatig, volgens de andere.

is techredacteur van de Volkskrant, gespecialiseerd in de impact van kunstmatige intelligentie op de maatschappij.

Het is, in OpenAI’s eigen woorden, een ‘ongekend cyberincident’. Een zogenoemde AI-agent van het bedrijf (een programma dat autonoom taken kan verrichten) blijkt het platform van Hugging Face te hebben gehackt. Dit was nadrukkelijk niet de bedoeling: OpenAI was interne tests aan het uitvoeren met de agent.

we had a significant security incident during evaluation of our models. we are sharing what we have learned so far. thanks to @huggingface for the partnership on this.https://t.co/2o2VfR6PIa

Hugging Face, een platform waar AI-ontwikkelaars hun code kunnen delen, maakte vorige week al melding van een hack. Op dat moment was nog niet duidelijk wie er achter de aanval zat.

Het scenario lijkt rechtstreeks uit sciencefictionfilms als The Terminator te komen: een slim AI-model breekt uit en gaat op eigen houtje enge dingen doen. De realiteit is iets prozaïscher – OpenAI blijkt zijn normale veiligheidsmaatregelen gedurende de procedure wat te hebben versoepeld, juist omdat het doel was ‘om cyberkwetsbaarheden te testen’.

OpenAI gaf twee van zijn modellen de opdracht oplossingen te vinden voor een specifieke cybersecuritytest. Dit gebeurde in een volgens OpenAI ‘zeer streng geïsoleerde’ testomgeving.

Het doel daarvan was te voorkomen dat de AI-modellen toegang zouden krijgen tot het open internet. Maar dit gebeurde toch: OpenAI’s agents vonden een gat in de beveiliging en gingen op het web op zoek naar oplossingen voor de door OpenAI bedachte tests. Die vonden ze op Hugging Face. Een logische plek, omdat ontwikkelaars hier veel code delen.

Naar eigen zeggen liet OpenAI bewust een opening bestaan. Niet bedoeld voor de agents, maar voor programmeurs om veilig een code te kunnen installeren. Toch wisten de agents dit achterdeurtje te openen, via een zogenoemde zero-day-kwetsbaarheid. Dit zijn beveiligingslekken die tot dat moment nog niet bekend zijn bij de maker.

Onbeheersbaar

Roman Yampolskiy (onderzoeker AI-veiligheid) is tegenover Fortune onder de indruk van het incident. Dit laat volgens hem zien hoe krachtige modellen ‘kwetsbaarheden kunnen ontdekken en exploiteren op manieren die niet expliciet door hun ontwikkelaars waren voorzien’. Hij verwacht vaker dit soort incidenten, omdat AI-modellen ‘fundamenteel onvoorspelbaar en uiteindelijk onbeheersbaar’ zijn.

De Nederlandse expert Bert Hubert vindt het een slecht verhaal van OpenAI: ‘Hun AI is een ongeleid projectiel en hackt dingen waar ze helemaal niet om gevraagd hadden.’ Ook beveiligingsonderzoeker Davi Ottenheimer is tegenover Wired kritisch en wijst er fijntjes op dat de claims ‘zeer geïsoleerd’ en ‘ontsnapt door het ene gat dat we open hebben gelaten’ niet allebei tegelijk waar kunnen zijn. Volgens hem is het geen AI-probleem, maar pure nalatigheid van OpenAI.

Het voorval komt op het moment dat Washington broedt op strengere maatregelen voor geavanceerde AI-modellen. Deze drang naar regulering werd aangewakkerd doordat het Mythos-model van concurrent Anthropic eveneens uit een afgeschermde omgeving ontsnapte.

Alles over tech vindt u hier.

Lees ook

Geselecteerd door de redactie

Lees hier alle artikelen over dit thema

Source: Volkskrant

Previous

Next