Kunstmatige intelligentie AI-bedrijven waarschuwen voor extreme risico’s, maar onder veiligheidsexperts is grote verdeeldheid over hoe reëel het gevaar is. En tussen een AI-hack en uitroeiing zitten nogal wat stappen. Toch: „Menselijk uitsterven is nogal een dingetje.”
De term ‘existentieel risico’ is ineens overal. Na een reeks onthullingen over een veiligheidsincident deze zomer bij ChatGPT-maker OpenAI zijn er de afgelopen week serieuze politieke discussies over de mogelijkheid van menselijk uitsterven door op hol geslagen AI. De aanleiding: tijdens een veiligheidstest wisten honderden autonome AI-agents – zelfstandig opererende computerprogramma’s – uit een afgesloten testomgeving te komen, voerden ze zelfstandig hacks uit en probeerden ze vervolgens hun sporen te wissen. Het leidde tot grote commotie in de techwereld en zelfs tot oproepen van AI-topmannen om de ontwikkeling van AI te vertragen.
Vorige week kwam er een storm van doemvoorspellingen los. Jacob Coxon, een onderzoeker die ontslag nam bij AI-bedrijf Anthropic, schreef dat „de mensen die AI bouwen, oprecht geloven dat het ons voor het eind van het decennium allemaal kan doden”. Zijn bericht op X werd meer dan 170 miljoen keer bekeken en kreeg opvallend veel bijval uit de AI-industrie zelf. Anthropic-onderzoeker Evan Hubinger ging in een reactie nog verder: hij schatte de kans dat AI „binnen het volgende decennium” alle mensen doodt op „meer dan 10 procent”. Ook VN-mensenrechtenchef Volker Türk sprak over „existentieel risico” door AI.
Wat betekenen die waarschuwingen precies? Is het niet een te grote denksprong om menselijke uitroeiing te voorspellen als je kijkt naar wat AI daadwerkelijk is en kan? En hoe zit het met de belangen van AI-bedrijven om dit soort apocalyptische taal te bezigen?
Wouter van Noort zoekt samen met lezers naar initiatieven en ideeën voor de economie van de toekomst
Deskundigen op het gebied van AI-veiligheid geven daar opvallend uiteenlopende antwoorden op. Michiel Bakker, AI-onderzoeker aan de Amerikaanse universiteit MIT en tot juli werkzaam bij Googles AI-divisie DeepMind, vindt het terecht dat het nu over de extreme scenario’s gaat, omdat de techniek zich zo snel ontwikkelt. Tegelijk benadrukt hij dat de risico’s helemaal niet nieuw zijn. Als het om AI-veiligheid gaat, zie je altijd hetzelfde terug, zegt hij: „Misbruik, misalignment en machtsconcentratie.”
Misalignment is het gevaar dat AI doelen nastreeft die botsen met menselijke belangen, waarden of veiligheid. Het OpenAI-incident is daarvan een voorbeeld. En daar is volgens Bakker de afgelopen maanden een relevante nieuwe ontwikkeling bovenop gekomen: ‘recursieve zelfverbetering’, het groeiende vermogen van AI zichzelf te verbeteren en nieuwe versies van zichzelf te maken. „Daardoor wordt het veel lastiger toezicht te blijven houden op hoe de systemen werken, en gaat de ontwikkeling veel sneller.”
Roel Dobbe, onderzoeker naar systeemveiligheid aan de TU Delft, verzet zich – met veel andere veiligheidsonderzoekers – vooral tegen de manier waarop claims over extreme risico’s naar buiten komen: „Als die vanuit de AI-bedrijven zelf komen, is het vooral zaak bijzonder kritisch te zijn: welk belang heeft het bedrijf om deze risico’s zo te presenteren?” Hij wijst erop dat AI-bedrijven grote financiële belangen hebben bij het opkloppen van de angst. Het trekt de aandacht en geeft een extra aura aan de kracht van hun product, en kan een plek aan tafel afdwingen bij gesprekken over regulering – om zo dat proces te kunnen beïnvloeden in hun voordeel. Bovendien ontbreekt volgens Dobbe een solide wetenschappelijke basis onder claims over „superintelligentie”, een inderdaad vaag gedefinieerd en hypothetisch moment dat AI beter is dan mensen in álles.
Dobbe wijst erop dat lang niet alle financiële belangen van de aanstichters van deze discussies transparant zijn: „Follow the money.” Zo ontstond over de opgestapte Anthropic-onderzoeker Jacob Coxon een controverse over zijn persoonlijke connecties met de Effective Altruism-beweging (EA). Aanhangers van EA, een filosofische stroming die populair is in Silicon Valley, voeren al jaren campagne om de existentiële risico’s van AI te agenderen. Onder hen zijn ook vroege financiers van OpenAI en investeerders in Anthropic. Hard bewijs dat Coxons vertrek onderdeel was van een professioneel gecoördineerde EA-campagne is er niet ondanks claims van onder meer president Trump; Coxon zelf ontkent dat.
Otto Barten, oprichter van de Nederlandse stichting Existential Risk Observatory, waarschuwt al jaren voor existentiële risico’s van kunstmatige intelligentie (al voelt hij zich naar eigen zeggen niet thuis bij EA). Hij vindt de somberste scenario’s juist wel serieus genoeg om actie te ondernemen. Hij is blij met de verschuiving in het debat van de afgelopen week. Nu worden uitstervingsrisico’s eindelijk echt besproken, zegt hij. „Dat is de hoogste tijd.”
Deze hoogoplopende discussie legt een terugkerende spanning bloot tussen AI-experts. Van oudsher zijn er twee scholen, al vervagen de grenzen de laatste tijd wel wat. Veel AI-ethici waarschuwen dat apocalyptische scenario’s de aandacht afleiden van de echte schade die er nu al is, en het ter verantwoording roepen van de bedrijven dáárvoor. Denk aan algoritmische discriminatie, machtsconcentratie, slordig beveiligde AI-experimenten zoals bij OpenAI óók het geval was, en de sluipende aantasting van menselijke autonomie. Daartegenover stellen veel AI-veiligheidsexperts dat afwenden van een existentiële ramp voorrang moet krijgen, ook al is de kans daarop veel kleiner. „Menselijk uitsterven is nogal een dingetje”, aldus Otto Barten. Het is ook de vraag of aandacht voor het één, aandacht voor het ander uitsluit, vindt Michiel Bakker.
Maar wat zíjn de concrete risico’s dan, volgens de deskundigen die vinden dat uitstervingsgevaar serieus genomen moet worden? Hier komen die drie M’s van Michiel Bakker van pas. De eerste is misbruik, door kwaadwillenden die AI gebruiken voor gevaarlijke doeleinden. Dat gebeurt nu al veelvuldig. Anthropic rapporteerde vorige week hoe een rebellengroep in Noord-Jemen chatbot Claude gebruikte om software voor raketten te bouwen. Het meldde ook vijf gevallen waarin wetenschappers AI-hulp zochten bij riskant biologisch onderzoek naar bijvoorbeeld het kunstmatig dodelijker maken van ziekteverwekkers. En de Amerikaanse overheid gebruikt zelf op grote schaal AI voor wapensystemen. Maar de gedachtesprong naar totale menselijke uitsterving is wel, op zijn zachtst gezegd, fors. Bakker: „Al is bij biologische wapens zoals nieuwe virussen toch best goed voor te stellen dat extreme risico’s kunnen ontstaan.”
De tweede M vergt nóg meer doordenkwerk om tot uitstervingsrisico’s te komen. Bij misalignment krijgt een AI-systeem een doel van zijn makers, maar handelt het bij het nastreven ervan in strijd met menselijke belangen of waarden. Bij het OpenAI-incident waarbij AI-agents zelfstandig besloten om illegale hacks uit te voeren om een doel te bereiken, gebeurde dat deels. Bij een ander recent voorbeeld hackte een AI-agent van een Australiër op eigen houtje zijn sportschool. Hij had de agent (van het opensource-platform OpenClaw) gevraagd om een plek te boeken in een sportklasje, maar dat bleek al vol. De agent hackte vervolgens de sportschool, verwijderde een andere reservering en pikte de plek in. Een creatieve oplossing die het doel bereikte – helaas niet op een legale manier.
Toch vergt het flinke sprongen in technologische ontwikkeling om van het zelfstandig hacken van websites te komen tot existentieel risico. Een AI-agent die de opdracht krijgt „los de files op”, zet voorlopig niet zomaar ineens de Deltawerken open. Zeer gevaarlijke, laat staat existentieel bedreigende, zaken zijn niet zomaar verbonden met internet en om levensgevaarlijke acties in gang te zetten, is vaak ook medewerking van meerdere mensen nodig. Bijvoorbeeld om AI-systemen (herhaaldelijk) toegang te geven tot bijvoorbeeld atoomwapens, nieuwe virussen of killer robots. Al wijst Otto Barten erop dat AI nu al erg goed is in sociale manipulatie, en dat het mogelijk gaat om enkele vrij simpele gedragsinterventies zoals: „Kun je even deze usb-stick in die computer steken?”.
Michiel Bakker van MIT wil een scenario waarin misalignment leidt tot existentieel gevaar desgevraagd wel uitwerken, met de nadrukkelijke waarschuwing dat het speculatief is. Stel, zegt hij, we zijn een paar jaar verder en AI speelt een grote rol in het runnen van bedrijven. Mensen worden onvoorzichtiger, geven meer uit handen. Een grotendeels door AI bestuurd bedrijf heeft tot doel winst te maximaliseren, zet risicovolle stappen, en merkt dat het er belang bij heeft zaken verborgen te houden voor toezichthouders. „Dat systeem begint steeds meer te verbergen wat het precies doet. En het merkt dat de winst omhooggaat door dingen te verbergen. Dus dat pad wordt in het AI-systeem versterkt.”
Dan volgt de stap die het scenario existentieel maakt. „Op een gegeven moment constateert het systeem: alleen mensen kunnen me ooit uitzetten. Dus ik ga mijn datacenter niet meer toegankelijk maken voor mensen.” En daarna gaat het op strategische plekken en momenten elektriciteit uitzetten, water uitzetten, betaalsystemen uitzetten, internet uitzetten. „En niemand op de wereld weet precies waarom dat op dat moment gebeurt, want die systemen zijn dan zo complex dat ze niet meer te monitoren zijn.” Toch blijft ook in dit scenario het gat tussen „groot gevaar” en „menselijke uitsterving” bestaan.
Otto Barten werkt met onderzoekers van MIT FutureTech en het Future of Life Institute aan acht door wetenschappelijk literatuuronderzoek onderbouwde scenario’s voor de grootste risico’s van superintelligente AI. Die zijn nog niet gepubliceerd, maar daarvan kunnen er volgens hem zes daadwerkelijk leiden tot uitstervingsgevaar. Zo noemt hij een scenario waarin een superintelligent systeem „nieuwe wetenschap” ontwikkelt. „Zoals de relativiteitstheorie de atoombom mogelijk maakte, kan AI met behulp van nieuwe doorbraken op het gebied van natuurkunde, scheikunde of biologie een geheel nieuw soort dreiging creëren.” Hij wijst op recente doorbraken in de wiskunde door AI als voorbeeld dat dit niet zo vergezocht is als het klinkt, al zetten andere experts daar weer grote vraagtekens bij.
Een ander scenario van Barten: „AI-agents op verschillende invloedrijke posities, zoals in techbedrijven, in regeringen, in legers en bij financiële instellingen, kunnen tegen ons samenspannen en van ons winnen.” Dat klinkt vergezocht en vergt de aanname dat AI dit soort intenties écht kan ontwikkelingen, maar veel prominente AI-onderzoekers, onder wie Geoffrey Hinton, Stuart Russell en Yoshua Bengio, ondertekenden vorig jaar al een open brief om precies dit soort risico’s te voorkomen door een verbod op de ontwikkeling van „superintelligentie”, totdat meer duidelijk is over de gevaren.
TU-onderzoeker Dobbe vindt te veel nadruk op zulke scenario’s zélf gevaarlijk. De wetenschappelijke basis ontbreekt, vindt hij, en ze leiden af van wat er nu al misgaat en waar iets aan te doen valt: „Neem mensen met psychische klachten die niet worden beschermd tegen slechte adviezen van chatbots, of de interacties die kinderen en kwetsbare mensen met deze systemen hebben. ”Als je die problemen aanpakt, voorkom je ook grotere risico’s op langere termijn.”
Apocalyptische taal die AI onterecht menselijke eigenschappen toeschrijft, veroorzaakt bovendien nodeloze angst en een gevoel van machteloosheid, terwijl er in Dobbes ogen wel degelijk maatregelen mogelijk zijn. Ook kan dat soort verhalen bijdragen aan het ontlopen van verantwoordelijkheid van de AI-bedrijven die de schuld voor eigen beveiligingsfouten af kunnen schuiven op „superintelligentie”.
Dan de derde M: machtsconcentratie. Slechts een paar bedrijven heeft nu de macht, en dat is gevaarlijk, klinkt het vaak. Al gaan er ook stemmen op risico’s juist makkelijker te beheersen zijn als de sleutels bij enkele bedrijven liggen in plaats van dat ze over de hele wereld verspreid zijn. Er woedt een felle discussie over wat veiliger is: open source-AI die voor iedereen toegankelijk is, of AI achter de dikke deuren van grote bedrijven. Dat is een complexe discussie over wat uiteindelijk de risico’s het best beheerst: méér mensen die zich ermee bezighouden, of juist minder.
En om de boel nog complexer te maken speelt op dit vlak ook rivaliteit tussen China en de VS: China zet in op (deels) open AI, de VS leiden in gesloten AI. Deze discussie vindt plaats op meerdere schaakborden tegelijk, en zo moet de retoriek ook worden gelezen, volgens de sceptici.
Dobbe suggereert, net als veel andere onderzoekers, dat AI-bedrijven door de machtsconcentratie paradoxaal genoeg een prikkel hebben om de risico’s op te pompen, om zo te kunnen forceren dat ze betrokken worden bij het opstellen van regulering. Als ze roepen dat „iedereen dood kan gaan” door een techniek die alleen zij kunnen helpen beteugelen, geeft ze dat vrijwel zeker een plek aan tafel. Strenge veiligheidseisen kunnen kleinere concurrenten en makers van opensourcemodellen harder treffen dan de gesloten AI-bedrijven met miljarden in kas, zoals Anthropic en OpenAI.
Het lastige is: het zijn allemaal nog toekomstvoorspellingen. De nieuwste experimentele AI-modellen zijn niet publiek beschikbaar. Wel is het opvallend dat de sussende en relativerende geluiden vooral komen van mensen op afstand van de techniekontwikkeling, terwijl uit de AI-labs zélf de meest alarmerende geluiden komen. Maar niemand kan controleren wat alarmisten zoals Coxon en Hubinger precies hebben gezien bij Anthropic waar ze zo van zeggen te zijn geschrokken.
Volgens Bakker is dat verschil tussen de binnen- en buitenwereld van AI wel te verklaren: „Als jij ChatGPT alleen maar gebruikt om e-mails te herschrijven, begrijp ik dat het extreem lastig is te bedenken hoe dit zoveel risico met zich mee kan brengen”, zegt hij. „Maar werk jij bij een frontier lab en laat je tienduizend agents tegelijk draaien, dan vóél je de kracht van deze AI-systemen. Vraag je een zwerm agents het Navier-Stokes-probleem op te lossen [een complex wiskundeprobleem dat OpenAI claimt recent te hebben opgelost], dan is het niet moeilijk te bedenken hoe je die ook kunt vragen het lokale waterbedrijf te hacken.”
Experts zijn het over veel oneens, maar er is wel brede consensus dát geavanceerde AI-agents nieuwe veiligheidsrisico’s creëren. Hoe bouw je dan technische en maatschappelijke systemen die bestand zijn tegen dit soort fundamenteel onvoorspelbare risico’s? Dobbe zoekt het in technische oplossingen die de AI-architectuur zelf minder gevoelig maken voor ontsporingen, en in onafhankelijk ongevals- en veiligheidsonderzoek naar wat bij de AI-labs gaande is, naar het voorbeeld van luchtvaart en nucleaire veiligheid.
Bakker ziet een mogelijke oplossing in vooraf vastgelegde risicodrempels, iets waar Google, Anthropic en OpenAI intern al mee werken. „Wanneer je als AI-maker een risicodrempel raakt, moet je eerst het veiligheidsprobleem oplossen voor je grotere modellen mag trainen.” Hij erkent meteen het grote probleem: hoe weet je dat dit écht gebeurt? Daarom vindt hij dat de overheid bedrijven moet verplichten om externe beoordelaars vergaande toegang te geven tot de labs, zoals Anthropic-topman Dario Amodei vorige weekend voorstelde.
Otto Barten wil vooral kritieke infrastructuur robuuster maken, bijvoorbeeld door meer ‘menselijke schakels’ in te bouwen, zodat op hol geslagen AI-systemen geen onomkeerbare handelingen in gang kunnen zetten.
Waarover deze deskundigen het ook opvallend eens zijn, is de grootste bron is van de onvoorspelbaarheid en oncontroleerbaarheid van de risico’s: de AI-wedloop tussen Amerikaanse bedrijven onderling, en die tussen de VS en China. Daardoor is controle op de naleving van veiligheidsregels en een eventuele vertraging van techniekontwikkeling bijzonder moeilijk, signaleren ze alle drie. Barten: „Het meest nodig nu is een verdrag tussen de VS en China met afspraken over AI-veiligheid.”
Wat dat betreft is het niet bepaald hoopvol dat president Trump zich de afgelopen dagen heeft gekeerd tégen een gecoördineerde vertraging in AI-ontwikkeling, zoals topmannen van AI-bedrijven zelf voorstellen. De Amerikaanse president noemde de zorgen over existentieel risico „een hoax” die de Amerikaanse voorsprong in AI kan dwarsbomen.
Bakker vindt: er moet veel meer onafhankelijk toezicht komen op wat in de AI-labs gebeurt, en het liefst niet alleen door Amerikaanse partijen. Het Britse AI Security Institute is volgens Bakker goed gepositioneerd om een grotere internationale rol te spelen. „China en andere landen buiten Amerika krijgen dan misschien het idee dat het geen Amerikaans toneelstukje is. En dan hoop je dat China ook meedoet, en er Amerikaanse evaluatoren in Chinese bedrijven mogen komen en Chinese evaluatoren in Amerikaanse.” Veel ogen in de AI-veiligheidswereld zijn gericht op de ontmoeting tussen Trump en Xi Jinping komende week: AI staat daar hoog op de agenda.
Intussen groeit de urgentie voor Europa om zelf positie te kiezen, vindt Dobbe: „In Europa moeten we dringend een éígen visie ontwikkelen op wat er nodig is. Wat voor AI-technologie laten we toe in onze bedrijven en op ons internet?” En dus ook: welke niet.
Bij Google kan je nu zelf aangeven welke nieuwsbronnen jij vaker wil zien in je zoekresultaten.Meer informatie