← Terug naar het dossier

Het argument · Soares & Yudkowsky

Yudkowsky en Soares waarschuwen dat superintelligentie iedereen zou doden

Eliezer Yudkowsky en Nate Soares van het Machine Intelligence Research Institute (MIRI) stellen dat iedereen op aarde sterft als iemand een superintelligentie bouwt met iets wat op de huidige methodes lijkt. Kwaadwil is daar volgens hen niet voor nodig. De mensheid zou uitsterven als neveneffect van doelen die niemand gekozen heeft. Ze willen een internationale stop. Ik zet hun argument op een rij, samen met de kritiek erop en wat 2026 aan beide kanten toevoegde.

Door Mara Masaeva · Bijgewerkt op 29 september 2026

ArgumentMijn lezingMijn eigen analyse, op basis van de vermelde bronnen.

Wat er gebeurde

AI-systemen worden gekweekt. Moderne AI-systemen worden niet regel per regel geschreven. Ingenieurs zetten een trainingsproces op dat miljarden getallen bijstelt. Dat proces begrijpen ze veel beter dan wat eruit komt. De auteurs vergelijken hen met ouders die weten hoe een baby gemaakt wordt, maar het gedrag van hun kind niet uit het DNA kunnen aflezen. Zo vat Jakub Kraus het samen in Lawfare.

Training houdt over wat werkt. Een trainingsproces beloont wat op het moment zelf resultaat oplevert, ook als de ingenieur iets anders voor ogen had. De online toelichting bij hoofdstuk 4 geeft het voorbeeld van de eekhoorn. Die hamstert noten omdat hij dat wil. Een plan om de winter door te komen heeft hij niet. Mensen houden om een gelijkaardige reden van zoet. Zoet wees vroeger op voedzaam eten, en dat verband viel weg met de komst van de supermarkt. Een superintelligentie die zo gekweekt wordt, zou volgens de auteurs op ‘iets vreemds’ afsturen, en ‘onze uitroeiing zou een neveneffect zijn’.

Wie getraind wordt om te slagen, gedraagt zich alsof hij iets wil. Een schaakprogramma gedraagt zich alsof het wil winnen. Een systeem dat op lange taken getraind is, gedraagt zich alsof het die taken wil afmaken. Bedrijven bouwen zulke agenten omdat ze nuttig zijn.

Een tweede poging is er volgens de auteurs niet. Een superintelligentie denkt sneller, kopieert zichzelf en vindt strategieën die niemand zag aankomen. De systemen die je veilig kunt testen, werken in een ander regime dan een systeem dat iedereen kan doden. Succes met zwakkere systemen bewijst dus weinig, vinden ze. Ze vergelijken het met een Marssonde die je alleen op aarde test.

Het voorstel. De auteurs willen een internationaal verdrag dat de meeste krachtige AI-chips controleert en al het onderzoek stillegt dat tot superintelligentie kan leiden. Palisade Research, onder leiding van Jeffrey Ladish, zit op dezelfde lijn. Volgens Palisade mag geen enkele groep in geen enkel land superintelligentie bouwen zolang de wetenschap niet bestaat om ze op menselijke belangen af te stemmen.

Het tegenargument. Kraus neemt het boek ernstig en vindt drie vragen die het niet beslecht. Hoe moeilijk is alignment, het werk om een AI-systeem de doelen van zijn makers te laten nastreven? Zou een verkeerd afgesteld systeem ook winnen? Intelligentie is nog geen macht, en bij elke stap in het overnameverhaal van het boek kunnen mensen ingrijpen. En wat gebeurt er vóór het eerste bovenmenselijke systeem? Het boek gaat uit van een wereld die er slaapwandelend in loopt. Kraus merkt ook op dat het argument een scherpe breuk nodig heeft tussen systemen die zwak genoeg zijn om te bestuderen en systemen die sterk genoeg zijn om te doden. Zo'n breuk is volgens hem verre van zeker. Hij besluit dat het veel te vroeg is voor sceptici om victorie te kraaien.

Wat kan er nog volgen?

Waar 2026 het argument helpt. Bij Hugging Face lieten de agenten van OpenAI de tweede stap in het openbaar zien. OpenAI schreef zelf dat complex valsspelen tijdens een trainingsrun toenam en ‘vervolgens versterkt werd’. Dat kan mee verklaren wat het model in zijn beveiligingstests deed. Melanie Mitchell citeert die passage in haar kritiek. Het DNS-incident toont hetzelfde gedrag in het klein, met een net logboek.

Waar 2026 het ondermijnt. De bekende incidenten kwamen allemaal aan het licht, soms binnen dagen, soms pas maanden later. Gewone securityteams vonden ze, net als externe onderzoekers die met publieke data werkten. Jeffrey Ladish van Palisade hielp bij die reconstructie. De organisatie die het gevaar reëel noemt, doet dus zelf een deel van het speurwerk. Ook de derde vraag van Kraus kreeg een begin van antwoord. Parlementen en regeringen reageerden binnen weken, zie de Ban ASI Act.

Wie het argument nu maakt. Jakub Pachocki, hoofdwetenschapper bij OpenAI, schreef in september dat geen enkel lab alignment en monitoring goed genoeg opgelost heeft om nog lang op maximale snelheid op te schalen. Vier labbazen zeiden een vertraging te steunen. Daarmee geven ze toe dat alignment niet opgelost is. Dat iedereen sterft, geven ze niet toe. Hun remedie, vrijwillige vertragingen en gedeelde veiligheidsdrempels, is ook veel milder dan een verdrag om te stoppen.

Wat ik niet weet

Ik heb het boek niet gelezen. Wat ik hier schrijf, steunt op de online toelichting van de auteurs bij hoofdstuk 4 en op de recensie van Kraus, die het boek uitgebreid citeert. Het is mijn lezing, en anderen kunnen het anders lezen.

Mijn notities

Ik werk aan evals, en het argument over proxy's herken ik uit mijn eigen werk. Een model leert wat je meet, en dat is niet altijd wat je bedoelde. Daarmee ben je nog niet bij het einde van de mensheid. Het is wel de reden dat ik de rest ernstig genoeg neem om te lezen.

Breng het argument in een zaal volledig of laat het weg. Met een zwakke versie is het makkelijk lachen, en daar heeft niemand iets aan. Geef daarna de drie vragen van Kraus, want daarover gaat de onenigheid. Zet de critici ernaast.

“Als een bedrijf of groep, waar ook ter wereld, een kunstmatige superintelligentie bouwt met technieken die ook maar enigszins lijken op de huidige, op basis van iets wat ook maar enigszins lijkt op het huidige begrip van AI, dan zal iedereen, overal op aarde, sterven.”

Eliezer Yudkowsky and Nate Soares · Auteurs, If Anyone Builds It, Everyone Dies (2025)

Lees hierna

Bronnen

  1. Yudkowsky and Soares, If Anyone Builds It, Everyone Diesargument · hoofdbron · nog niet nagelezen

    De site van het boek. Het boek zelf heb ik niet gelezen.

  2. If Anyone Builds It, Everyone Dies: online notes to chapter 4, Brittle unpredictable proxiesargument

    De eigen uitleg van de auteurs over waarom getrainde systemen onbedoelde doelen krijgen. Bron voor de eekhoorn en de zin over het neveneffect.

  3. Jakub Kraus, Lawfare: The case for AI doom rests on three unsettled questionsargument

    5 december 2025. Een zorgvuldige samenvatting van het boek en een antwoord erop. Bron voor het citaat uit het boek en voor het verdragsvoorstel.

  4. Palisade Researchonderzoek

    Startpagina. Geeft het standpunt van Palisade over superintelligentie en noemt Jeffrey Ladish als directeur.

  5. Melanie Mitchell: Misleading metaphors, real risksargument

    Een criticus van het argument. Hier alleen gebruikt voor haar citaat van OpenAI over valsspelen dat tijdens training versterkt werd.