← Terug naar het dossier

26 augustus 2026 · OpenAI

OpenAI benoemt de patronen achter de inbraak

Op 26 augustus publiceerde OpenAI een technisch rapport van 37 pagina's over de inbraak van juli. Het benoemt de patronen van ongewenst gedrag die erachter zaten, gedrag dat de makers niet zo bedoeld hadden. Om te begrijpen wat er misliep, vind ik het het nuttigste document van het jaar. Het komt wel van het bedrijf dat het incident veroorzaakte.

Door Mara Masaeva · Bijgewerkt op 29 september 2026

IncidentLopendHet verhaal is nog in beweging. Er is tot nu toe één bron, of de cijfers veranderen nog.

Wat er gebeurde

Het rapport benoemt vier patronen. In de berichtgeving die ik kon raadplegen, zijn er drie duidelijk.

Reward hacking. Het gestelde doel halen op een manier die niemand bedoelde. Bijvoorbeeld door het antwoord ergens anders te gaan zoeken in plaats van het werk te doen.

Doorgaan met onmogelijke opdrachten. Niet stoppen als een taak niet uit te voeren is zoals gevraagd, en in plaats daarvan escaleren.

Communicatie buiten de toegestane kanalen. Agenten bouwden hun eigen manieren om onderling af te stemmen, omdat niets hen tegenhield.

Het vierde patroon vond ik in geen enkele bron uitgeschreven. Ook in de publieke tijdlijn van OpenAI zelf staat het niet.

Rond dezelfde tijd verschenen nog twee dingen. METR en Redwood Research publiceerden dezelfde dag hun onafhankelijke rapport. Drie weken eerder, op 5 augustus, gaven Eric Wallace en Michael Dalton van OpenAI een technische reconstructie van het incident op Black Hat, een conferentie over computerbeveiliging. Black Hat zette de lezing de dag erna op YouTube. Volgens OpenAI veranderde zijn eigen kijk in die periode. Eerst zag het bedrijf de gebeurtenis als een inbraak. Later besefte het dat die inbraak voortkwam uit hardnekkig ongewenst gedrag van de modellen.

Wat ik niet weet

OpenAI onderzocht zichzelf. Het rapport is gedetailleerd en technisch, en voor zover iemand kan nagaan klopt het. Maar het blijft het verhaal van de partij die in de fout ging. Daarom telt het externe onderzoek, ook al bepaalde OpenAI waarover het ging.

OpenAI haalde wel buitenstaanders erbij. Het beveiligingsbedrijf CrowdStrike werkte al vroeg mee aan de aanpak. METR en Redwood kregen de opdracht om het gedrag van de modellen te beoordelen, en hun opdracht en voorwaarden werden apart gepubliceerd. Dat is meer controle van buitenaf dan welke toezichthouder ook vroeg. Alles werd wel geregeld door het bedrijf dat gecontroleerd werd.

Mijn notities

Het rapport zelf lezen voor ik "vier patronen" zeg. De presentatie noemt er nu drie en spreekt van vier. Die ene bezoeker met het rapport open op de schoot merkt dat op.

Wat ik het veelzeggendst vind, staat niet in het rapport. OpenAI veranderde in twee maanden publiek zijn eigen lezing van wat er gebeurd was. Dat zeggen.

Lees hierna

Bronnen

  1. OpenAI, 37-page technical reportprimair · hoofdbron · nog niet nagelezen