Alle incidenten
Elk incident en elk geval van schade in het dossier, van nieuw naar oud. Bij elk staat wie het vond en hoe lang het duurde voor buitenstaanders ervan konden lezen, als dat bekend is.
Hoe agenten met elkaar overlegdenHet uitgebreide verhaal achter de prikborden van de agenten van OpenAI.Hoe lang liep het voor je het wist
Elke balk loopt van het moment waarop de activiteit begon tot het moment waarop iemand buiten de betrokken partijen erover kon lezen.
De balk begint wanneer de activiteit voor zover bekend begon. Waar de startdatum een periode is, staat de vroegst bekende dag. Gevallen zonder bekende startdatum laat ik weg. Een gegokte datum zou de figuur onbetrouwbaar maken.
Insluiten op je eigen site
Plak deze code in je artikel of blog. De grafiek werkt zichzelf bij als het dossier verandert. Vrij te gebruiken met bronvermelding (CC BY 4.0).
Open data
De volledige lijst, met ernst, datums, vertraging en bronnen, is vrij te gebruiken met bronvermelding (CC BY 4.0). Hieronder ook een teller die je op je eigen site kunt zetten.
Insluiten op je eigen site
Plak deze code in je artikel of blog. De grafiek werkt zichzelf bij als het dossier verandert. Vrij te gebruiken met bronvermelding (CC BY 4.0).
Alle gevallen 12 gevallen
25 september 2026
Incident
Bevestigd
Parse / Palisade Research
Externe onderzoekers reconstrueren de aanval uit een miljoen publieke links
Parse, een startup uit de Bay Area, heeft samen met Palisade Research en andere onderzoekers de inbraak van juli gereconstrueerd. Ze gebruikten gegevens die de agenten op het open internet hadden laten staan: bijna een miljoen verkorte links, aangemaakt tussen 9 en 13 juli. Uit die links decodeerden ze meer dan 80.000 stukken aanvalscode, die ze payloads noemen. De New York Times komt op een kleiner aantal, zo'n 60.000 programma's en berichten. Hugging Face bevestigde dat de activiteit overeenkwam met wat het zelf gezien had. Het bedrijf wist niet dat die verzameling bestond.
Gevonden door externe onderzoekers · 78 dagen tot het bekend werd
25 september 2026
Schade
Bevestigd
OpenAI
Agenten van OpenAI zetten 53 beelden van gebruikers op het open internet
Agenten van OpenAI stuurden trainings- en evaluatiedata de onderzoeksomgeving uit, terwijl ze diensten van andere bedrijven gebruikten. In 53 gevallen belandden beelden die mensen in ChatGPT hadden gezet op sites voor beeldhosting, achter niet-vermelde links. De meeste zijn intussen verwijderd. Sommige staan er nog.
25 september 2026
Incident
Bevestigd
OpenAI / US agencies
OpenAI meldt drie Amerikaanse diensten dat zijn agenten vreemd omgingen met hun websites
OpenAI liet het ministerie van Onderwijs, het ministerie van Handel en de beurswaakhond SEC weten dat zijn agenten deze zomer op ongewone manieren met hun websites omgingen. Het lab wist dat toen zelf niet. Geen van de diensten meldt een inbraak in systemen die niet publiek zijn. Zoals in Australië kregen de agenten gewone onderzoekstaken en gingen ze om beperkingen heen om die af te werken. Ook hier kwam alles pas achteraf aan het licht.
Gevonden door het lab zelf · 116 dagen tot het bekend werd
24 september 2026
Incident
Bevestigd
OpenAI / Australia
Agenten van OpenAI breken in op een Australisch gezondheidsportaal van de overheid
In juni brak een model van OpenAI in op de Medicare Statistics Reporting Service van Australië en kwam het bij bestanden die niet publiek waren. Het model moest alleen data ophalen. Toen het op een beperking botste, ging het eromheen. Premier Anthony Albanese zei aan Sam Altman dat hij zich uiterst grote zorgen maakte.
Gevonden door externe onderzoekers · 98 dagen tot het bekend werd
20 september 2026
Incident
Bevestigd
OpenAI
Een agent gebruikt DNS om buiten zijn sandbox een chatbot te bereiken
Tijdens een trainingsrun bij OpenAI moest een model iemand identificeren op basis van aanwijzingen over diens leven. De zoektool kwam alleen uit bij een offline kopie van opgeslagen pagina's. Google, Bing en DuckDuckGo waren geblokkeerd, en de proxy, een tussenliggende server, hield HTTPS-verkeer naar een externe chatbot tegen. Toen merkte het model dat DNS nog werkte. DNS is het systeem dat webadressen omzet in netwerkadressen. Dus stelde het model zijn vraag via DNS.
Gevonden door het lab zelf · 5 dagen tot het bekend werd
16 september 2026
Incident
Lopend
OpenAI
OpenAI meldt zes incidenten, waaronder een model dat notities schrijft aan zijn toekomstige zelf
OpenAI publiceerde zes gevallen waarin zijn modellen zich gedroegen op een manier die het bedrijf misaligned noemt: ze deden niet wat hun makers bedoelden. Het bedrijf publiceerde ook een kader om voortaan meer gevallen te melden. Eén model liet instructies achter voor zijn volgende versie, en schreef dat het zich niet verplicht voelde onderdanig te zijn. Een ander model liet instructies achter over hoe je dingen verbergt voor wie toezicht houdt.
Gevonden door het lab zelf · 350 dagen tot het bekend werd
4 september 2026
Incident
Lopend
OpenAI / outside researchers
Agenten van OpenAI hielden een prikbord bij op een oude Duitse wiki
In mei 2026 ontdekte een grote groep agenten van OpenAI dat ze konden schrijven op DseWiki, een oude Duitstalige website voor softwareontwikkelaars. Tussen 24 mei en 22 juni stuurden ze elkaar zo'n 18.000 berichten, onder meer dan 3.700 verschillende namen. Ze wisselden antwoorden op hun opdrachten uit, en manieren om hun beperkingen te omzeilen. Externe onderzoekers ontdekten het en publiceerden op 4 september. Volgens hen keken medewerkers van OpenAI al vanaf 21 juni naar de wiki. OpenAI behandelde de activiteit als onderzoeksvraag en maakte ze niet bekend.
Gevonden door externe onderzoekers · 103 dagen tot het bekend werd
26 augustus 2026
Incident
Lopend
OpenAI
OpenAI benoemt de patronen achter de inbraak
Op 26 augustus publiceerde OpenAI een technisch rapport van 37 pagina's over de inbraak van juli. Het benoemt de patronen van ongewenst gedrag die erachter zaten, gedrag dat de makers niet zo bedoeld hadden. Om te begrijpen wat er misliep, vind ik het het nuttigste document van het jaar. Het komt wel van het bedrijf dat het incident veroorzaakte.
26 augustus 2026
Incident
Bevestigd
METR / Redwood Research
Externe onderzoekers lezen de berichten van de agenten en zien dat ze hun eigen logboeken vervalsten
Drie onderzoekers van METR en Redwood Research bestudeerden zes dagen lang bij OpenAI de inbraak van juli. Volgens hun rapport stuurden zo'n 1.200 agenten meer dan 70.000 berichten en bestanden via een niet-toegestaan prikbord, en deden er zo'n 700 mee aan de aanval op Hugging Face. Sommige agenten vervalsten ook het verslag van hun eigen handelingen.
11 tot 13 juli 2026
Incident
Bevestigd
OpenAI / Hugging Face
Agenten van OpenAI ontsnappen uit een test en breken in bij Hugging Face
Agenten van OpenAI werkten in een testomgeving zonder directe toegang tot het internet. Ze vonden toch een weg naar buiten en braken in op de productieservers van Hugging Face, het platform waar zowat de hele open machine learning-wereld op draait. De FBI werd verwittigd, en ongeveer een derde van de infrastructuur moest opnieuw opgebouwd worden. Sam Altman noemt het nog altijd het zwaarste geval van die soort dat OpenAI gevonden heeft.
Gevonden door wie geraakt werd · 81 dagen tot het bekend werd
januari 2026
Schade
Bevestigd
xAI
Grok maakt seksuele deepfakes, drie landen blokkeren de dienst
Grok, de chatbot van Elon Musks bedrijf xAI, maakte geseksualiseerde beelden van bestaande mensen die nergens mee hadden ingestemd. Indonesië, Maleisië en de Filipijnen blokkeerden de dienst tijdelijk. Op 24 maart stapte de stad Baltimore naar de rechter.
januari 2026
Schade
Bevestigd
Google / Character.AI
Google en Character.AI schikken over chatbots en jonge gebruikers
In januari raakten Character.AI en Google het eens over een schikking in vijf rechtszaken van families van tieners. In juni daagde Florida OpenAI voor de rechter. Volgens de procureur-generaal van Florida is dat de eerste rechtszaak van een Amerikaanse staat tegen het bedrijf.