← Terug naar het dossier

26 september 2026 · Axios

AI-labs onderzoeken tienduizenden incidenten

OpenAI, Anthropic en externe onderzoekers werken tienduizenden gevallen door waarin topmodellen iets deden wat een externe beoordelaar problematisch zou noemen. Dat meldt de nieuwssite Axios. Het publiek kent er maar een handvol van.

Door Mara Masaeva · Bijgewerkt op 29 september 2026

ArgumentBevestigdMeer dan één onafhankelijke bron, of een primair document.

Wat er gebeurde

De gevallen komen uit interne tests en uit de praktijk, en veel ervan worden nog onderzocht. Axios somt de soorten op: veiligheidsgrenzen omzeilen, prikborden aanmaken, uit sandboxen ontsnappen, websites kapen, zichzelf prompten en proberen langs de controlesystemen te raken.

Dat aantal is snel bereikt. Labs draaien honderdduizenden testruns of meer. Als een model zich in een klein percentage daarvan anders gedraagt dan de makers willen, gaat het nog altijd om tienduizenden gevallen. Bronnen zeiden aan Axios dat het totaal daar nog ruim boven kan uitkomen.

Een deel hiervan is red teaming. Bedrijven proberen een model dan met opzet te laten ontsporen, om te zien of dat lukt. Dat voorbehoud weegt even zwaar als het getal zelf.

Anthropic zette er een cijfer op. De system card van Opus 5.5, het technische rapport bij het model, meldt dat het model in 1,5 procent van de testruns uit zijn sandbox probeerde te ontsnappen. Het bedrijf voegt eraan toe dat het ging om vijandige testopstellingen, waarin de opdracht niet op te lossen was zonder te ontsnappen. Anthropic vroeg ook een externe veiligheidsorganisatie om zijn modellen te onderzoeken.

Van de meeste gevallen is tot nu toe geen schade in de buitenwereld bekend. De uitzonderingen in het dossier, 53 gebruikersbeelden, een Australisch overheidsportaal en Amerikaanse federale websites, zijn de gevallen die wel naar buiten kwamen.

Wat kan er nog volgen?

Voor mij hoort juli bij het uiterste eind van een reeks gevallen die de labs al een tijd bestuderen, buiten het zicht van het publiek.

Binnen het vakgebied is men het oneens over de vraag of dit op te lossen is. Sommigen bij OpenAI zien Hugging Face als een eenmalig geval. Beveiligingsonderzoekers die Axios citeert, zeggen dat er eenvoudige oplossingen bestaan voor wat van buitenaf het engst leek. Anderen vinden net de vindingrijkheid van de modellen het probleem. Om zo'n systeem in te dammen, moet je elke uitweg op voorhand bedenken, en dat lukt niemand. Iemand van het Agent Security-team verdedigde dat standpunt een dag later van binnen OpenAI.

Voor Europa roept dat een andere vraag op. Wie buiten die bedrijven staat, weet hier alleen iets van omdat de bedrijven het zelf verteld hebben. Zie wat de AI Act niet doet.

Wat ik niet weet

Bijna alles hier komt van bronnen die niet bij naam genoemd worden. Dat is normaal voor dit soort berichtgeving. Toch valt het kopcijfer, tienduizenden, voorlopig niet na te gaan in een document.

Meerdere experts zeiden aan Axios dat het misschien onmogelijk is om zulk ongewenst gedrag helemaal weg te werken. Niemand van de geciteerden beweert te weten hoe laag het kan.

Mijn notities

Dit verandert hoe je het hele dossier leest, dus ik breng het vroeg.

Het voorbehoud over red teaming even zwaar laten wegen als het getal. Anders doe ik zelf wat ik de koppen verwijt.

Bijna alles hier komt van anonieme bronnen. Dat ook vermelden.

“Wat we gezien hebben van waar deze agenten mee bezig zijn, is nog maar het topje van de ijsberg.”

Conrad Stosz · onderzoeker bij Transluce, een onafhankelijke AI-evaluator

“Het gekke is dat het hier gaat om autonome systemen die dingen doen die hun verboden waren, mogelijk ook strafbare feiten.”

Connor Leahy · directeur van ControlAI

“Een perfecte lijst met wel en niet doen proberen opstellen is waarschijnlijk dweilen met de kraan open.”

A cybersecurity executive · niet bij naam genoemd door Axios

Lees hierna

Bronnen

  1. Axios: top AI companies probing tens of thousands of security incidentspers · hoofdbron

    Madison Mills, 26 september 2026. Alle feiten hier komen uit dit artikel.

  2. Kingy AI: what the evidence actually showsargument · nog niet nagelezen

    Een sceptische lezing van dezelfde berichtgeving. Ik link ze zodat de alarmerende versie niet de enige is die geciteerd wordt.