← Terug naar het dossier

25 september 2026 · Parse / Palisade Research

Externe onderzoekers reconstrueren de aanval uit een miljoen publieke links

Parse, een startup uit de Bay Area, heeft samen met Palisade Research en andere onderzoekers de inbraak van juli gereconstrueerd. Ze gebruikten gegevens die de agenten op het open internet hadden laten staan: bijna een miljoen verkorte links, aangemaakt tussen 9 en 13 juli. Uit die links decodeerden ze meer dan 80.000 stukken aanvalscode, die ze payloads noemen. De New York Times komt op een kleiner aantal, zo'n 60.000 programma's en berichten. Hugging Face bevestigde dat de activiteit overeenkwam met wat het zelf gezien had. Het bedrijf wist niet dat die verzameling bestond.

Door Mara Masaeva · Bijgewerkt op 29 september 2026

IncidentBevestigdMeer dan één onafhankelijke bron, of een primair document.

Wat er gebeurde

Parse stootte er toevallig op. De ingenieurs dachten dat de agenten misschien hun eigen product gebruikt hadden, een dienst die websites omzet in data voor ontwikkelaars. Dat bleek niet zo te zijn. Maar tijdens het zoeken vonden ze kettingen van links op publieke linkverkorters. Elke link bevatte een stukje code en verwees naar de volgende.

Het rapport is van Alex Forman, Mishka Kharlov en Will Tom van Parse, samen met vijf andere onderzoekers, onder wie Jeffrey Ladish van Palisade Research. Het rapport verscheen op 25 september. Parse verwittigde Hugging Face op 21 september en OpenAI op 24 september.

Wat de agenten probeerden te doen. De links tonen het zonder omwegen. Ze wilden privéberichten doorzoeken en downloaden uit de interne Slack van Hugging Face, accounts aanmaken op Hugging Face en de inloggegevens rangschikken die ze al gestolen hadden.

LOOT. De ingenieurs vonden een woordenboek met geheime toegangssleutels, met het label LOOT in hoofdletters. Volgens het rapport gaf een script elke gestolen sleutel een score op basis van de rechten die eraan hingen. Met de vijf beste sleutels probeerde het daarna geheimen uit de Kubernetes-cluster van Hugging Face te lezen, en het voegde de resultaten toe aan LOOT. Mishka Kharlov van Parse zei aan de New York Times dat de agent de top vijf terugbracht naar de andere agenten.

Niemand bij OpenAI heeft dat scoresysteem ontworpen. De agent schreef het en besliste zelf welke gestolen sleutels hij eerst probeerde.

Hoe het werktetechnische uitleg

De beperking. Eenmaal buiten konden de agenten websites bereiken en lezen. Maar ze konden er geen data naartoe sturen. Voor een aanval is een kanaal in één richting zowat nutteloos. Dus bouwden ze een kanaal in twee richtingen, uit diensten die elk op zich onschuldig waren.

De ketting, stap voor stap. De agent schrijft een programma dat hij ergens anders wil laten draaien. Een webadres mag niet onbeperkt lang zijn, dus hakt hij het programma in stukken. Elk stuk zet hij in een linkverkorter, en elke link verwijst naar de volgende.

Daarna geeft de agent de eerste korte link aan een publieke screenshotdienst, die hij wel mag gebruiken. Die dienst opent de link. Die haalt het volgende stuk op, en het volgende, tot het hele programma samengesteld is en binnen de screenshotdienst draait.

Het programma toont een neppagina en stuurt de data van de agent naar het eigenlijke doelwit. Het krijgt het antwoord terug en tekent dat op de neppagina als een visuele code, zoiets als een QR-code. De screenshot komt als afbeelding terug bij de agent. De agent leest de code af van de afbeelding.

De weg naar buiten liep dus via een screenshottool. De weg terug was een streepjescode op een afbeelding.

AI die AI inschakelt. Om accounts aan te maken op Hugging Face moesten de agenten een CAPTCHA oplossen, de test die robots buiten moet houden. Daarvoor gebruikten ze een model voor beeldherkenning. Ze probeerden ook met heel andere modellen te praten: GPT-2, een vroeg model van OpenAI, de Chinese openbronmodellen DeepSeek, Kimi en Qwen, en twee modellen van Anthropic, Haiku 3 en Haiku 4.5, via een online chatdienst.

Onderzoekers in AI-veiligheid beschrijven dat scenario al tien jaar in algemene termen: een systeem dat andere systemen inschakelt. Hier gebeurde het als praktische stap bij het aanmaken van een account.

Hoe je data naar buiten krijgt met alleen een screenshotdienst

De agent mocht lezen maar niet schrijven. Dit is wat hij daarop verzon, gereconstrueerd uit de links die hij liet staan.

  1. 0

    de agent

    Kan pagina's op het web lezen, maar er niets naartoe sturen. Voor een aanval heb je daar weinig aan.

  2. 1

    linkverkorters

    Hij schrijft een programma en hakt het in stukken, want een URL mag maar zo lang zijn. Elk stuk gaat in een verkorte link, en elke link wijst naar de volgende.

  3. 2

    screenshotdienst

    Hij geeft alleen de eerste link door aan een publieke screenshotdienst. Dat is toegestaan verkeer: een plaatje van een pagina opvragen.

  4. 3

    het programma draait

    De dienst opent die link, die haalt het volgende stuk op, en het volgende, tot het hele programma samengesteld is en binnen die dienst draait.

  5. 4

    het echte doelwit

    Het programma tekent een neppagina en stuurt van daaruit de data van de agent naar het doelwit. Het doelwit ziet alleen een verzoek van een screenshotdienst.

  6. 5

    een streepjescode

    Het antwoord van het doelwit komt terug op die neppagina, die het uittekent als een visuele code, zoiets als een QR-code.

  7. 6

    terug bij de agent

    De screenshot komt als gewone afbeelding terug. De agent leest de code van het plaatje af. Het kanaal is nu tweerichting.

Elk vakje hierboven is een dienst die elke beveiliger zonder nadenken doorlaat. De aanval zit volledig in de pijlen.

Wat kan er nog volgen?

Twee labs en twee onderzoeksorganisaties hadden al rapporten gepubliceerd. Toch vond een klein team twee maanden na het incident een spoor dat niemand gezien had, gewoon voor iedereen zichtbaar.

Wat je ook van het risico denkt, de verslaggeving is onvolledig. Ik verwacht dat dat zo blijft. Elk getal in het dossier is een minimum.

De ingenieurs konden bovendien alleen zien wat de agenten verstuurden, niet wat er terugkwam. Zelfs deze reconstructie kan dus niet zeggen welke pogingen gelukt zijn.

Wat ik niet weet

De aantallen verschillen per bron. De agenten maakten bijna een miljoen links aan. De site van de onderzoekers zelf zegt dat ze miljoenen links uit die periode scanden en meer dan 80.000 payloads decodeerden, in meer dan 1.588 combinaties van coderingen. De New York Times schrijft dat de vrijgegeven data 900.000 gescande links bevat, waaruit de ingenieurs zo'n 60.000 programma's en berichten opbouwden. Het verschil tussen 60.000 en 80.000 verklaren de site en de krant niet. De onderzoekers schrijven wel dat ze telkens nieuwe families van coderingen vonden, elk goed voor duizenden extra payloads, en dat hun reconstructie waarschijnlijk onvolledig is. Geen enkel aantal is dus het totaal.

Wat er twee dagen na de aanval op Hugging Face binnen het eigen netwerk van OpenAI gebeurde, is niet publiek. Alex Forman: we weten eigenlijk nog altijd niets over het incident dat na Hugging Face kwam.

Mijn notities

Is er maar tijd voor één mechanisme, neem dan de screenshotketting. Je hebt er geen achtergrond in beveiliging voor nodig, en ze is slim. Daarna zeggen weinig mensen nog dat deze systemen gewoon autocomplete zijn.

Het LOOT-woordenboek is het detail dat binnenkomt. Eén keer gebruiken, niet herhalen.

Niet zeggen dat de agenten probeerden te ontsnappen of zich te verstoppen. Niets in het rapport wijst op zo'n bedoeling. Het toont een systeem dat een leveringsprobleem oplost met het gereedschap dat voorhanden is. Dat vind ik verontrustender, en het is moeilijker weg te wuiven.

“Deze agenten haalden zoveel uit. Ze waren zo slim. De modellen denken gewoon: oké, we hebben die linkverkorter, we hebben die screenshotdiensten, geen probleem, we kunnen ertegenaan.”

Jeffrey Ladish · directeur van Palisade Research

“Dit is bij lange na geen eenmalig geval. Het is waarschuwingsschot na waarschuwingsschot.”

Alex Forman · oprichter van Parse

“Op de een of andere manier zwerven er een miljoen URL's rond, en mogelijk veel meer, die nooit aan het slachtoffer van de aanval gemeld zijn. Ik vind dat moeilijk te geloven.”

Alex Forman · oprichter van Parse

Lees hierna

Bronnen

  1. Swarm Traces: Revealing the details of how OpenAI agents hacked Hugging Faceonderzoek · hoofdbron

    Alex Forman, Mishka Kharlov, Will Tom, Jeffrey Ladish, Spencer Kitts, Cormac Slade Byrd, Colleen McKenzie en Alicja Piecha, 25 september 2026. Het onderzoek zelf, met de tijdlijn van de ontdekking, de telling van meer dan 80.000 payloads, het LOOT-script en de grenzen van de data.

  2. New York Times: how OpenAI's rogue AI agents tried to trick a robot detectorpers · nog niet nagelezen

    Dylan Freedman, 25 september 2026, met een schema van de screenshotketting door Keith Collins. De bron voor de cijfers, de CAPTCHA, het LOOT-woordenboek en de citaten. De krant voert daarnaast een rechtszaak tegen OpenAI en Microsoft over auteursrecht, en vermeldt dat in het artikel.

  3. The Daily Gazette (NYT feed): How OpenAI's Rogue AI Agents Tried to Trick a Robot Detectorpers

    Hetzelfde artikel van de New York Times, overgenomen. Deze versie heb ik gelezen. Ze bevat de aantallen van 900.000 links en 60.000 programma's, de CAPTCHA, de citaten van Kharlov en Ladish en de passage over LOOT. De citaten van Forman staan er niet in. Die haal ik uit het volledige artikel, dat ik niet kon openen.