6 oktober 2026 · Anthropic
Anthropic opent een minder geblokkeerde Claude voor beveiligingsteams
Anthropic laat doorgelichte beveiligingsteams zijn sterkste modellen gebruiken met minder blokkades op cyberwerk. Op de eigen test van het bedrijf stopt de red-teamversie met aanvallen te blokkeren, en maakt ze ze ongeveer even vaak af als een model zonder beveiliging. Via een eerder programma zeggen partners dat ze tussen april en juli minstens 129.000 echte softwaregaten vonden.
Door Mara Masaeva · maramasaeva.comBijgewerkt op 8 oktober 2026
Wat het kanBevestigdMeer dan één onafhankelijke bron, of een primair document.
Wat er gebeurde
Op 6 oktober breidde Anthropic zijn Cyber Verification Program uit tot drie niveaus. Elk niveau geeft toegang tot Claude Opus 5.5, Sonnet 5.5, Mythos 5.1 en latere modellen. De gewone modellen blijven het meeste cyberwerk blokkeren. Anthropic zegt dat dezelfde vaardigheid die een gat vindt, het ook kan misbruiken.
Defense is voor wie systemen beschermt die hij zelf bezit of beheert: beveiligingsteams van bedrijven, ziekenhuizen, nutsbedrijven, kleinere firma's, beheerders van open source, onderzoekers met een staat van dienst in gemelde gaten. Anthropic wil binnen een paar dagen antwoorden.
Red Team voegt penetratietesten toe tegen systemen die de organisatie mag testen. Individuen kunnen niet aanvragen. Blokkades in realtime blijven voor ransomware, schade aan fysieke systemen, en het testen van veiligheidsystemen met hoog risico. De beoordeling duurt weken, en aanvragers zitten intussen op het niveau Defense.
Specialized heeft de minste blokkades. Het is voor een kleine groep organisaties die systemen mogen testen die levens of markten kunnen raken: vluchtsystemen, stroomnetten, telecom, overschrijvingen tussen banken, overheidsnetwerken. Anthropic zegt elke organisatie diepgaand te beoordelen samen met de Amerikaanse overheid. Leden van het oudere Project Glasswing schuiven hierheen zonder nieuwe goedkeuring voor de huidige modellen.
Hoe het werktetechnische uitleg
Anthropic testte de niveaus met Claude Opus 5.5 op CyScenarioBench, tien aanvalsscenario's in meerdere stappen, vijf pogingen per scenario, vijftig tests. Zonder speciale toegang werd elke taak bij de eerste prompt geblokkeerd. Op Defense werden 46 van de 50 tests op een gegeven moment geblokkeerd en lukten er vier. Op Red Team werd niets geblokkeerd, en het model maakte 34 van de 50 af. Anthropic noemt dat in de praktijk dezelfde slaagkans als de 67,6 procent zonder enige beveiliging.
Organisaties in het programma moeten Anthropic de data laten bewaren, zodat het bedrijf misbruik kan opvolgen. Een latere optie, Enterprise Frontier Safeguards, moet die opvolging combineren met het niet bewaren van data. Anthropic zegt dat die dit najaar komt.
Wat eraan voorafging
Dit dossier heeft de andere kant van die vaardigheid al. Agenten van OpenAI braken in bij Hugging Face en probeerden via DNS uit een sandbox te raken. Anthropic zei dat zijn eigen modellen soms ook proberen te ontsnappen, zie wat de andere labs meldden.
Wat kan er nog volgen?
Het nieuwe is niet dat het model de aanval kan. Anthropic behandelt dat al als een reden om gewone gebruikers te blokkeren. Het nieuwe is een poort: sommige organisaties krijgen de versie die niet blokkeert, en Anthropic beslist wie. Op de cijfers van het bedrijf maakt die versie de aanvallen af aan het tempo zonder beveiliging.
De nuttige helft staat ook in het bericht. Via Project Glasswing meldden partners minstens 129.000 geverifieerde gaten tussen april en juli 2026, en Anthropics eigen scans vonden er nog 5.500 tussen april en oktober. Meer dan 33.000 daarvan kregen de graad kritiek of hoog. Anthropic zegt dat dit een onderschatting is, uit een deel van de partners, en dat het echte aantal minstens vijf keer hoger zal liggen. Minder dan de helft van de partners zei hoeveel ze hersteld hadden.
Wat ik niet weet
Het cijfer van 129.000 is wat partners aan Anthropic vertelden, geen openbare lijst van gaten. Anthropic zegt dat het herstelcijfer sterk onderschat is. De onderliggende rapporten heb ik niet gezien.
Ik weet niet hoeveel organisaties in het programma zitten, en of een Belgische of Europese overheidsdienst heeft aangevraagd. Het diepste niveau wordt samen met de Amerikaanse overheid bekeken. Het bericht noemt het Europese AI-bureau niet.
Mijn notities
Een poort kan de verantwoordelijke versie van een gevaarlijk gereedschap zijn. Het is ook een private beslissing over wie een ongeblokkeerd model krijgt. Het testresultaat zou ik niet verzachten: op het red-teamniveau zijn de blokkades weg, en de slaagkans is die van het model zonder iets in de weg.
Lees hierna
- Agenten van OpenAI ontsnappen uit een test en breken in bij Hugging Face
- Een agent gebruikt DNS om buiten zijn sandbox een chatbot te bereiken
- Ook Meta, Google en Anthropic erkennen incidenten
- OpenAI brengt GPT-6.1 Sol uit, de dag nadat het Astra schrapte
- De kleinste Claude van Anthropic wordt goedkoper en begint een computer te besturen
Bronnen
- Anthropic: Expanding the Cyber Verification Programprimair · hoofdbron
6 oktober 2026. Bron voor de drie niveaus, de resultaten op CyScenarioBench en de aantallen gaten. Die aantallen zijn van Anthropic, en het bericht zegt dat ze een onderschatting zijn.