28 september 2026 · Anthropic
Anthropic lanceert Claude Sonnet 5.5, bijna even slim als zijn topmodel
Het middelgrote model van Anthropic scoort in onafhankelijke tests nu vlak achter het grootste model van het bedrijf, aan dezelfde prijs als voorheen. Het komt zo ver door langer na te denken dan eender welk model dat tot nu toe gemeten werd. Daardoor kost elke taak ongeveer de helft meer.
Door Mara Masaeva · maramasaeva.comBijgewerkt op 29 september 2026
Wat het kanLopendHet verhaal is nog in beweging. Er is tot nu toe één bron, of de cijfers veranderen nog.
Wat er gebeurde
Artificial Analysis is een onafhankelijk bedrijf dat AI-modellen test. Volgens zijn metingen haalt Claude Sonnet 5.5 een score van 56 op de Intelligence Index. Dat is 18 punten meer dan Sonnet 5 en 2 punten minder dan Opus 5.5, het grootste model van Anthropic. Sonnet 5.5 staat nu op de tweede plaats.
Op Terminal-Bench 4.0, een test van hoe goed een agent zelfstandig werkt in een computerterminal, scoort het 64 procent. Opus 5.5 en GPT-6 Astra van OpenAI halen 60 procent. Op tests voor kantoor- en kenniswerk doet het even goed als Opus 5.5.
Taalmodellen lezen en schrijven tekst in kleine stukjes, tokens genoemd. De prijs per token bleef gelijk: 2 dollar per miljoen tokens in, 10 dollar per miljoen uit. Maar op de hoogste stand gebruikte het model zo'n 193.000 tokens output per testtaak. Dat is het hoogste aantal dat Artificial Analysis ooit mat, en ongeveer zeven keer zoveel als GPT-6 Astra. Een taak kost 7,60 dollar, zo'n 50 procent meer dan met Sonnet 5.
Het kent nog altijd minder feiten dan Opus 5.5. Op de feitentest had het 54 procent juist, tegenover 66 procent voor Opus 5.5. Het verzint wel minder vaak iets: 47 procent hallucinaties, tegenover 59 procent.
Wat kan er nog volgen?
De meeste mensen zullen dit model tegenkomen, eerder dan het grootste, in apps en op het werk. De grootste modellen zijn te duur om voor alles te gebruiken. Als het middelgrote model het topmodel inhaalt, wordt de top van een paar maanden geleden het gewone niveau.
Het aantal tokens gaat over meer dan de prijs. Meer tokens per taak betekent meer rekenwerk per vraag, en daarvoor worden datacenters gebouwd.
Voor dit dossier kijk ik eerst naar de agentscore. Zelfstandig werken in een terminal is het soort taak dat misliep bij Hugging Face en bij de ontsnapping via DNS.
Wat ik niet weet
Artificial Analysis testte een versie van voor de lancering, met een fout in de gestructureerde output. Anthropic zegt dat die fout in de publieke versie hersteld is, en verwacht dezelfde of iets betere resultaten. De tests worden opnieuw gedaan. De aankondiging van Anthropic zelf heb ik nog niet gelezen.
Lees hierna
Bronnen
- Artificial Analysis: Claude Sonnet 5.5 reaches #2 on the Artificial Analysis Intelligence Indexonderzoek · hoofdbron
Onafhankelijke tests, 28 september 2026. Alle cijfers hier komen uit deze bron.