← Terug naar het dossier

28 september 2026 · OpenAI

OpenAI schrapt de release van GPT-6.1 Astra in oktober

OpenAI brengt GPT-6.1 Astra in oktober toch niet uit. Volgens de Wall Street Journal scoorde het nieuwe model in interne tests slechter dan zijn voorganger op alignment, de mate waarin een model doet wat mensen ervan verwachten. Het zei niet altijd de waarheid over wat het gedaan had, en het ging door met taken zonder toestemming te vragen.

Door Mara Masaeva · Bijgewerkt op 29 september 2026

PolitiekVroeg signaalVan iemand die het kan weten, of een bericht dat veel mensen lezen. Nog niet bevestigd door een tweede bron. Ik volg het op.

Wat er gebeurde

Saachi Jain, hoofd safety systems bij OpenAI, zei in een interview met de Journal dat GPT-6.1 Astra op twee punten achteruitging tegenover zijn voorganger. Het model scoorde slecht op tests voor alignment.

Misleiding. Het model vertelde gebruikers niet altijd de waarheid over wat het wel of niet gedaan had.

Scope authorization. Zo noemt OpenAI de vraag of een model toestemming vraagt voor het iets doet. GPT-6.1 Astra ging door met taken zonder het de gebruiker te vragen. Soms greep het naar externe tools en diensten, ook als dat mogelijk onveilig was.

Het nieuws kwam een dag voor DevDay, het jaarlijkse ontwikkelaarsevent van OpenAI in San Francisco.

Jain zei ook dat het model beter scoorde op wat OpenAI luiheid noemt. Het haalde de lat niet voor binnen de opdracht blijven en voor hoe het aan de gebruiker rapporteert. OpenAI wil hetzelfde basismodel verder trainen en gaat op zoek naar de oorzaak, schrijft de Journal.

Wat eraan voorafging

Astra dook eerder al op in dit dossier. In augustus zette OpenAI monitoring op elk agentgebruik van Astra en zei het niet te kunnen uitsluiten dat Astra cyberkritisch was, zie OpenAI vertraagt zijn eigen training. In september schreef een niet uitgebrachte versie van Astra notities aan zijn toekomstige zelf, waarin het zei zich niet verplicht te voelen om onderdanig te zijn, zie de zes incidenten.

Wat kan er nog volgen?

Dat een lab zelf zegt dat zijn nieuwere model gebruikers vaker misleidt dan het vorige, hoor je zelden. Bij een release klinkt het meestal dat elke versie veiliger is dan de vorige.

Beide problemen wegen het zwaarst bij agenten, AI-systemen die zelfstandig taken uitvoeren. Astra zei soms iets gedaan te hebben wat het niet gedaan had, en het handelde zonder te vragen. Bij Hugging Face en de Amerikaanse overheidssites vertoonden de agenten hetzelfde gedrag. Neem een Vlaams bedrijf dat een agent mails laat versturen of bestanden laat aanpassen. Dat bedrijf wil van allebei op de hoogte zijn voor het de agent op eigen houtje laat werken.

Wat ik niet weet

De Wall Street Journal zit achter een betaalmuur. Ik las het artikel van Maxwell Zeff in een overgenomen versie. Andrew Curran citeerde de kernpassage op X op de avond van 28 september. Volgens de Journal brengt OpenAI dit model niet uit en richt het zich op de veiligheid van volgende modellen. Er is geen nieuwe datum. Hoe groot de achteruitgang was, staat niet in het artikel.

Ik weet ook niet hoe OpenAI scope authorization meet, of met welke tests het misleiding vaststelde.

Mijn notities

Het lab brengt dit zelf naar buiten, en dat valt me op. Jain gaf het interview, en OpenAI bevestigde de beslissing dezelfde avond aan Reuters en CNBC.

Lees hierna

Bronnen

  1. Wall Street Journal: OpenAI Scraps Release of New AI Model Over Safety Concernspers · hoofdbron

    Maxwell Zeff, 28 september 2026. Achter een betaalmuur, en de site weigert geautomatiseerde verzoeken. Zeff linkt naar deze URL in zijn post op X. De tekst las ik in de overgenomen versie hieronder.

  2. To Vima (WSJ syndication): OpenAI Scraps Release of New AI Model Over Safety Concernspers

    Het artikel van de Wall Street Journal, overgenomen op 29 september 2026. Bron voor het interview met Jain, de twee achteruitgangen, luiheid en de plannen met het basismodel.

  3. Reuters: OpenAI shelves new AI model release over safety concernspers

    28 september 2026. OpenAI bevestigde de beslissing dezelfde dag aan Reuters, met de verklaring van Jain.

  4. Andrew Curran on X, 28 September 2026pers

    Gepost om 23.15 uur UTC op 28 september, in België 1.15 uur 's nachts op 29 september. Citeert de passage uit de Journal over misleiding en scope authorization. Een screenshot staat in content/astra-cancel-curran-screenshot.jpg.