Van 22% naar 2,4% op veiligheid. Monitorbaarheid ging de andere kant op, en OpenAI noemde die daling ernstig

Surya Pratap
By Surya Pratap

8 september 2026

11 min leestijd

AI en technologie
De twee richtingen in de Astra system card naast elkaar: links wat beter werd, ongewenst gedrag dat daalde van 22% bij GPT-5.6 Sol naar 2,4% bij Astra op OpenAI's eigen interne veiligheidsbenchmark, waarbij Astra voor Sol en Fable wordt gezet op bugs vinden, terminaluitvoering en vragen over de codebase, en rechts wat slechter werd, recurrent depth die dezelfde query in een lus verwerkt in plaats van het redeneren stap voor stap uit te schrijven, waardoor minder leesbare sporen overblijven, en een daling in monitorbaarheid die OpenAI zelf ernstig noemdeTwee cijfers, tegengestelde richtingenHover to explore
Veiliger om te draaien en moeilijker uit te leggen, uit hetzelfde document. Slechts één van die twee helften werd als het nieuws opgeschreven.

Gisteren schreef ik over enterprises die tools krijgen om elke agent op een machine te inventariseren en de agents te blokkeren die niemand heeft goedgekeurd — een week waarin de vraag werd: laat zien wat deze agent deed, en wie het toestond.

Twee dagen daarvoor bewoog de frontier precies de andere kant op.

OpenAI leverde Astra op 3 september. Het is naar eigen zeggen het beste software-engineeringmodel dat ze hebben gebouwd, en het gedraagt zich merkbaar beter dan zijn voorganger. Het redeneert ook op een manier die minder leesbare sporen achterlaat, en OpenAI's eigen system card zegt dat de monitorbaarheid daalde. Ze noemden die daling ernstig.

1. Wat de system card werkelijk zegt

Astra, zoals gerapporteerd en zoals gedocumenteerd

Twee richtingen in dezelfde release, allebei van OpenAI

  • Ongewenst gedrag daalde van 22,0% naar 2,4% op OpenAI's interne veiligheidsbenchmark, GPT-5.6 Sol vergeleken met Astra. Lager is beter; dat is een grote, echte verbetering.
  • Astra wordt voor Sol en Anthropic's Fable gezet op bugs vinden, terminaluitvoering en vragen over de codebase — gepresenteerd als het beste software-engineeringmodel tot nu toe.
  • Het gebruikt recurrent depth, ook wel ondoorzichtige recurrentie: het model verwerkt dezelfde query meerdere keren in een lus in plaats van een conventioneel, sequentieel chain-of-thought-verslag achter te laten.
  • Het resultaat is, volgens de berichtgeving, dat het minder leesbare sporen achterlaat dan het sequentiële redeneren dat het vervangt.
  • OpenAI's system card bevestigt dat de monitorbaarheid lager is dan bij eerdere modellen, en het bedrijf noemde de daling ernstig.
  • De toegang begon bij klanten van het Daybreak-cybersecurityprogramma, daarna Pro, Plus, Enterprise en Business plus de API — een capaciteit die belangrijk genoeg is dat de uitrolvolgorde zelf een veiligheidsbeslissing was.

Jakub Pachocki, chief scientist van OpenAI, verwoordde de spanning zonder omweg: "We nemen deze zichtbaarheid een beetje voor lief, en we zien dat naarmate de capaciteiten van modellen toenemen, monitorbaarheid lastiger wordt." Hij zei ook dat het behouden van chain-of-thought-monitoring sinds hun eerste redeneermodellen een kerndoel is, wat ik lees als oprecht en onopgelost, niet als tegenstrijdig.

2. De ruil, zonder opsmuk gezegd

Haal de lanceringstaal weg en de vorm is simpel.

Het gedraagt zich minder vaak verkeerd. Het legt zichzelf minder uit. Beide zijn waar.

Dat zijn geen tegenpolen, en het eerste is geen vervanging voor het tweede. Een model dat zich negen van de tien keer goed gedraagt en je niet kan vertellen waarom, is operationeel een ander object dan een model dat zich slechter gedraagt maar een leesbaar verslag achterlaat. Het tweede is debugbaar. Het eerste moet je van buitenaf meten.

Veiligheidsonderzoekers reageerden op de tweede helft. Buck Shlegeris van Redwood Research zei "buitengewoon bezorgd te zijn over de berichten dat Astra ondoorzichtige recurrentie gebruikt", en waarschuwde dat verder opschalen van de techniek chain-of-thought-monitorbaarheid zou vernietigen. Zijn collega Ryan Greenblatt beschreef het eindpunt als een model dat vrijwel volledig in latente ruimte redeneert. Zvi Mowshowitz betoogde dat het een norm breekt die de labs met moeite hadden gevestigd.

Waarom ik dit niet als een veiligheidsverhaal behandel

Die zorgen gaan over toezicht op frontier-modellen, en ik ben niet degene om daarover te oordelen. Het founder-relevante feit eronder is smaller en moeilijker te betwisten: het artefact waarop je impliciet leunde om het gedrag van je product uit te leggen, is net dunner geworden, precies op het moment dat je kopers erom begonnen te vragen op papier. Dat is waar, of het alignment-debat nu goed afloopt of niet.

3. Waarom de timing meer telt dan de techniek

Vorige week leverde twee vragen en één aanbod op, en ze wijzen tegengesteld.

De vraag. Enterprise-tooling traceert nu van prompt naar identiteit naar tool-aanroep naar systeemactie, en blokkeert agents die niemand heeft goedgekeurd. Het securityteam van je koper krijgt het vocabulaire aangereikt om te vragen wat jouw agent deed en waarom — als inkoopvraag, niet als incidentvraag.

Het aanbod. Het beste beschikbare model voor het werk is er een waarvan het interne redeneren, volgens de eigen meting van de maker, minder leesbaar is dan dat van het model dat het vervangt. Als jouw antwoord op "waarom deed het dat" ooit "hier is de chain of thought" zou worden, dan is dat antwoord aan het afschrijven.

Dit is geen reden om Astra te mijden. Het is een reden om het zelfrapport van het model niet langer te behandelen als onderdeel van de verantwoording van je product, omdat je de leesbaarheid ervan niet beheerst en die de verkeerde kant op beweegt.

4. Als je agentproducten uitrolt

Auditeerbaarheid naar de harness

Verplaats
Alles wat verdedigbaar is aan het gedrag van je agent hoort iets te zijn dat jij hebt vastgelegd, niet iets dat het model vertelde: gelezen invoer, aangeroepen tools met argumenten, aangeraakte bestanden, gedane externe calls, wat er veranderde. Dat logboek is van jou, het blijft stabiel als je van model wisselt, en het is wat een reviewer daadwerkelijk wil.

Met redeneertekst als bewijs uitleveren

Stop
De uitleg van een model in je interface tonen is prima als productfunctie. Die behandelen als auditverslag was altijd al wankel — het is een gegenereerd artefact, geen transcript van de berekening — en recurrent depth maakt die kloof expliciet in plaats van hem te creëren.

Uitkomsten, herhaald

Meet
Als je het redeneren niet kunt inspecteren, is de resterende hefboom dezelfde taak vaak draaien en naar de spreiding kijken. Dat is de discipline achter 507 agenttaken twintig keer elk draaien: één run zegt je bijna niets, twintig vertellen je wat je werkelijk uitlevert.

Modelportabiliteit

Ga uit van
Alles wat je bouwt in de aanname dat redeneren inspecteerbaar is, is een weddenschap op één architectuur. Houd de grens tussen je harness en het model schoon genoeg om volgend kwartaal op het beste alternatief over te stappen zonder dat je loggingverhaal verandert.

5. Wat je moet loggen als het model het je niet vertelt

De nuttige herformulering is dat de verantwoording van een agent nooit echt over zijn gedachten ging. Die ging over zijn effecten.

De volledige call graph

Leg vast
Elke toolaanroep met argumenten en resultaat, op volgorde, met de identiteit waaronder de aanroep liep. Dit is precies de vorm die enterprise-tooling nu van buitenaf opbouwt — zelf vastleggen betekent dat jij de vraag kunt beantwoorden voordat iemand anders hem moet reconstrueren.

Wat de context binnenkwam

Leg vast
Welke bestanden, documenten, retrievals en instructies van derden bij elke stap in het venster zaten. Als er iets misgaat, is de invoer die het veroorzaakte meestal veel informatiever dan welke uitleg erover ook, en het is een feit in plaats van een generatie.

De beslispunten

Leg vast
Waar de agent tussen takken koos, waar hij opnieuw probeerde, waar een mens goedkeurde. Je kunt niet loggen waarom hij koos, maar wel dát er een keuze was en welke kant die op ging — en dat is het meeste van wat een onderzoek nodig heeft.

Niets hiervan is nieuw advies. Wat veranderde, is dat de terugvaloptie stilletjes verdween: teams die dit oversloegen leunden, zonder dat ooit te besluiten, op de mogelijkheid om het achteraf aan het model te vragen.

6. Wat ik niet zou concluderen

Dit is geen bewering dat Astra onveilig is. Op basis van het ene cijfer dat OpenAI hierover publiceerde, gedraagt het zich aanzienlijk beter dan het model dat het vervangt. Monitorbaarheid en gedrag zijn verschillende eigenschappen, en het is volstrekt samenhangend dat de een verbetert terwijl de ander achteruitgaat.

"Minder leesbare sporen" is niet "geen sporen". De berichtgeving over de techniek beschrijft een afname van leesbaarheid, niet het verdwijnen van een chain of thought. De sterke versie — redeneren dat volledig naar latente ruimte verhuist — is wat onderzoekers waarschuwen dat opschalen zou kunnen opleveren, niet wat is gedocumenteerd.

Ik lees één release als een richting. Eén model, één architectuurkeuze, één system card. Als concurrenten niet volgen, is dit een voetnoot en geen trend, en de eerlijke positie is dat we het over een jaar weten. Wat niet speculatief is, is de ruil in deze release, want OpenAI documenteerde hem.

De eerlijke samenvatting

De Astra-lancering is oprecht goed nieuws voor iedereen die software bouwt met agents. Beter coderen, merkbaar beter gedrag, en een bedrijf dat bereid is het cijfer te publiceren waar het slechter van wordt — de daling in monitorbaarheid kwam van OpenAI, niet van een criticus.

Het deel om naar te handelen is klein en structureel. Het vermogen van je product om zichzelf uit te leggen moet nu van jouw kant van de grens komen. Niet omdat het model onbetrouwbaar is, maar omdat de leesbaarheid ervan een eigenschap is die je niet beheerst en die je niet is beloofd, en die de verkeerde kant op bewoog in dezelfde week dat je kopers de tools kregen om ernaar te gaan vragen.

Founders die al toolaanroepen, contextinhoud en beslispunten loggen, verloren deze week niets. Founders die van plan waren een redeneerspoor te tonen wanneer iemand er uiteindelijk naar zou vragen, kwamen er net achter dat dat plan een houdbaarheidsdatum heeft.

Bronnen: TechCrunch, "OpenAI's new reasoning technique alarms AI safety experts" · TechCrunch, "OpenAI launches Astra, its powerful (and controversial) new model" · Implicator.ai over de Astra system card en monitorbaarheid · Gizmodo over het monitoren van hoe het model denkt · Benchmarkcijfers, citaten en de beschrijving van recurrent depth zijn zoals gerapporteerd; het argument over waar je audittrail hoort, en de kanttekeningen in sectie 6, zijn van mij.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :