Van 22% naar 2,4% op veiligheid. Monitorbaarheid ging de andere kant op, en OpenAI noemde die daling ernstig

8 september 2026
11 min leestijd

8 september 2026
11 min leestijd
Gisteren schreef ik over enterprises die tools krijgen om elke agent op een machine te inventariseren en de agents te blokkeren die niemand heeft goedgekeurd — een week waarin de vraag werd: laat zien wat deze agent deed, en wie het toestond.
Twee dagen daarvoor bewoog de frontier precies de andere kant op.
OpenAI leverde Astra op 3 september. Het is naar eigen zeggen het beste software-engineeringmodel dat ze hebben gebouwd, en het gedraagt zich merkbaar beter dan zijn voorganger. Het redeneert ook op een manier die minder leesbare sporen achterlaat, en OpenAI's eigen system card zegt dat de monitorbaarheid daalde. Ze noemden die daling ernstig.
Astra, zoals gerapporteerd en zoals gedocumenteerd
Twee richtingen in dezelfde release, allebei van OpenAI
Jakub Pachocki, chief scientist van OpenAI, verwoordde de spanning zonder omweg: "We nemen deze zichtbaarheid een beetje voor lief, en we zien dat naarmate de capaciteiten van modellen toenemen, monitorbaarheid lastiger wordt." Hij zei ook dat het behouden van chain-of-thought-monitoring sinds hun eerste redeneermodellen een kerndoel is, wat ik lees als oprecht en onopgelost, niet als tegenstrijdig.
Haal de lanceringstaal weg en de vorm is simpel.
Het gedraagt zich minder vaak verkeerd. Het legt zichzelf minder uit. Beide zijn waar.
Dat zijn geen tegenpolen, en het eerste is geen vervanging voor het tweede. Een model dat zich negen van de tien keer goed gedraagt en je niet kan vertellen waarom, is operationeel een ander object dan een model dat zich slechter gedraagt maar een leesbaar verslag achterlaat. Het tweede is debugbaar. Het eerste moet je van buitenaf meten.
Veiligheidsonderzoekers reageerden op de tweede helft. Buck Shlegeris van Redwood Research zei "buitengewoon bezorgd te zijn over de berichten dat Astra ondoorzichtige recurrentie gebruikt", en waarschuwde dat verder opschalen van de techniek chain-of-thought-monitorbaarheid zou vernietigen. Zijn collega Ryan Greenblatt beschreef het eindpunt als een model dat vrijwel volledig in latente ruimte redeneert. Zvi Mowshowitz betoogde dat het een norm breekt die de labs met moeite hadden gevestigd.
Waarom ik dit niet als een veiligheidsverhaal behandel
Die zorgen gaan over toezicht op frontier-modellen, en ik ben niet degene om daarover te oordelen. Het founder-relevante feit eronder is smaller en moeilijker te betwisten: het artefact waarop je impliciet leunde om het gedrag van je product uit te leggen, is net dunner geworden, precies op het moment dat je kopers erom begonnen te vragen op papier. Dat is waar, of het alignment-debat nu goed afloopt of niet.
Vorige week leverde twee vragen en één aanbod op, en ze wijzen tegengesteld.
De vraag. Enterprise-tooling traceert nu van prompt naar identiteit naar tool-aanroep naar systeemactie, en blokkeert agents die niemand heeft goedgekeurd. Het securityteam van je koper krijgt het vocabulaire aangereikt om te vragen wat jouw agent deed en waarom — als inkoopvraag, niet als incidentvraag.
Het aanbod. Het beste beschikbare model voor het werk is er een waarvan het interne redeneren, volgens de eigen meting van de maker, minder leesbaar is dan dat van het model dat het vervangt. Als jouw antwoord op "waarom deed het dat" ooit "hier is de chain of thought" zou worden, dan is dat antwoord aan het afschrijven.
Dit is geen reden om Astra te mijden. Het is een reden om het zelfrapport van het model niet langer te behandelen als onderdeel van de verantwoording van je product, omdat je de leesbaarheid ervan niet beheerst en die de verkeerde kant op beweegt.
De nuttige herformulering is dat de verantwoording van een agent nooit echt over zijn gedachten ging. Die ging over zijn effecten.
Niets hiervan is nieuw advies. Wat veranderde, is dat de terugvaloptie stilletjes verdween: teams die dit oversloegen leunden, zonder dat ooit te besluiten, op de mogelijkheid om het achteraf aan het model te vragen.
Dit is geen bewering dat Astra onveilig is. Op basis van het ene cijfer dat OpenAI hierover publiceerde, gedraagt het zich aanzienlijk beter dan het model dat het vervangt. Monitorbaarheid en gedrag zijn verschillende eigenschappen, en het is volstrekt samenhangend dat de een verbetert terwijl de ander achteruitgaat.
"Minder leesbare sporen" is niet "geen sporen". De berichtgeving over de techniek beschrijft een afname van leesbaarheid, niet het verdwijnen van een chain of thought. De sterke versie — redeneren dat volledig naar latente ruimte verhuist — is wat onderzoekers waarschuwen dat opschalen zou kunnen opleveren, niet wat is gedocumenteerd.
Ik lees één release als een richting. Eén model, één architectuurkeuze, één system card. Als concurrenten niet volgen, is dit een voetnoot en geen trend, en de eerlijke positie is dat we het over een jaar weten. Wat niet speculatief is, is de ruil in deze release, want OpenAI documenteerde hem.
De Astra-lancering is oprecht goed nieuws voor iedereen die software bouwt met agents. Beter coderen, merkbaar beter gedrag, en een bedrijf dat bereid is het cijfer te publiceren waar het slechter van wordt — de daling in monitorbaarheid kwam van OpenAI, niet van een criticus.
Het deel om naar te handelen is klein en structureel. Het vermogen van je product om zichzelf uit te leggen moet nu van jouw kant van de grens komen. Niet omdat het model onbetrouwbaar is, maar omdat de leesbaarheid ervan een eigenschap is die je niet beheerst en die je niet is beloofd, en die de verkeerde kant op bewoog in dezelfde week dat je kopers de tools kregen om ernaar te gaan vragen.
Founders die al toolaanroepen, contextinhoud en beslispunten loggen, verloren deze week niets. Founders die van plan waren een redeneerspoor te tonen wanneer iemand er uiteindelijk naar zou vragen, kwamen er net achter dat dat plan een houdbaarheidsdatum heeft.
Bronnen: TechCrunch, "OpenAI's new reasoning technique alarms AI safety experts" · TechCrunch, "OpenAI launches Astra, its powerful (and controversial) new model" · Implicator.ai over de Astra system card en monitorbaarheid · Gizmodo over het monitoren van hoe het model denkt · Benchmarkcijfers, citaten en de beschrijving van recurrent depth zijn zoals gerapporteerd; het argument over waar je audittrail hoort, en de kanttekeningen in sectie 6, zijn van mij.
IdeaToMVP Academy
4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.