OpenAI gaf de agent-loop zojuist weg. De sessie is het deel dat je huurt

11 september 2026
12 min leestijd

11 september 2026
12 min leestijd
Ongeveer achttien maanden lang zat het lastigste van een agent-product niet in de modelcall. Het zat in alles eromheen. Op 10 september 2026 leverde OpenAI dat hele pakket als managed service, zonder opslag, met een limitations-pagina die de meeste berichtgeving oversloeg.
Beide helften doen ertoe. De tweede het meest.
De Agents API ging in public beta en ontsluit dezelfde harness die Codex draait. De documentatie brengt het terug tot vier primitieven:
De Agents API, zoals gedocumenteerd
Vier begrippen, waarvan er één het echte werk doet
Daarachter draait OpenAI de loop: het platform verzorgt "sessie-orchestratie, contextcompactie en herstel". Sessies vatten eerder werk samen zodra het venster volloopt, verdelen taken over subagents onder een concurrency-plafond (max_concurrent_subagents staat op 4 in het gepubliceerde voorbeeld), laden tooldefinities on demand in plaats van ze elke beurt allemaal te betalen, en overleven storingen zonder dat jij de retry schrijft.
Sandboxes komen in drie smaken: gehost door OpenAI, zelf gehost via codex exec-server over een uitgaande WebSocket, of via een partner — Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop en Vercel werden bij de lancering genoemd.
En de prijsstelling is de kop die niemand helemaal geloofde: de Agents API rekent zelf niets. Je betaalt modeltokens tegen standaardtarief, standaardtarieven voor door OpenAI geleverde tools, en containertijd als je een gehoste sandbox gebruikt. De orchestratie is gratis.
Ik heb deze zomer twee keer over de harness geschreven, beide keren als iets waartussen je kiest. Prime Agent en Muse Code deden tegengestelde weddenschappen over open versus gehost, en DeepSeek gaf er één vrij waarin zelfs de loop een plugin is. De gedeelde premisse van dat hele debat was dat de harness echt engineering is met echte ontwerpkeuzes, en dat er één kiezen een strategische daad is.
Die premisse is zojuist flink verzwakt — althans voor de delen die iedereen identiek zat te bouwen.
Niemand onderscheidde zich met zijn retry-logica. Iedereen zat hem alleen maar te schrijven.
Loop de lijst af van wat de managed harness nu doet en vraag je eerlijk af welke daarvan jouw team beter deed dan een competente default. Context compacteren als het venster volloopt. Parallelle toolcalls. Een subagent die zijn eigen context krijgt en een resultaat teruggeeft. Hervatten na een crash zonder vanaf beurt één opnieuw te spelen. Toolschema's lazy laden zodat honderd tools niet honderd schema's per beurt kosten.
Dat zijn precies de punten op de interne infrastructuurbacklog van elk agent-team, en het is nergens waar iemands product wint. Als een concurrent ze gratis levert en ze werken, wordt je eigen versie aanhouden een beslissing die je moet verantwoorden in plaats van een die zichzelf verantwoordt.
Het efficiëntieargument dat wél echt is
Lazy tooldefinities en automatische compactie pakken het residentieprobleem direct aan — elk bestand dat een agent leest blijft resident en wordt elke beurt opnieuw gefactureerd — en een managed compactor die correct draait verslaat een zelfgebouwde die draait wanneer iemand eraan denkt. Deze besparing is echt, geen marketing.
Dit is de regel, uit OpenAI's eigen Agents API-documentatie:
Uit de limitations van de Agents API
De Agents API ondersteunt dataresidentie momenteel alleen in de Verenigde Staten en ondersteunt geen Zero Data Retention. Een zelf gehoste sandbox kiezen maakt de Agents API niet ZDR-geschikt.
Lees die laatste zin twee keer, want hij sluit precies de nooduitgang waar een founder als eerste naar grijpt.
De intuïtie zegt: prima, onze code is gevoelig, dus we draaien de sandbox in onze eigen VPC. Dat kan. De compute verhuist. De bestanden blijven op jouw infrastructuur. En je bent nog steeds niet ZDR-geschikt, want de sandbox was nooit het ding dat bewaard werd.
Dit is het deel dat ik een founder echt zou willen laten landen, want het is geen beleidsgat dat een latere release dichtzet.
Wat een duurzame sessie waardevol maakt, is dat hij zich dingen herinnert. Je kunt hem morgen een taak teruggeven en hij weet wat hij las, wat hij probeerde, wat faalde en wat hij concludeerde, zonder dat jij iets herbouwt. OpenAI's documentatie zegt het onomwonden: de API "bewaart sessiestate zodat je werk over beurten heen kunt voortzetten zonder de gesprekscontext opnieuw op te bouwen".
Beschrijf datzelfde mechanisme nu eens aan een security reviewer. Een derde partij houdt een persistent, herspeelbaar verslag bij van alles wat je agent aanraakte — bestandsinhoud, tooloutput, tussentijdse redenering, klantdata die erdoorheen ging — op infrastructuur die je niet beheert, in een jurisdictie die je niet koos.
Duurzaamheid is bewaring met de marketing eroverheen. Eén eigenschap, beschreven door engineering en door legal.
Er bestaat geen versie hiervan waarin de sessie een herstart overleeft en er niets bewaard blijft. Zero Data Retention en een duurzame sessie sluiten elkaar per constructie uit, en de eerlijke lezing van die limitations-pagina is niet "nog niet" maar "niet zolang de functie zo werkt".
Dat herformuleert de beslissing. Dit is geen vinkje dat in Q1 opengaat. Het is een structurele ruil: je ruilt de mogelijkheid om een koper te beloven dat er niets bewaard wordt in voor de mogelijkheid te stoppen met het onderhouden van een agent-loop. Voor een hoop producten is die ruil overduidelijk juist. Voor sommige is hij diskwalificerend vanaf dag één, en het nuttige is te weten welke van de twee jij bent voordat je er acht maanden bovenop bouwt.
Het open-sourceframe heeft mensen in de war gebracht, dus het loont om het netjes uit elkaar te trekken.
codex exec-server maken de uitvoeromgeving tot een echte keuze, met echte CPU-, GPU-, geheugen- en VPC-opties. Als je zorg is waar code draait en waar bestanden staan, is die zorg vandaag al adresseerbaar.gpt-6-astra. Een harness die context beheert, kiest wanneer te compacteren en subagents coördineert, is mede-ontworpen met het model waartegen hij is afgestemd. Zelfs met open harness-code is "een andere provider erin schuiven" het overdoen van die afstemming, niet een configuratiewijziging.De overstapkosten zijn verplaatst. Het was de orchestratiecode die je schreef — vervelend, maar van jou. Het zijn nu de transcripten die je niet schreef, en die zijn dat niet.
Wil je de gratis loop — en de meeste teams zouden hem minstens moeten doorrekenen — dan is de architectuur die je opties openhoudt dezelfde die je agent debugbaar maakt, wat een prettig toeval is.
Doe dit en de Agents API wordt een versneller die je kunt verlaten. Sla het over en hij wordt de plek waar het geheugen van je product woont.
Bij de lancering hoorden klantresultaten, en die zijn het waard om nauwkeurig te noemen en passend af te waarderen: één launch partner rapporteerde een evaluatiescore die van 0,71 naar 0,85 ging met ruwweg 4x minder latency, een ander een kostenreductie van 60 % per case, een derde 86 % minder mislukte responses.
Dat zijn echte teams die echte verschillen rapporteren. Het zijn ook door de leverancier geselecteerde, zelfgerapporteerde, niet-geauditeerde cijfers, gemeten tegen wat die teams daarvóór hadden — wat, voor een bedrijf dat instemde launch partner voor managed orchestratie te worden, plausibel een zelfgebouwde loop was die aan vervanging toe was.
Wat de cijfers wel en niet aantonen
Ze tonen aan dat een competente managed harness een verwaarloosde interne verslaat, wat nooit ter discussie stond. Ze tonen niet aan dat hij een onderhouden interne verslaat, en geen enkele gepubliceerde vergelijking doet dat. Neem ze als bewijs dat het ding werkt, niet als jouw verwachte verbetering.
Een recht antwoord per situatie
De regel over bewaring beslist het meeste hiervan voordat iets anders dat doet
Een public beta is een public beta. Residentie, ZDR en modelondersteuning kunnen allemaal veranderen, en een beperking die vandaag structureel is voor het duurzame-sessieontwerp kan later worden beantwoord met een andere sessiemodus. Bouw op wat gedocumenteerd is, niet op wat plausibel is.
"Geen opslag" is niet "geen kosten". Containertijd wordt gefactureerd, gehoste tools worden gefactureerd, en een harness die transparant compacteert en subagents start maakt tokenverbruik moeilijker te voorspellen, niet makkelijker. Meet uitgaven per afgeronde taak vanaf dag één, niet per call.
Gratis orchestratie is een strategie, geen vrijgevigheid. De laag erboven weggeven om de tokens eronder te verkopen is de oudste zet in infrastructuur, en hij werkt juist omdat de gratis laag oprecht goed is. Dat is een argument om hem met open ogen te gebruiken, niet om hem te weigeren.
De agent-harness hield op 10 september 2026 op een onderscheidende factor te zijn. Contextcompactie, subagent-coördinatie, lazy tool loading en crashherstel zijn nu een managed service zonder opslag, en het argument om je eigen versie daarvan te onderhouden moet gemaakt worden in plaats van aangenomen.
Wat het als strategische vraag vervangt, is de sessie. Een duurzame agent-sessie is het nuttigste primitief in deze release en het enige dat je niet zelf kunt hosten, waarop je geen bewaringsgaranties kunt krijgen en dat je niet kunt meenemen. Duurzaamheid en bewaring zijn dezelfde eigenschap, wat betekent dat dit een ruil is en geen tijdelijk gat.
Huur de loop. Bezit de state. De teams die dit misrekenen merken het een jaar lang niet, en merken het dan in één klap.
Bronnen: OpenAI, "Introducing the Agents API" · OpenAI API-documentatie, overzicht van de Agents API · OpenAI API-changelog, 10 september 2026 · MarkTechPost, "OpenAI Launches the Agents API in Public Beta, Putting the Codex Harness Behind One API Call" · De primitieven, de tekst van de limitations en alle prijscomponenten zijn geciteerd uit OpenAI's documentatie; de cijfers van launch partners zijn door de leverancier gerapporteerd. De lezing van duurzaamheid en bewaring als één eigenschap, en elke architectuuraanbeveling, zijn van mij. Voor hoe het harness-debat eruitzag toen het nog een keuze tussen leveranciers was, zie de twee harnesses die binnen 48 uur uitkwamen met tegengestelde weddenschappen.
IdeaToMVP Academy
4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.