De 22 % à 2,4 % sur la sûreté. La monitorabilité est allée dans l'autre sens, et OpenAI a qualifié la baisse de sérieuse

Surya Pratap
By Surya Pratap

8 septembre 2026

11 min de lecture

IA et technologie
Les deux directions de la fiche technique d'Astra mises côte à côte : à gauche ce qui s'est amélioré, les comportements indésirables passant de 22 % sur GPT-5.6 Sol à 2,4 % sur Astra sur le banc d'essai interne de sûreté d'OpenAI, avec Astra donné devant Sol et Fable sur la recherche de bogues, l'exécution en terminal et les questions sur le code, et à droite ce qui s'est dégradé, la profondeur récurrente qui reboucle la même requête au lieu d'écrire le raisonnement par étapes, laissant moins de traces lisibles, et une baisse de monitorabilité qu'OpenAI elle-même a qualifiée de sérieuseDeux chiffres, directions opposéesHover to explore
Plus sûr à exécuter et plus difficile à expliquer, dans le même document. Une seule de ces deux moitiés a été racontée comme l'information.

Hier, j'ai écrit sur les entreprises qui reçoivent des outils pour inventorier tous les agents d'une machine et bloquer ceux que personne n'a approuvés — une semaine où la question est devenue montrez-moi ce que cet agent a fait, et qui l'y a autorisé.

Deux jours plus tôt, la frontière avait bougé dans l'autre sens.

OpenAI a livré Astra le 3 septembre. C'est, selon eux, le meilleur modèle d'ingénierie logicielle qu'ils aient construit, et il se comporte nettement mieux que son prédécesseur. Il raisonne aussi d'une manière qui laisse moins de traces lisibles, et la fiche technique d'OpenAI dit que la monitorabilité a baissé. Ils ont qualifié cette baisse de sérieuse.

1. Ce que dit réellement la fiche technique

Astra, tel que rapporté et tel que documenté

Deux directions dans la même sortie, toutes deux venant d'OpenAI

  • Les comportements indésirables sont passés de 22,0 % à 2,4 % sur le banc d'essai interne de sûreté d'OpenAI, en comparant GPT-5.6 Sol et Astra. Plus bas est meilleur ; c'est une amélioration importante et réelle.
  • Astra est donné devant Sol et le Fable d'Anthropic sur la recherche de bogues, l'exécution en terminal et les questions sur le code, présenté comme le meilleur modèle d'ingénierie logicielle à ce jour.
  • Il utilise la profondeur récurrente, aussi appelée récurrence opaque : le modèle traite plusieurs fois la même requête en boucle au lieu de laisser un enregistrement conventionnel et séquentiel de chaîne de pensée.
  • Le résultat, d'après ce qui est rapporté, est qu'il laisse moins de traces lisibles que le raisonnement séquentiel qu'il remplace.
  • La fiche technique d'OpenAI confirme que la monitorabilité est inférieure à celle des modèles antérieurs, et l'entreprise a qualifié la baisse de sérieuse.
  • L'accès a commencé par les clients du programme de cybersécurité Daybreak, puis les offres Pro, Plus, Enterprise et Business ainsi que l'API — une capacité assez importante pour que l'ordre de déploiement soit lui-même une décision de sûreté.

Jakub Pachocki, directeur scientifique d'OpenAI, a posé la tension sans détour : « Nous tenons un peu cette visibilité pour acquise, et nous constatons qu'à mesure que les capacités des modèles augmentent, la monitorabilité devient plus difficile. » Il a aussi dit que préserver le suivi de la chaîne de pensée est un objectif central depuis leurs premiers modèles de raisonnement, ce que je lis comme sincère et non résolu plutôt que contradictoire.

2. L'échange, énoncé sans habillage

Enlevez le langage de lancement et la forme est simple.

Il se comporte mal moins souvent. Il s'explique moins. Les deux sont vrais.

Ce ne sont pas des contraires, et le premier ne remplace pas le second. Un modèle qui se comporte bien neuf fois sur dix et qui ne peut pas vous dire pourquoi est un objet opérationnel différent d'un modèle qui se comporte moins bien mais laisse un enregistrement lisible. Le second est débogable. Le premier doit être mesuré de l'extérieur.

Les chercheurs en sûreté ont réagi à la seconde moitié. Buck Shlegeris, de Redwood Research, s'est dit « extrêmement préoccupé par les informations selon lesquelles Astra utilise la récurrence opaque », avertissant que pousser davantage la technique détruirait la monitorabilité de la chaîne de pensée. Son collègue Ryan Greenblatt a décrit le point d'arrivée comme un modèle qui raisonne presque entièrement dans l'espace latent. Zvi Mowshowitz a soutenu que cela rompt une norme que les laboratoires s'étaient efforcés d'établir.

Pourquoi je ne traite pas cela comme un sujet de sûreté

Ces préoccupations portent sur la supervision des modèles de frontière, et ce n'est pas à moi de trancher. Le fait pertinent pour les fondateurs qui se trouve dessous est plus étroit et plus difficile à contester : l'artefact sur lequel vous comptiez implicitement pour expliquer le comportement de votre produit vient de s'amincir, au moment même où vos acheteurs commencent à le demander par écrit. C'est vrai que le débat sur l'alignement se résolve bien ou non.

3. Pourquoi le calendrier compte plus que la technique

La semaine dernière a produit deux demandes et une offre, et elles pointent dans des directions opposées.

La demande. L'outillage d'entreprise trace désormais du prompt à l'identité, à l'appel d'outil et à l'action système, et bloque les agents que personne n'a approuvés. On donne à l'équipe sécurité de votre acheteur le vocabulaire pour demander ce que votre agent a fait et pourquoi, comme question d'achat et non comme question d'incident.

L'offre. Le meilleur modèle disponible pour ce travail est celui dont le raisonnement interne est, de l'aveu mesuré de son fabricant, moins lisible que celui du modèle qu'il remplace. Si votre réponse à « pourquoi a-t-il fait cela » devait un jour être « voici la chaîne de pensée », cette réponse se déprécie.

Ce n'est pas une raison d'éviter Astra. C'est une raison de cesser de traiter l'auto-explication du modèle comme un élément de la responsabilité de votre produit, parce que vous n'en contrôlez pas la lisibilité et qu'elle évolue dans le mauvais sens.

4. Si vous diffusez des produits d'agents

L'auditabilité dans le harnais

Déplacez
Tout ce qui est défendable dans le comportement de votre agent devrait être quelque chose que vous avez enregistré, pas quelque chose que le modèle a raconté : entrées lues, outils appelés avec leurs arguments, fichiers touchés, appels externes effectués, ce qui a changé. Ce journal est le vôtre, il est stable quand vous changez de modèle, et c'est ce qu'un relecteur veut vraiment.

De livrer le texte du raisonnement comme preuve

Cessez
Afficher l'explication d'un modèle dans votre interface est très bien comme élément produit. La traiter comme un enregistrement d'audit a toujours été fragile — c'est un artefact généré, pas une transcription du calcul — et la profondeur récurrente rend cet écart explicite plutôt qu'elle ne le crée.

Les résultats, de façon répétée

Mesurez
Quand vous ne pouvez pas inspecter le raisonnement, le levier restant est d'exécuter la même tâche de nombreuses fois et de regarder la dispersion. C'est la discipline derrière l'exécution de 507 tâches d'agent vingt fois chacune : un passage ne vous dit presque rien, vingt vous disent ce que vous livrez réellement.

La portabilité du modèle

Supposez
Tout ce que vous construisez en supposant que le raisonnement est inspectable est un pari sur une architecture. Gardez la frontière entre votre harnais et le modèle assez nette pour pouvoir basculer vers le meilleur du trimestre suivant sans que votre stratégie de journalisation change.

5. Quoi journaliser quand le modèle ne vous le dira pas

Le recadrage utile, c'est que la responsabilité d'un agent n'a jamais vraiment porté sur ses pensées. Elle portait sur ses effets.

Le graphe d'appels complet

Enregistrez
Chaque invocation d'outil avec ses arguments et son résultat, dans l'ordre, avec l'identité sous laquelle l'appel s'est exécuté. C'est la forme même que l'outillage d'entreprise construit désormais de l'extérieur — la capturer vous-même signifie pouvoir répondre à la question avant que quelqu'un d'autre ait à la reconstituer.

Ce qui est entré dans le contexte

Enregistrez
Quels fichiers, documents, récupérations et instructions de tiers se trouvaient dans la fenêtre à chaque étape. Quand quelque chose tourne mal, l'entrée qui l'a causé est généralement bien plus instructive que n'importe quelle explication, et c'est un fait plutôt qu'une génération.

Les points de décision

Enregistrez
Où l'agent a choisi entre des branches, où il a réessayé, où un humain a validé. Vous ne pouvez pas journaliser pourquoi il a choisi, mais vous pouvez journaliser qu'un choix existait et dans quel sens il est allé — ce qui représente l'essentiel de ce dont une enquête a besoin.

Rien de tout cela n'est un conseil nouveau. Ce qui a changé, c'est que le recours de secours a discrètement disparu : les équipes qui avaient sauté cette étape comptaient, sans l'avoir décidé, sur la possibilité de demander au modèle après coup.

6. Ce que je ne conclurais pas

Ce n'est pas affirmer qu'Astra n'est pas sûr. D'après le seul chiffre qu'OpenAI a publié là-dessus, il se comporte considérablement mieux que le modèle qu'il remplace. Monitorabilité et comportement sont des propriétés différentes, et il est parfaitement cohérent que l'une s'améliore pendant que l'autre régresse.

« Moins de traces lisibles » n'est pas « aucune trace ». Ce qui est rapporté sur la technique décrit une réduction de lisibilité, pas la suppression d'une chaîne de pensée. La version forte — un raisonnement qui passe entièrement dans l'espace latent — est ce que les chercheurs préviennent que la montée en échelle pourrait produire, pas ce qui a été documenté.

Je lis une sortie comme une direction. Un modèle, un choix d'architecture, une fiche technique. Si les concurrents ne suivent pas, c'est une note de bas de page et non une tendance, et la position honnête est que nous le saurons dans un an. Ce qui n'est pas spéculatif, c'est l'échange dans cette sortie, parce qu'OpenAI l'a documenté.

Le résumé honnête

Le lancement d'Astra est une vraie bonne nouvelle pour quiconque construit des logiciels avec des agents. Meilleur en code, nettement meilleur en comportement, et une entreprise prête à publier le chiffre qui la met en difficulté — la baisse de monitorabilité vient d'OpenAI, pas d'un critique.

La partie sur laquelle agir est petite et structurelle. La capacité de votre produit à s'expliquer doit désormais venir de votre côté de la frontière. Non parce que le modèle n'est pas fiable, mais parce que sa lisibilité est une propriété que vous ne contrôlez pas et qu'on ne vous a pas promise, et qu'elle a bougé dans le mauvais sens la semaine même où vos acheteurs ont reçu les outils pour commencer à poser la question.

Les fondateurs qui journalisent déjà les appels d'outils, le contenu du contexte et les points de décision n'ont rien perdu cette semaine. Ceux qui comptaient montrer une trace de raisonnement quand on finirait par leur demander viennent d'apprendre que ce plan a une date de péremption.

Sources : TechCrunch, « OpenAI's new reasoning technique alarms AI safety experts » · TechCrunch, « OpenAI launches Astra, its powerful (and controversial) new model » · Implicator.ai sur la fiche technique d'Astra et la monitorabilité · Gizmodo sur la surveillance de la façon dont le modèle pense · Les chiffres du banc d'essai, les citations et la description de la profondeur récurrente sont ceux rapportés ; l'argument sur l'endroit où doit se trouver votre piste d'audit, et les mises en garde de la section 6, sont les miens.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :