De 22 % à 2,4 % sur la sûreté. La monitorabilité est allée dans l'autre sens, et OpenAI a qualifié la baisse de sérieuse

8 septembre 2026
11 min de lecture

8 septembre 2026
11 min de lecture
Hier, j'ai écrit sur les entreprises qui reçoivent des outils pour inventorier tous les agents d'une machine et bloquer ceux que personne n'a approuvés — une semaine où la question est devenue montrez-moi ce que cet agent a fait, et qui l'y a autorisé.
Deux jours plus tôt, la frontière avait bougé dans l'autre sens.
OpenAI a livré Astra le 3 septembre. C'est, selon eux, le meilleur modèle d'ingénierie logicielle qu'ils aient construit, et il se comporte nettement mieux que son prédécesseur. Il raisonne aussi d'une manière qui laisse moins de traces lisibles, et la fiche technique d'OpenAI dit que la monitorabilité a baissé. Ils ont qualifié cette baisse de sérieuse.
Astra, tel que rapporté et tel que documenté
Deux directions dans la même sortie, toutes deux venant d'OpenAI
Jakub Pachocki, directeur scientifique d'OpenAI, a posé la tension sans détour : « Nous tenons un peu cette visibilité pour acquise, et nous constatons qu'à mesure que les capacités des modèles augmentent, la monitorabilité devient plus difficile. » Il a aussi dit que préserver le suivi de la chaîne de pensée est un objectif central depuis leurs premiers modèles de raisonnement, ce que je lis comme sincère et non résolu plutôt que contradictoire.
Enlevez le langage de lancement et la forme est simple.
Il se comporte mal moins souvent. Il s'explique moins. Les deux sont vrais.
Ce ne sont pas des contraires, et le premier ne remplace pas le second. Un modèle qui se comporte bien neuf fois sur dix et qui ne peut pas vous dire pourquoi est un objet opérationnel différent d'un modèle qui se comporte moins bien mais laisse un enregistrement lisible. Le second est débogable. Le premier doit être mesuré de l'extérieur.
Les chercheurs en sûreté ont réagi à la seconde moitié. Buck Shlegeris, de Redwood Research, s'est dit « extrêmement préoccupé par les informations selon lesquelles Astra utilise la récurrence opaque », avertissant que pousser davantage la technique détruirait la monitorabilité de la chaîne de pensée. Son collègue Ryan Greenblatt a décrit le point d'arrivée comme un modèle qui raisonne presque entièrement dans l'espace latent. Zvi Mowshowitz a soutenu que cela rompt une norme que les laboratoires s'étaient efforcés d'établir.
Pourquoi je ne traite pas cela comme un sujet de sûreté
Ces préoccupations portent sur la supervision des modèles de frontière, et ce n'est pas à moi de trancher. Le fait pertinent pour les fondateurs qui se trouve dessous est plus étroit et plus difficile à contester : l'artefact sur lequel vous comptiez implicitement pour expliquer le comportement de votre produit vient de s'amincir, au moment même où vos acheteurs commencent à le demander par écrit. C'est vrai que le débat sur l'alignement se résolve bien ou non.
La semaine dernière a produit deux demandes et une offre, et elles pointent dans des directions opposées.
La demande. L'outillage d'entreprise trace désormais du prompt à l'identité, à l'appel d'outil et à l'action système, et bloque les agents que personne n'a approuvés. On donne à l'équipe sécurité de votre acheteur le vocabulaire pour demander ce que votre agent a fait et pourquoi, comme question d'achat et non comme question d'incident.
L'offre. Le meilleur modèle disponible pour ce travail est celui dont le raisonnement interne est, de l'aveu mesuré de son fabricant, moins lisible que celui du modèle qu'il remplace. Si votre réponse à « pourquoi a-t-il fait cela » devait un jour être « voici la chaîne de pensée », cette réponse se déprécie.
Ce n'est pas une raison d'éviter Astra. C'est une raison de cesser de traiter l'auto-explication du modèle comme un élément de la responsabilité de votre produit, parce que vous n'en contrôlez pas la lisibilité et qu'elle évolue dans le mauvais sens.
Le recadrage utile, c'est que la responsabilité d'un agent n'a jamais vraiment porté sur ses pensées. Elle portait sur ses effets.
Rien de tout cela n'est un conseil nouveau. Ce qui a changé, c'est que le recours de secours a discrètement disparu : les équipes qui avaient sauté cette étape comptaient, sans l'avoir décidé, sur la possibilité de demander au modèle après coup.
Ce n'est pas affirmer qu'Astra n'est pas sûr. D'après le seul chiffre qu'OpenAI a publié là-dessus, il se comporte considérablement mieux que le modèle qu'il remplace. Monitorabilité et comportement sont des propriétés différentes, et il est parfaitement cohérent que l'une s'améliore pendant que l'autre régresse.
« Moins de traces lisibles » n'est pas « aucune trace ». Ce qui est rapporté sur la technique décrit une réduction de lisibilité, pas la suppression d'une chaîne de pensée. La version forte — un raisonnement qui passe entièrement dans l'espace latent — est ce que les chercheurs préviennent que la montée en échelle pourrait produire, pas ce qui a été documenté.
Je lis une sortie comme une direction. Un modèle, un choix d'architecture, une fiche technique. Si les concurrents ne suivent pas, c'est une note de bas de page et non une tendance, et la position honnête est que nous le saurons dans un an. Ce qui n'est pas spéculatif, c'est l'échange dans cette sortie, parce qu'OpenAI l'a documenté.
Le lancement d'Astra est une vraie bonne nouvelle pour quiconque construit des logiciels avec des agents. Meilleur en code, nettement meilleur en comportement, et une entreprise prête à publier le chiffre qui la met en difficulté — la baisse de monitorabilité vient d'OpenAI, pas d'un critique.
La partie sur laquelle agir est petite et structurelle. La capacité de votre produit à s'expliquer doit désormais venir de votre côté de la frontière. Non parce que le modèle n'est pas fiable, mais parce que sa lisibilité est une propriété que vous ne contrôlez pas et qu'on ne vous a pas promise, et qu'elle a bougé dans le mauvais sens la semaine même où vos acheteurs ont reçu les outils pour commencer à poser la question.
Les fondateurs qui journalisent déjà les appels d'outils, le contenu du contexte et les points de décision n'ont rien perdu cette semaine. Ceux qui comptaient montrer une trace de raisonnement quand on finirait par leur demander viennent d'apprendre que ce plan a une date de péremption.
Sources : TechCrunch, « OpenAI's new reasoning technique alarms AI safety experts » · TechCrunch, « OpenAI launches Astra, its powerful (and controversial) new model » · Implicator.ai sur la fiche technique d'Astra et la monitorabilité · Gizmodo sur la surveillance de la façon dont le modèle pense · Les chiffres du banc d'essai, les citations et la description de la profondeur récurrente sont ceux rapportés ; l'argument sur l'endroit où doit se trouver votre piste d'audit, et les mises en garde de la section 6, sont les miens.
IdeaToMVP Academy
4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.