Del 22 % al 2,4 % en seguridad. La monitorizabilidad fue en sentido contrario, y OpenAI calificó la caída de seria

Surya Pratap
By Surya Pratap

8 de septiembre de 2026

11 min de lectura

IA y tecnología
Las dos direcciones de la ficha técnica de Astra puestas una junto a otra: a la izquierda lo que mejoró, el comportamiento no deseado cayendo del 22 % en GPT-5.6 Sol al 2,4 % en Astra en el banco de pruebas interno de seguridad de OpenAI, con Astra situado por delante de Sol y de Fable en detección de errores, ejecución en terminal y preguntas sobre el código; a la derecha lo que empeoró, la profundidad recurrente que repite la misma consulta en bucle en vez de escribir el razonamiento por pasos, dejando menos rastros legibles, y una caída de monitorizabilidad que la propia OpenAI calificó de seriaDos cifras, direcciones opuestasHover to explore
Más seguro de ejecutar y más difícil de explicar, del mismo documento. Solo una de esas mitades se contó como la noticia.

Ayer escribí sobre las empresas que están recibiendo herramientas para inventariar todos los agentes de una máquina y bloquear los que nadie aprobó: una semana en la que la pregunta pasó a ser enséñame qué hizo este agente, y quién le dejó.

Dos días antes, la frontera se movió en sentido contrario.

OpenAI lanzó Astra el 3 de septiembre. Según ellos, es el mejor modelo de ingeniería de software que han construido, y se comporta notablemente mejor que su predecesor. También razona de una manera que deja menos rastros legibles, y la propia ficha técnica de OpenAI dice que la monitorizabilidad bajó. Calificaron la caída de seria.

1. Qué dice realmente la ficha técnica

Astra, según lo publicado y lo documentado

Dos direcciones en el mismo lanzamiento, ambas de OpenAI

  • El comportamiento no deseado cayó del 22,0 % al 2,4 % en el banco de pruebas interno de seguridad de OpenAI, comparando GPT-5.6 Sol con Astra. Menos es mejor; es una mejora grande y real.
  • Astra se sitúa por delante de Sol y del Fable de Anthropic en detección de errores, ejecución en terminal y preguntas sobre el código, presentado como el mejor modelo de ingeniería de software hasta la fecha.
  • Usa profundidad recurrente, también llamada recurrencia opaca: el modelo procesa la misma consulta varias veces en bucle en lugar de dejar un registro convencional y secuencial de cadena de pensamiento.
  • El resultado, según lo publicado, es que deja menos rastros legibles que el razonamiento secuencial al que sustituye.
  • La ficha técnica de OpenAI confirma que la monitorizabilidad es menor que en modelos anteriores, y la empresa calificó la caída de seria.
  • El acceso empezó por los clientes del programa de ciberseguridad Daybreak, y siguió por los planes Pro, Plus, Enterprise y Business más la API: una capacidad lo bastante significativa como para que el orden de despliegue fuese en sí una decisión de seguridad.

Jakub Pachocki, director científico de OpenAI, planteó la tensión sin rodeos: «Damos esta visibilidad un poco por descontada, y estamos viendo que, a medida que aumentan las capacidades de los modelos, la monitorizabilidad se vuelve más difícil.» También dijo que preservar la monitorización de la cadena de pensamiento ha sido un objetivo central desde sus primeros modelos de razonamiento, algo que leo como sincero y sin resolver, más que como contradictorio.

2. El intercambio, dicho sin adornos

Quite el lenguaje de lanzamiento y la forma es simple.

Se porta peor menos veces. Se explica menos. Ambas son ciertas.

No son opuestos, y lo primero no sustituye a lo segundo. Un modelo que se comporta bien nueve de cada diez veces y no puede decirle por qué es un objeto operativo distinto de uno que se comporta peor pero deja un registro legible. El segundo es depurable. El primero hay que medirlo desde fuera.

Los investigadores de seguridad reaccionaron a la segunda mitad. Buck Shlegeris, de Redwood Research, dijo estar «extremadamente preocupado por la información de que Astra usa recurrencia opaca», y advirtió de que escalar más la técnica destruiría la monitorizabilidad de la cadena de pensamiento. Su colega Ryan Greenblatt describió el punto final como un modelo que razona casi por completo en espacio latente. Zvi Mowshowitz sostuvo que rompe una norma que los laboratorios se habían esforzado en establecer.

Por qué no trato esto como una noticia de seguridad

Esas preocupaciones son sobre la supervisión de los modelos de frontera, y no soy yo quien debe dirimirlas. El hecho relevante para los fundadores que hay debajo es más estrecho y más difícil de discutir: el artefacto en el que se apoyaba usted implícitamente para explicar el comportamiento de su producto acaba de adelgazar, justo cuando sus compradores han empezado a pedirlo por escrito. Eso es cierto se resuelva bien o no el debate sobre alineamiento.

3. Por qué importa más el momento que la técnica

La semana pasada produjo dos demandas y una oferta, y apuntan en direcciones opuestas.

La demanda. Las herramientas empresariales ya trazan del prompt a la identidad, a la llamada de herramienta y a la acción de sistema, y bloquean a los agentes que nadie aprobó. Al equipo de seguridad de su comprador le están dando el vocabulario para preguntar qué hizo su agente y por qué, como pregunta de compras y no como pregunta de incidente.

La oferta. El mejor modelo disponible para el trabajo es uno cuyo razonamiento interno es, según la medición de su propio fabricante, menos legible que el del modelo al que sustituye. Si su respuesta a «¿por qué hizo eso?» iba a ser alguna vez «aquí está la cadena de pensamiento», esa respuesta se está depreciando.

No es una razón para evitar Astra. Es una razón para dejar de tratar el autoinforme del modelo como un componente de la rendición de cuentas de su producto, porque usted no controla su legibilidad y va en la dirección equivocada.

4. Si distribuye productos de agentes

La auditabilidad al arnés

Traslade
Todo lo defendible sobre el comportamiento de su agente debería ser algo que usted registró, no algo que el modelo narró: entradas leídas, herramientas invocadas con sus argumentos, archivos tocados, llamadas externas realizadas, qué cambió. Ese registro es suyo, es estable ante cambios de modelo y es lo que un revisor quiere de verdad.

De publicar el texto del razonamiento como prueba

Deje
Mostrar la explicación de un modelo en su interfaz está bien como recurso de producto. Tratarla como registro de auditoría siempre fue endeble —es un artefacto generado, no una transcripción del cálculo— y la profundidad recurrente hace explícita esa brecha, no la crea.

Resultados, repetidamente

Mida
Cuando no puede inspeccionar el razonamiento, la palanca que queda es ejecutar la misma tarea muchas veces y mirar la dispersión. Esa es la disciplina detrás de ejecutar 507 tareas de agente veinte veces cada una: una pasada no le dice casi nada, veinte le dicen qué está lanzando de verdad.

Portabilidad de modelo

Asuma
Todo lo que construya asumiendo que el razonamiento es inspeccionable es una apuesta por una arquitectura. Mantenga la frontera entre su arnés y el modelo lo bastante limpia como para poder cambiar al mejor del trimestre siguiente sin que cambie su historia de registro.

5. Qué registrar cuando el modelo no se lo va a decir

El replanteamiento útil es que la rendición de cuentas de un agente nunca fue realmente sobre sus pensamientos. Fue sobre sus efectos.

El grafo completo de llamadas

Registre
Cada invocación de herramienta con sus argumentos y su resultado, en orden, con la identidad bajo la que corrió la llamada. Es la misma forma que las herramientas empresariales construyen ahora desde fuera: capturarla usted significa poder responder la pregunta antes de que otro tenga que reconstruirla.

Qué entró en el contexto

Registre
Qué archivos, documentos, recuperaciones e instrucciones de terceros estaban en la ventana en cada paso. Cuando algo sale mal, la entrada que lo causó suele ser mucho más informativa que cualquier explicación de ello, y es un hecho en vez de una generación.

Los puntos de decisión

Registre
Dónde el agente eligió entre ramas, dónde reintentó, dónde aprobó un humano. No puede registrar por qué eligió, pero sí que existía una elección y hacia dónde fue, que es la mayor parte de lo que necesita una investigación.

Nada de esto es consejo nuevo. Lo que cambió es que el recurso de reserva desapareció en silencio: los equipos que se saltaron esto se apoyaban, sin haberlo decidido, en poder preguntarle después al modelo.

6. Qué no concluiría

Esto no es afirmar que Astra sea inseguro. Por la única cifra que OpenAI ha publicado sobre esto, se comporta bastante mejor que el modelo al que sustituye. Monitorizabilidad y comportamiento son propiedades distintas, y es perfectamente coherente que una mejore mientras la otra retrocede.

«Menos rastros legibles» no es «ningún rastro». Lo publicado sobre la técnica describe una reducción de legibilidad, no la eliminación de una cadena de pensamiento. La versión fuerte —el razonamiento moviéndose por completo al espacio latente— es lo que los investigadores advierten que escalar podría producir, no lo que se ha documentado.

Estoy leyendo un lanzamiento como una dirección. Un modelo, una decisión de arquitectura, una ficha técnica. Si los competidores no siguen, esto es una nota al pie y no una tendencia, y la posición honesta es que lo sabremos dentro de un año. Lo que no es especulativo es el intercambio de este lanzamiento, porque OpenAI lo documentó.

El resumen honesto

El lanzamiento de Astra es una noticia genuinamente buena para cualquiera que construya software con agentes. Mejor programación, comportamiento notablemente mejor y una empresa dispuesta a publicar la cifra que la deja peor: la caída de monitorizabilidad vino de OpenAI, no de un crítico.

La parte sobre la que conviene actuar es pequeña y estructural. La capacidad de su producto de explicarse tiene que venir ahora de su lado de la frontera. No porque el modelo no sea de fiar, sino porque su legibilidad es una propiedad que usted ni controla ni le prometieron, y se movió en la dirección equivocada la misma semana en que sus compradores obtuvieron las herramientas para empezar a preguntar.

Los fundadores que ya registran llamadas de herramientas, contenidos del contexto y puntos de decisión no perdieron nada esta semana. Los fundadores que pensaban enseñar un rastro de razonamiento cuando alguien acabara preguntando acaban de descubrir que ese plan tiene fecha de caducidad.

Fuentes: TechCrunch, «OpenAI's new reasoning technique alarms AI safety experts» · TechCrunch, «OpenAI launches Astra, its powerful (and controversial) new model» · Implicator.ai sobre la ficha técnica de Astra y la monitorizabilidad · Gizmodo sobre monitorizar cómo piensa el modelo · Las cifras del banco de pruebas, las citas y la descripción de la profundidad recurrente son las publicadas; el argumento sobre dónde debe estar su registro de auditoría, y las cautelas de la sección 6, son míos.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :