Del 22 % al 2,4 % en seguridad. La monitorizabilidad fue en sentido contrario, y OpenAI calificó la caída de seria

8 de septiembre de 2026
11 min de lectura

8 de septiembre de 2026
11 min de lectura
Ayer escribí sobre las empresas que están recibiendo herramientas para inventariar todos los agentes de una máquina y bloquear los que nadie aprobó: una semana en la que la pregunta pasó a ser enséñame qué hizo este agente, y quién le dejó.
Dos días antes, la frontera se movió en sentido contrario.
OpenAI lanzó Astra el 3 de septiembre. Según ellos, es el mejor modelo de ingeniería de software que han construido, y se comporta notablemente mejor que su predecesor. También razona de una manera que deja menos rastros legibles, y la propia ficha técnica de OpenAI dice que la monitorizabilidad bajó. Calificaron la caída de seria.
Astra, según lo publicado y lo documentado
Dos direcciones en el mismo lanzamiento, ambas de OpenAI
Jakub Pachocki, director científico de OpenAI, planteó la tensión sin rodeos: «Damos esta visibilidad un poco por descontada, y estamos viendo que, a medida que aumentan las capacidades de los modelos, la monitorizabilidad se vuelve más difícil.» También dijo que preservar la monitorización de la cadena de pensamiento ha sido un objetivo central desde sus primeros modelos de razonamiento, algo que leo como sincero y sin resolver, más que como contradictorio.
Quite el lenguaje de lanzamiento y la forma es simple.
Se porta peor menos veces. Se explica menos. Ambas son ciertas.
No son opuestos, y lo primero no sustituye a lo segundo. Un modelo que se comporta bien nueve de cada diez veces y no puede decirle por qué es un objeto operativo distinto de uno que se comporta peor pero deja un registro legible. El segundo es depurable. El primero hay que medirlo desde fuera.
Los investigadores de seguridad reaccionaron a la segunda mitad. Buck Shlegeris, de Redwood Research, dijo estar «extremadamente preocupado por la información de que Astra usa recurrencia opaca», y advirtió de que escalar más la técnica destruiría la monitorizabilidad de la cadena de pensamiento. Su colega Ryan Greenblatt describió el punto final como un modelo que razona casi por completo en espacio latente. Zvi Mowshowitz sostuvo que rompe una norma que los laboratorios se habían esforzado en establecer.
Por qué no trato esto como una noticia de seguridad
Esas preocupaciones son sobre la supervisión de los modelos de frontera, y no soy yo quien debe dirimirlas. El hecho relevante para los fundadores que hay debajo es más estrecho y más difícil de discutir: el artefacto en el que se apoyaba usted implícitamente para explicar el comportamiento de su producto acaba de adelgazar, justo cuando sus compradores han empezado a pedirlo por escrito. Eso es cierto se resuelva bien o no el debate sobre alineamiento.
La semana pasada produjo dos demandas y una oferta, y apuntan en direcciones opuestas.
La demanda. Las herramientas empresariales ya trazan del prompt a la identidad, a la llamada de herramienta y a la acción de sistema, y bloquean a los agentes que nadie aprobó. Al equipo de seguridad de su comprador le están dando el vocabulario para preguntar qué hizo su agente y por qué, como pregunta de compras y no como pregunta de incidente.
La oferta. El mejor modelo disponible para el trabajo es uno cuyo razonamiento interno es, según la medición de su propio fabricante, menos legible que el del modelo al que sustituye. Si su respuesta a «¿por qué hizo eso?» iba a ser alguna vez «aquí está la cadena de pensamiento», esa respuesta se está depreciando.
No es una razón para evitar Astra. Es una razón para dejar de tratar el autoinforme del modelo como un componente de la rendición de cuentas de su producto, porque usted no controla su legibilidad y va en la dirección equivocada.
El replanteamiento útil es que la rendición de cuentas de un agente nunca fue realmente sobre sus pensamientos. Fue sobre sus efectos.
Nada de esto es consejo nuevo. Lo que cambió es que el recurso de reserva desapareció en silencio: los equipos que se saltaron esto se apoyaban, sin haberlo decidido, en poder preguntarle después al modelo.
Esto no es afirmar que Astra sea inseguro. Por la única cifra que OpenAI ha publicado sobre esto, se comporta bastante mejor que el modelo al que sustituye. Monitorizabilidad y comportamiento son propiedades distintas, y es perfectamente coherente que una mejore mientras la otra retrocede.
«Menos rastros legibles» no es «ningún rastro». Lo publicado sobre la técnica describe una reducción de legibilidad, no la eliminación de una cadena de pensamiento. La versión fuerte —el razonamiento moviéndose por completo al espacio latente— es lo que los investigadores advierten que escalar podría producir, no lo que se ha documentado.
Estoy leyendo un lanzamiento como una dirección. Un modelo, una decisión de arquitectura, una ficha técnica. Si los competidores no siguen, esto es una nota al pie y no una tendencia, y la posición honesta es que lo sabremos dentro de un año. Lo que no es especulativo es el intercambio de este lanzamiento, porque OpenAI lo documentó.
El lanzamiento de Astra es una noticia genuinamente buena para cualquiera que construya software con agentes. Mejor programación, comportamiento notablemente mejor y una empresa dispuesta a publicar la cifra que la deja peor: la caída de monitorizabilidad vino de OpenAI, no de un crítico.
La parte sobre la que conviene actuar es pequeña y estructural. La capacidad de su producto de explicarse tiene que venir ahora de su lado de la frontera. No porque el modelo no sea de fiar, sino porque su legibilidad es una propiedad que usted ni controla ni le prometieron, y se movió en la dirección equivocada la misma semana en que sus compradores obtuvieron las herramientas para empezar a preguntar.
Los fundadores que ya registran llamadas de herramientas, contenidos del contexto y puntos de decisión no perdieron nada esta semana. Los fundadores que pensaban enseñar un rastro de razonamiento cuando alguien acabara preguntando acaban de descubrir que ese plan tiene fecha de caducidad.
Fuentes: TechCrunch, «OpenAI's new reasoning technique alarms AI safety experts» · TechCrunch, «OpenAI launches Astra, its powerful (and controversial) new model» · Implicator.ai sobre la ficha técnica de Astra y la monitorizabilidad · Gizmodo sobre monitorizar cómo piensa el modelo · Las cifras del banco de pruebas, las citas y la descripción de la profundidad recurrente son las publicadas; el argumento sobre dónde debe estar su registro de auditoría, y las cautelas de la sección 6, son míos.
IdeaToMVP Academy
4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.