De 22% para 2,4% em segurança. A monitorabilidade foi no sentido oposto, e a OpenAI chamou a queda de séria

Surya Pratap
By Surya Pratap

8 de setembro de 2026

11 min de leitura

IA e tecnologia
As duas direções do system card do Astra colocadas lado a lado: à esquerda o que melhorou, o comportamento indesejado caindo de 22% no GPT-5.6 Sol para 2,4% no Astra no benchmark interno de segurança da própria OpenAI, com o Astra colocado à frente do Sol e do Fable em encontrar bugs, execução em terminal e perguntas sobre a base de código, e à direita o que piorou, a profundidade recorrente que processa a mesma consulta em laço em vez de escrever o raciocínio em passos, deixando menos rastros legíveis, e uma queda de monitorabilidade que a própria OpenAI chamou de sériaDois números, direções opostasHover to explore
Mais seguro de rodar e mais difícil de explicar, do mesmo documento. Só uma dessas metades foi contada como a notícia.

Ontem escrevi sobre as empresas ganhando ferramentas para inventariar todos os agentes de uma máquina e bloquear os que ninguém aprovou — uma semana em que a pergunta passou a ser me mostre o que este agente fez, e quem deixou.

Dois dias antes, a fronteira andou no sentido oposto.

A OpenAI lançou o Astra em 3 de setembro. É, segundo eles, o melhor modelo de engenharia de software que já construíram, e se comporta visivelmente melhor que o antecessor. Ele também raciocina de um jeito que deixa menos rastros legíveis, e o próprio system card da OpenAI diz que a monitorabilidade caiu. Chamaram a queda de séria.

1. O que o system card realmente diz

Astra, conforme relatado e conforme documentado

Duas direções no mesmo lançamento, ambas vindas da OpenAI

  • O comportamento indesejado caiu de 22,0% para 2,4% no benchmark interno de segurança da OpenAI, comparando GPT-5.6 Sol com Astra. Menor é melhor; é uma melhora grande e real.
  • O Astra é colocado à frente do Sol e do Fable da Anthropic em encontrar bugs, execução em terminal e perguntas sobre a base de código — apresentado como o melhor modelo de engenharia de software até hoje.
  • Ele usa profundidade recorrente, também chamada de recorrência opaca: o modelo processa a mesma consulta várias vezes em laço em vez de deixar um registro convencional e sequencial de cadeia de pensamento.
  • O resultado, conforme relatado, é que ele deixa menos rastros legíveis do que o raciocínio sequencial que substitui.
  • O system card da OpenAI confirma que a monitorabilidade é menor que a de modelos anteriores, e a empresa chamou a queda de séria.
  • O acesso começou pelos clientes do programa de cibersegurança Daybreak, depois os planos Pro, Plus, Enterprise e Business mais a API — uma capacidade significativa o bastante para que a ordem de liberação fosse, ela mesma, uma decisão de segurança.

Jakub Pachocki, cientista-chefe da OpenAI, colocou a tensão sem rodeios: "Meio que tomamos essa visibilidade como garantida, e estamos vendo que, conforme as capacidades dos modelos aumentam, a monitorabilidade fica mais difícil." Ele também disse que preservar o monitoramento da cadeia de pensamento é um objetivo central desde os primeiros modelos de raciocínio deles, o que leio como sincero e não resolvido, mais do que contraditório.

2. A troca, dita sem enfeite

Tire a linguagem de lançamento e o formato é simples.

Ele se comporta mal menos vezes. Ele se explica menos. As duas coisas são verdade.

Não são opostos, e a primeira não substitui a segunda. Um modelo que se comporta bem nove em cada dez vezes e não consegue dizer por quê é um objeto operacional diferente de um que se comporta pior mas deixa um registro legível. O segundo é depurável. O primeiro precisa ser medido de fora.

Pesquisadores de segurança reagiram à segunda metade. Buck Shlegeris, da Redwood Research, disse estar "extremamente preocupado com os relatos de que o Astra usa recorrência opaca", alertando que escalar mais a técnica destruiria a monitorabilidade da cadeia de pensamento. Seu colega Ryan Greenblatt descreveu o ponto final como um modelo que raciocina quase inteiramente em espaço latente. Zvi Mowshowitz argumentou que isso quebra uma norma que os laboratórios se esforçaram para estabelecer.

Por que não trato isto como uma pauta de segurança

Essas preocupações são sobre supervisão de modelos de fronteira, e não cabe a mim julgá-las. O fato relevante para fundadores que está por baixo é mais estreito e mais difícil de contestar: o artefato em que você implicitamente se apoiava para explicar o comportamento do seu produto acabou de afinar, no exato momento em que os seus compradores começaram a pedi-lo por escrito. Isso é verdade independentemente de o debate sobre alinhamento se resolver bem ou não.

3. Por que o momento importa mais do que a técnica

A semana passada produziu duas demandas e uma oferta, e elas apontam em direções opostas.

A demanda. As ferramentas corporativas agora rastreiam do prompt à identidade, à chamada de ferramenta e à ação de sistema, e bloqueiam agentes que ninguém aprovou. O time de segurança do seu comprador está recebendo o vocabulário para perguntar o que o seu agente fez e por quê, como pergunta de compras e não como pergunta de incidente.

A oferta. O melhor modelo disponível para o trabalho é um cujo raciocínio interno é, pela medição do próprio fabricante, menos legível que o do modelo que ele substitui. Se a sua resposta para "por que ele fez isso" um dia seria "aqui está a cadeia de pensamento", essa resposta está se depreciando.

Isto não é motivo para evitar o Astra. É motivo para parar de tratar o autorrelato do modelo como componente da prestação de contas do seu produto, porque você não controla a legibilidade dele e ela está indo na direção errada.

4. Se você distribui produtos de agentes

A auditabilidade para o harness

Mova
Tudo o que é defensável sobre o comportamento do seu agente deveria ser algo que você registrou, não algo que o modelo narrou: entradas lidas, ferramentas chamadas com argumentos, arquivos tocados, chamadas externas feitas, o que mudou. Esse log é seu, é estável quando você troca de modelo, e é o que um revisor de fato quer.

De entregar texto de raciocínio como prova

Pare
Mostrar a explicação de um modelo na sua interface é ótimo como recurso de produto. Tratá-la como registro de auditoria sempre foi frágil — é um artefato gerado, não uma transcrição do cálculo — e a profundidade recorrente torna essa lacuna explícita em vez de criá-la.

Resultados, repetidamente

Meça
Quando você não consegue inspecionar o raciocínio, a alavanca que resta é rodar a mesma tarefa muitas vezes e olhar a dispersão. Essa é a disciplina por trás de rodar 507 tarefas de agente vinte vezes cada: uma passada não diz quase nada, vinte dizem o que você realmente entrega.

Portabilidade de modelo

Assuma
Qualquer coisa que você construa assumindo que o raciocínio é inspecionável é uma aposta em uma arquitetura. Mantenha a fronteira entre o seu harness e o modelo limpa o bastante para trocar pelo melhor do próximo trimestre sem que a sua história de logging mude.

5. O que registrar quando o modelo não vai contar

O reenquadramento útil é que a prestação de contas de um agente nunca foi realmente sobre os pensamentos dele. Foi sobre os efeitos dele.

O grafo completo de chamadas

Registre
Cada invocação de ferramenta com seus argumentos e resultado, em ordem, com a identidade sob a qual a chamada rodou. É a mesma forma que as ferramentas corporativas agora constroem de fora — capturá-la você mesmo significa poder responder à pergunta antes que outra pessoa precise reconstruí-la.

O que entrou no contexto

Registre
Quais arquivos, documentos, recuperações e instruções de terceiros estavam na janela a cada passo. Quando algo dá errado, a entrada que causou isso costuma ser muito mais informativa do que qualquer explicação sobre isso, e é um fato em vez de uma geração.

Os pontos de decisão

Registre
Onde o agente escolheu entre ramos, onde ele tentou de novo, onde um humano aprovou. Você não consegue registrar por que ele escolheu, mas consegue registrar que havia uma escolha e para que lado ela foi — o que é a maior parte do que uma investigação precisa.

Nada disso é conselho novo. O que mudou é que a alternativa de reserva sumiu em silêncio: times que pularam isso estavam se apoiando, sem terem decidido, em poder perguntar ao modelo depois.

6. O que eu não concluiria

Isto não é afirmar que o Astra é inseguro. Pelo único número que a OpenAI publicou a respeito, ele se comporta consideravelmente melhor que o modelo que substitui. Monitorabilidade e comportamento são propriedades diferentes, e é perfeitamente coerente que uma melhore enquanto a outra regride.

"Menos rastros legíveis" não é "nenhum rastro". O que foi relatado sobre a técnica descreve uma redução de legibilidade, não a eliminação de uma cadeia de pensamento. A versão forte — o raciocínio migrando inteiramente para o espaço latente — é o que os pesquisadores alertam que escalar poderia produzir, não o que foi documentado.

Estou lendo um lançamento como uma direção. Um modelo, uma escolha de arquitetura, um system card. Se os concorrentes não seguirem, isto é uma nota de rodapé e não uma tendência, e a posição honesta é que saberemos daqui a um ano. O que não é especulativo é a troca neste lançamento, porque a OpenAI a documentou.

O resumo honesto

O lançamento do Astra é genuinamente boa notícia para quem constrói software com agentes. Programa melhor, se comporta visivelmente melhor, e é uma empresa disposta a publicar o número que a deixa pior — a queda de monitorabilidade veio da OpenAI, não de um crítico.

A parte sobre a qual agir é pequena e estrutural. A capacidade do seu produto de se explicar precisa vir do seu lado da fronteira agora. Não porque o modelo seja pouco confiável, mas porque a legibilidade dele é uma propriedade que você não controla nem lhe foi prometida, e que andou na direção errada na mesma semana em que os seus compradores ganharam as ferramentas para começar a perguntar.

Fundadores que já registram chamadas de ferramentas, conteúdo de contexto e pontos de decisão não perderam nada nesta semana. Fundadores que planejavam mostrar um rastro de raciocínio quando alguém enfim perguntasse acabaram de descobrir que esse plano tem prazo de validade.

Fontes: TechCrunch, "OpenAI's new reasoning technique alarms AI safety experts" · TechCrunch, "OpenAI launches Astra, its powerful (and controversial) new model" · Implicator.ai sobre o system card do Astra e a monitorabilidade · Gizmodo sobre monitorar como o modelo pensa · Os números do benchmark, as citações e a descrição da profundidade recorrente são os relatados; o argumento sobre onde a sua trilha de auditoria deve ficar, e as ressalvas da seção 6, são meus.

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :