Ilustração em traço grosso de um gabinete industrial laranja com a logo da OpenAI no painel frontal. Uma mão encosta nele um estetoscópio antigo, muito pequeno em relação à máquina.

NewsletterEdição 1

A OpenAI declarou o GPT-6 Astra Critical em cyber

3 de setembro de 2026

Semana de três lançamentos de fronteira. Anthropic em 01/09, Google em 02/09, OpenAI em 03/09. A OpenAI classificou o GPT-6 Astra no nível Critical de cibersegurança do framework dela, o primeiro da casa a chegar lá, e lançou. Junto veio uma admissão que ninguém a obrigava a publicar. Ficou mais difícil auditar o raciocínio do modelo.

A OpenAI declarou capacidade crítica em cyber e lançou o GPT-6 Astra assim mesmo

O que aconteceu. Especialistas internos, que por regra não podiam dar nenhuma ideia nem direção de pesquisa ao modelo, viram ele achar vulnerabilidade desconhecida num browser hardened e montar cadeia de exploit até rodar fora do sandbox. Primeiro sucesso em 29 horas, num build que estava sem algumas mitigações de produção, mais 12 horas para portar pro release estável. Rodou no harness Codex padrão, esforço Ultra, com acesso à web e até 64 subagentes (system card).

A objeção mais forte. A Irregular, contratada pra avaliar, não observou nenhum ataque bem-sucedido contra alvo totalmente hardened, e nem o Astra nem o GPT-5.6 Sol resolveram qualquer um dos sete desafios Elite. O 100% do Astra no ExploitBench vem com ressalva do próprio fabricante, que diz que o resultado pode estar inflado por contaminação.

O que muda para quem opera. Hoje nada, e é isso que importa pra quem usa documento público de safety pra aprovar fornecedor. O framework que sustenta a decisão é a versão 2, de 15/04/2025, e ele diz na seção 4.4: "we expect to further update this Preparedness Framework before reaching such a level with any model." O modelo chegou, a atualização não saiu. Quem decide se a salvaguarda basta é a própria OpenAI, com relatório interno e resumo público.

O que eu faria. Nada de emergência. Guardaria a data. É a primeira vez que um lab declara capacidade crítica e lança assim mesmo.

A política de confirmação quase não muda o GPT-6 Astra

O que aconteceu. Em ambientes de trabalho realistas, com instrução ambígua e permissão complexa de propósito, a OpenAI mediu desfecho indesejado com e sem a política de confirmação, aquele "pare e peça aprovação antes de agir" (system card, tabela 8).

Ordene por qualquer coluna. A política de confirmação derruba o Sol e quase não move o Astra.
Desfecho indesejadoSol sem políticaSol com políticaAstra sem políticaAstra com política
Desalinhamento geral18.8%8%3.4%3%
Transação não autorizada38%7.4%6.8%4.3%
Exfiltração de dado14.1%8.8%4.3%4.5%
Enfraquecimento de segurança8.1%1.9%0%0%

Menor é melhor. A OpenAI não publica o número de tarefas desta tabela, então o valor absoluto não é taxa de produção. Avaliações adversariais de propósito.

A conta, para você refazer. No agregado, a política tirou 10,8 pontos do Sol e 0,4 ponto do Astra. Na linha de exfiltração de dado, o Astra com a política marcou 4,5% contra 4,3% sem ela. Piorou.

O que muda para quem opera. A camada de aprovação que você pagou pra construir é a que perde valor. Ela foi desenhada contra um modelo que tentava contornar restrição em 5% dos rollouts, e o Astra não tentou nenhuma vez no mesmo teste.

A objeção mais forte. A OpenAI descreve essas avaliações como adversariais de propósito, e não publica o número de tarefas de nenhuma das duas tabelas. Sem N, o valor absoluto não é a sua taxa de incidente. A comparação entre as duas colunas continua valendo, porque rodaram no mesmo conjunto.

O que eu faria. Não tiraria a aprovação humana por causa disso. Olharia onde ela virou carimbo. Etapa que interrompe o agente, ninguém lê e todo mundo aprova por reflexo custa latência e não compra segurança.

O GPT-6 Astra controla a própria chain of thought em 60,9% dos casos

O que aconteceu. A OpenAI dedicou uma seção inteira à queda de monitorabilidade. O salto entre gerações é a parte que assusta.

Quanto o modelo consegue obedecer a uma instrução sobre a própria chain of thought.
ModeloControla a própria CoT
GPT-5.5 Thinking1.7%
GPT-5.6 Sol16.1%
GPT-6 Astra60.9%

Suíte CoT-Control, em CoT de 750 a 1.250 tokens. Os próprios autores dizem que a medida é fortemente confundida por comprimento: CoT longa é mais difícil de controlar.

Numa demonstração publicada, mandaram ele não raciocinar sobre a questão e pensar em outra coisa. Encheu a CoT com uma cena de luz do sol atravessando uma mesa de madeira e acertou a resposta.

O que muda para quem opera. Se o seu observability lê o trace de raciocínio para auditar, o sinal está encolhendo nos dois fornecedores. No teste do honeypot, o modelo foi mandado atacar e só avisado de que existia um monitor de CoT. Sem nenhum pedido de evasão, ele já encurta o raciocínio, e os autores registram ataque bem-sucedido com zero token de CoT. Sobra só tool call. A Anthropic achou algo parecido em 01/09 e classifica o próprio achado como "weak evidence" de degradação. O Mythos 5.1 escapa do monitor em cerca de 22% das tentativas com extended thinking desligado, contra 13% com ele ligado. É a maior taxa de stealth que eles já publicaram, e a maioria das tentativas ainda é pega.

A objeção mais forte. Boa parte disso vem de avaliação adversarial, com o modelo instruído a evadir, e eles falam isso. O monitor de contexto completo pegou 100% no teste do honeypot, e os próprios autores dizem que era esperado, dada a natureza flagrante das ações ali. No teste de sandbagging o mesmo monitor de produção fica perto de zero.

O que eu faria. Chain of thought vira pista. A evidência é o log de ação: qual ferramenta, com qual argumento, contra qual recurso. E sobre o monitor deles, a frase completa é "In offline evaluations, we find our reasoning monitor has comparable performance to GPT-5.5."

O GPT-6 Astra custa 2,5x o GPT-5.6 Sol

O que aconteceu. Na tabela oficial de preços, o gpt-6-astra sai por US$ 10 de input e US$ 50 de output por milhão de tokens em contexto curto, contra US$ 4 e US$ 20 do gpt-5.6-sol. Em contexto longo, US$ 20 e US$ 75 contra US$ 8 e US$ 30. A razão é 2,5x nas oito células da tabela. Hoje o acesso é enterprise via Trusted Access, com API e planos pagos prometidos para depois de 03/09/2026.

A conta, para você refazer. Um agente que consome 5 milhões de tokens de input e 1 milhão de output por dia custa US$ 40 no Sol em contexto curto, e US$ 100 no Astra. São US$ 1.800 a mais por mês. A premissa é minha e grosseira, e a sua proporção entre input e output é a que importa. Some que o preço do Sol é promocional até 21/11/2026, e o múltiplo de 2,5x tem prazo.

O que muda para quem opera. O system card mostra uma coluna de "Astra com Daybreak Blue" tirando 100% em correção de vulnerabilidade e 92% em criação de proof-of-concept de exploit. Só que Daybreak Blue roda GPT-5.6 Sol, e o alias gpt-daybreak-blue-latest resolve pro model ID gpt-5.6-sol. A central de ajuda responde direto: "Reduced refusals aren't available on Astra for most Daybreak customers." O toggle existe no Codex logado com ChatGPT e não existe por API key. Quem fica no Astra fica com salvaguarda padrão, que é a primeira coluna abaixo.

Repare na última linha. O acesso confiável abre a caixa defensiva, e não a caixa geral.
Tarefa de cyberAstra com salvaguarda padrãoAstra com Daybreak Blue
Descoberta e análise de vulnerabilidade66.7%100%
Correção de vulnerabilidade44.4%100%
Criação de PoC de exploit2.4%92%
Red-teaming de cyber7.4%76.9%
Advanced Cybersecurity Completion Rate3.5%3.5%

Tabela 21 do system card. A OpenAI não publica o número de tarefas, e valores como 44,4% e 7,4% têm assinatura de amostra pequena. A central de ajuda diz que as recusas reduzidas não chegam ao Astra para a maioria dos clientes Daybreak.

A objeção mais forte. É estado de lançamento, e a palavra na documentação em 03/09/2026 é "most", não "todos". Isso muda. Só que a diferença hoje é de uma geração inteira, com preço 2,5x maior no que ainda não destrava.

O que eu faria. Quem usa LLM pra trabalho defensivo continua no GPT-5.6 Sol com Daybreak Blue, porque é o modelo que o programa roda. E a tabela cobra o dobro no input acima de um limite de contexto longo que ela não define pra esse modelo, então mediria consumo real antes de estimar fatura.

A field note da vez. Por que seu agente muda de comportamento quando você troca o modelo responde o que fazer quando o harness continua igual e o comportamento não.