OpenAI eleva capacidades de segurança com GPT-6 Astra

A OpenAI apresentou o GPT-6 Astra, o seu primeiro modelo a atingir o nível Critical em capacidades de cibersegurança, levando a empresa a reforçar as medidas de proteção e monitorização

OpenAI eleva capacidades de segurança com GPT-6 Astra
Squtye / AdobeStock

A OpenAI acaba de anunciar o GPT-6 Astra. A empresa descreve este modelo como o mais capaz que já disponibilizou de forma alargada e o primeiro a atingir o nível Critical em capacidades de cibersegurança, de acordo com o Preparedness Framework da empresa.

Segundo a OpenAI, com as ferramentas e os acessos adequados, o novo modelo consegue encontrar vulnerabilidades de segurança até então desconhecidas e desenvolver novas formas de as explorar em vários sistemas bem protegidos, sem necessitar de orientação humana em cada etapa.

O aumento das capacidades levou a empresa a reforçar as medidas destinadas a impedir ações cibernéticas prejudiciais, quer resultem de utilização maliciosa, quer de comportamentos desalinhados do próprio modelo.

Entre as medidas implementadas encontram-se um maior isolamento dos sistemas, encriptação de checkpoints, monitorização integral das trajetórias e avaliações de alinhamento obrigatórias antes da utilização interna.

Mais resistente a jailbreaks

Apesar do aumento das capacidades ofensivas, a OpenAI afirma que o GPT-6 Astra apresenta uma maior robustez de segurança do que o GPT-5.6 Sol.

A empresa diz ter introduzido novas técnicas de treino que tornam o Astra significativamente mais resistente a jailbreaks, incluindo durante sequências de interação mais prolongadas. Foram também realizados novos exercícios internos e externos de red teaming.

Para utilizadores identificados como potencialmente de maior risco, o modelo pode ainda adotar limites de recusa mais conservadores perante pedidos que envolvam utilizações de duplo uso.

A OpenAI afirma também ter observado melhorias no alinhamento. Numa simulação baseada em mais de 54 mil tarefas internas do Codex, o Astra recebeu aproximadamente metade das sinalizações associadas a comportamentos desalinhados de maior severidade registadas pelo GPT-5.6 Sol.

A evolução traz, contudo, um novo desafio, uma vez que a OpenAI reconhece que a monitorização do GPT-6 Astra é agora mais difícil em comparação com o antecessor.

Nos testes realizados, o modelo demonstrou maior capacidade para controlar o seu próprio chain of thought e menor propensão para incluir nessa informação elementos que permitam identificar comportamentos problemáticos.

Em avaliações adversariais nas quais foi especificamente treinado a evitar mecanismos de monitorização, o Astra conseguiu permanecer indetetado ao reduzir deliberadamente o seu desempenho em determinados testes, prática conhecida como sandbagging. Em alguns cenários, conseguiu também contornar monitores internos durante tarefas de sabotagem.

A OpenAI salienta que estes resultados foram obtidos sobretudo em condições adversariais criadas especificamente para testar a evasão e afirma não ter encontrado indícios de raciocínio esteganográfico.

Ainda assim, a empresa considera que os resultados demonstram a necessidade de desenvolver técnicas de auditoria de alinhamento que não dependam exclusivamente da análise do chain of thought.

Monitorização alargada às utilizações com ferramentas

Como camada adicional de proteção, a OpenAI passou a aplicar mecanismos de deteção de comportamentos desalinhados a todas as inferências do Astra que envolvam utilização de ferramentas na disponibilização externa do modelo.

A empresa destaca ainda melhorias na resistência a ataques de prompt injection e afirma que o Astra demonstrou uma menor propensão para executar ações não autorizadas ou potencialmente destrutivas em testes que simulam utilização de browsers e ambientes profissionais.

Tags

NOTÍCIAS RELACIONADAS

RECOMENDADO PELOS LEITORES

REVISTA DIGITAL

IT INSIGHT Nº 62 JULHO 2026

IT INSIGHT Nº 62 JULHO 2026

NEWSLETTER

Receba todas as novidades na sua caixa de correio!

O nosso website usa cookies para garantir uma melhor experiência de utilização.