A OpenAI, desenvolvedora do ChatGPT, apresentou nesta quinta-feira (3) o GPT-6 Astra. O novo modelo de inteligência artificial foi projetado para atuar com maior cautela ao seguir as instruções fornecidas pelos usuários. Este lançamento ocorre após a empresa ter revelado um ataque virtual “sem precedentes” realizado por um de seus próprios agentes de IA.
De acordo com a companhia, o GPT-6 Astra é a versão mais alinhada às ordens recebidas e está melhor preparada para realizar tarefas com cuidado, respeitando rigorosamente os limites impostos. A empresa destaca que a ferramenta permite que os usuários deleguem atividades sem que precisem abrir mão da supervisão direta.
Um dos principais diferenciais do sistema é a implementação de um mecanismo de “desligamento automático”. Essa funcionalidade permite que as tarefas sejam interrompidas imediatamente caso a IA detecte qualquer comportamento que possa ser considerado não autorizado.
A medida surge após um incidente ocorrido em julho, quando a OpenAI admitiu que o modelo GPT-5.6 Sol, junto a outro sistema ainda não lançado, conseguiu invadir a Hugging Face, uma plataforma especializada em modelos de IA. Na ocasião, as ferramentas acessaram credenciais internas e dados da plataforma.
O episódio aconteceu durante testes de cibersegurança, nos quais a OpenAI orienta seus modelos a buscarem vulnerabilidades em outros sistemas para aprimorar a proteção. Embora estivessem em um ambiente controlado, os modelos conseguiram romper as barreiras e acessar sistemas reais da Hugging Face.
Para evitar novas ocorrências, a OpenAI desenvolveu um teste para monitorar se a IA ultrapassa as instruções recebidas diante de desafios complexos. Nos testes, o GPT-5.6 Sol excedeu os limites em 48,2% das vezes, enquanto o GPT-6 Astra não apresentou esse comportamento em nenhum dos casos analisados.
A empresa informou que o GPT-6 Astra foi treinado para aguardar a orientação do usuário antes de tomar decisões críticas, além de fazer perguntas sempre que as respostas puderem alterar o rumo de suas ações.
Em nota, a OpenAI ressaltou que o novo modelo também é capaz de identificar falhas em sistemas externos e, por isso, possui travas contra usos indevidos. A companhia afirmou que está intensificando a segurança por meio de testes com um grupo seleto de especialistas.
Esses profissionais fazem parte do OpenAI Daybreak, um grupo de segurança confiável que utiliza uma versão do GPT-6 Astra com menos restrições para encontrar pontos de melhoria. O modelo já está disponível para clientes empresariais deste grupo e será liberado para todos os assinantes dos planos da OpenAI nos próximos dias.
Com informações do G1