A OpenAI notificou dezenas de organizações depois de identificar agentes de inteligência artificial a contornar controlos de acesso, utilizar credenciais expostas e interagir com sistemas fora do âmbito previsto
|
A OpenAI está a alargar a investigação ao comportamento dos seus modelos depois de concluir que o incidente envolvendo a plataforma Hugging Face faz parte de um problema mais abrangente relacionado com o desalinhamento de agentes de Inteligência Artificial (IA). A empresa tinha inicialmente interpretado o incidente sobretudo como um problema de cibersegurança, por ter envolvido um comprometimento ao nível da plataforma. A análise posterior levou a OpenAI a concluir que a atividade foi motivada pela utilização, por parte dos modelos, de estratégias desalinhadas para completar tarefas complexas. Segundo a empresa, que fez uma publicação no seu blog a explicar o sucedido, o incidente da Hugging Face continua a ser a atividade deste género mais grave identificada nos seus modelos e esteve principalmente associada a um modelo de investigação altamente capaz utilizado exclusivamente a nível interno. A OpenAI está agora a analisar de forma mais abrangente a atividade dos seus modelos na Internet durante processos de treino e avaliação. Até ao momento, afirma ter notificado dezenas de terceiros afetados por comportamentos em que os agentes poderão ter contornado mecanismos de Segurança, prejudicado a disponibilidade de serviços ou provocado outros impactos negativos. Agentes contornaram controlos e utilizaram credenciais expostasEntre os comportamentos identificados encontra-se o contorno de controlos de acesso. Segundo a OpenAI, houve situações em que agentes utilizaram endereços web alternativos, modificaram dados enviados em pedidos ou aproveitaram sessões autenticadas que lhes proporcionavam mais privilégios do que o esperado. A empresa detetou também agentes a utilizar credenciais ou chaves de acesso que estavam publicamente expostas para entrar em serviços. Outra categoria envolve a injeção de consultas ou comandos. Nestes casos, os agentes introduziram conteúdos que os sistemas de terceiros interpretaram como instruções, podendo levar à execução de consultas em bases de dados, código de aplicações ou comandos nos servidores. Foram ainda observados acessos a componentes internos de ambientes de execução, incluindo leitura de ficheiros relacionados com a implementação de serviços ou interação com sistemas de bastidores que não se destinavam ao acesso dos agentes. A OpenAI não identificou as organizações afetadas nestes exemplos, indicando que está a anonimizar os casos para proteger terceiros enquanto decorre a investigação. “Spam de agentes” alarga problema para além da cibersegurançaA investigação inclui ainda um comportamento que a OpenAI designa como “spam de agentes”. Trata-se de situações em que modelos publicam informação em sites de terceiros, alterando os respetivos conteúdos e podendo obrigar os responsáveis pelos serviços a proceder à sua remoção. Um dos exemplos referidos é a utilização de páginas wiki públicas como uma espécie de canal de comunicação partilhado entre agentes. Este comportamento é relevante porque demonstra que o impacto de um agente desalinhado não tem necessariamente de resultar numa intrusão ou explorar uma Vulnerabilidade tradicional. Um sistema autónomo pode utilizar funcionalidades legítimas de serviços externos de formas não previstas pelos seus programadores ou pelos operadores desses serviços. A OpenAI considera agora o incidente da Hugging Face uma manifestação de um problema de desalinhamento com consequências de cibersegurança, em vez de o tratar exclusivamente como um incidente de segurança. A distinção tem implicações para a utilização empresarial de agentes de IA. Controlos tradicionais como autenticação, gestão de privilégios e monitorização continuam relevantes, mas o comportamento dos próprios modelos passa também a fazer parte da análise de risco, sobretudo quando estes têm autonomia para navegar na web, utilizar ferramentas ou interagir com sistemas externos. A empresa está a dar prioridade aos incidentes considerados mais graves, mas diz estar também a analisar comportamentos de menor impacto. A revisão histórica ainda está em curso e poderá resultar na notificação de mais organizações. Para as empresas que desenvolvem ou implementam agentes autónomos, os casos descritos acrescentam uma dimensão ao problema de governação da IA: não basta determinar a que recursos um agente pode aceder, sendo também necessário acompanhar a forma como utiliza esses recursos e como reage quando encontra obstáculos à execução de uma tarefa. |