Ano passado, foi relatado que a OpenAI, a empresa por trás do ChatGPT, teve informações sobre o design do chatbot roubadas.
De acordo com o New York Times, o perpetrador obteve detalhes sobre como a empresa constrói suas ferramentas de IA bisbilhotando um fórum usado por funcionários da OpenAI.
Mas, embora não se acredite que os sistemas usados para construir e executar a IA tenham sido hackeados, o incidente mostrou como os sistemas de IA – e os data centers usados para abrigá-los e treiná-los – são os principais alvos dos invasores cibernéticos.
A razão é simples: à medida que a IA se torna mais integrada em nossas vidas, mais valiosos são os algoritmos por trás da IA e os conjuntos de dados nos quais são treinados. E não apenas as vastas faixas de informações processadas por fornecedores de IA e suas plataformas são extremamente valiosas para criminosos cibernéticos e agentes de ameaças mal-intencionadas, mas também há o risco de que os invasores tentem obter os segredos e o código-fonte que alimentam a IA.
Atacando a IA
Porque, como acontece com qualquer tipo de nova tecnologia, software ou produto, há quem queira se apossar dele por qualquer meio necessário. Isso pode incluir invadir o data center onde está hospedado, seja para fugir com a propriedade intelectual necessária para construir sua própria versão, roubar informações ou realizar uma série de outros atos maliciosos.
"O que você tem é esse valor crescente de dados que estão alojados nesses data centers, então eles estão se tornando um alvo cada vez maior – e cada vez mais o mundo está rodando na infraestrutura que está nesses ambientes", diz Paul Shaver, líder global de segurança de tecnologia operacional do Google Cloud Security.
"Eles se tornaram uma infraestrutura crítica muito rapidamente na maneira como estamos nos inclinando a alavancar cada vez mais a tecnologia de nuvem e IA".
Tal como acontece com outras formas de infraestrutura crítica, os data centers que hospedam ferramentas de IA rapidamente se tornam um alvo muito tentador para os invasores cibernéticos. E embora formas mais tradicionais de infraestrutura crítica, como energia, processamento de alimentos e sistemas de abastecimento de água, possam ser executadas em sistemas isolados, a própria natureza da IA significa que os data centers que a alimentam estão diretamente voltados para a Internet. Mas, embora necessário, isso significa que essa forma de infraestrutura crítica é potencialmente mais vulnerável a invasões não autorizadas.
"Está crescendo a superfície de ataque", diz Shaver. "Você está colocando mais na Internet com mais conectividade nesses ambientes, o que apresenta outro vetor de ataque que precisa ser monitorado, controlado e atualizado".
Naturalmente, os cibercriminosos estão cientes dessa superfície de ataque expandida em torno dos data centers que hospedam IA e estão tentando tirar proveito disso. E com muitos sistemas de IA hospedados em infraestrutura baseada em nuvem, os hackers tentarão explorar as mesmas técnicas que usam para atingir aplicativos baseados em nuvem: como usar ataques de phishing ou falsificação de identidade para obter credenciais legítimas, ou talvez até mesmo entregar malware para fornecer a eles um backdoor secreto no sistema. E eles estão usando cada vez mais ferramentas de IA para ajudar a conduzir ataques.
"Os invasores estão aproveitando a IA para identificar maneiras de explorar esses sistemas, escrever e-mails de phishing e escrever códigos maliciosos", diz Shaver.
Mas também há outro vetor de ameaça a ser considerado ao proteger os data centers que armazenam os modelos: a rede de suprimentos.
"Porque, por sua própria natureza, LLMs e IA são muito dependentes de integrações e APIs, o que significa que há muitas conexões e estruturas de terceiros", diz Michael Adjei, diretor de engenharia de sistemas da Illumio.
"O problema com isso é que a maioria deles é nova. Se você tem algo novo, que não foi testado contra o estresse, é um ponto ideal para as gangues cibernéticas atingirem. Especialmente se você fez muita pesquisa e desenvolvimento para chegar ao ponto em que esse IP é comercial", explica ele.
Mova-se rápido e quebre as coisas (e esqueça de protegê-las)
É uma história tão antiga quanto a tecnologia; quando algo é novo e empolgante, as empresas desejam lançar seu novo produto o mais rápido possível – especialmente se estiverem competindo com rivais por participação de mercado.
Mas a velocidade com que os produtos são lançados no mercado pode resultar em problemas, principalmente em torno da segurança dos sistemas. Infelizmente, é improvável que uma organização que queira garantir que seja a mais rápida no mercado teste todos os aspectos de seu produto, muito menos examine as ferramentas e empresas usadas em sua rede de suprimentos. E isso está criando oportunidades para invasores oportunistas.
"Se eu sou um Estado-nação e vejo que sua empresa está indo bem, colocarei recursos para tentar roubar essas informações, em vez de construí-las do zero", diz Adjei. "Se eles sabem que funciona, podem roubá-lo e torná-lo seu".
O ritmo acelerado em que a IA e os LLMs entraram aos olhos do público e se tornaram ferramentas amplamente utilizadas pelas empresas resultou em uma escassez de GPUs, à medida que os fornecedores de IA as adquiriam para permitir o processamento de alta potência necessário para executar e treinar seus modelos.
Ainda há apenas um punhado de grandes players - liderados pela Nvidia e AMD - que fabricam e fornecem GPUs adequadas para data centers de IA. Um invasor experiente e com bons recursos pode tirar proveito disso corrompendo a rede de suprimentos de uma forma que forneça acesso direto aos data centers.
"Se eu fosse priorizar as maiores preocupações, diria que a maioria das grandes empresas está usando certos fornecedores de LLM e todos estão usando determinado hardware – as GPUs mais sofisticadas, mais novas e mais brilhantes. Se você puder aprender esses fornecedores e hardware de IA, talvez um invasor possa plantar algo na rede de suprimentos", sugere Itamar Golan, CEO e cofundador da Prompt Security.
"Você poderia envenenar o hardware usado para treinar LLMs. Se você puder entrar na rede de suprimentos das GPUs, poderá torná-la vulnerável a certas entradas e palavras-chave e agora poderá assumir o controle do nível do hardware. É algo a se considerar".
Envenenando o fornecimento de dados
O envenenamento de dados ocorre quando um agente mal-intencionado insere intencionalmente dados falsos nos dados de treinamento de uma IA com o objetivo de manipular ou alterar a forma como o modelo opera. Na maioria das vezes, de uma forma projetada para interromper o funcionamento da IA ou induzi-la a liberar dados confidenciais ou prejudiciais.
"Eles podem fazer isso de várias maneiras. Eles podem invadir seu sistema e adicionar amostras falsas. Eles podem usar o que você adiciona, como feedback do cliente, mas intencionalmente distorcê-lo para um comportamento fora da média. Mas, no final, seu modelo está sendo treinado em dados tendenciosos ou impactados maliciosamente", explica Golan.
"As consequências podem variar desde simplesmente não gerar bons resultados porque o conjunto de treinamento é afetado, até ser capaz de gerar conteúdo prejudicial. Pode ser vulnerável a um token secreto que você pode usar para assumir o controle do modelo e outros recursos maliciosos sofisticados".
Proteger os data centers usados para treinar modelos de IA é, portanto, essencial, especialmente à medida que a IA se torna mais amplamente usada nos negócios e na sociedade.
"A IA se tornou onipresente e não podemos realmente optar por não participar dela – portanto, há uma responsabilidade maior dos fornecedores para garantir que ela seja protegida adequadamente", diz Adjei.
"Quer se trate de Estados-nação querendo roubar seu modelo ou de um agente de ameaça querendo usar injeções imediatas para manipular seu modelo, esse risco é real".
Então, quais ações os operadores de data center de IA devem tomar para garantir que sua infraestrutura permaneça protegida contra ataques cibernéticos, envenenamento de dados e outras ameaças? De muitas maneiras, as operadoras devem seguir as mesmas estratégias de segurança cibernética que aquelas que protegem quaisquer outros sistemas ou infraestruturas.
"Pensamos na IA como uma coisa nova – e é muito –, mas a tecnologia como um todo tem o mesmo ciclo de vida de boa higiene de segurança, boas detecções, testando esses recursos contra cenários de ataque do mundo real com base no cenário de ameaças", diz Shaver.
"Não estamos reinventando a roda, a roda está apenas se movendo mais rápido. E assim, voltamos a prestar atenção ao cenário de ameaças, desenvolvendo sua higiene de segurança e defesas contra o que os invasores estão fazendo. Os ataques mudam, as explorações mudam, mas o ciclo de vida da proteção da IA não é diferente", conclui.
Comments