Segurança da IA: que dados nunca deve partilhar com a inteligência artificial?
Controlar rigorosamente os dados introduzidos é essencial para utilizar as versões de consumo dos modelos de linguagem, pois as informações enviadas para ferramentas de inteligência artificial disponíveis ao público saem do ambiente local do utilizador. Introduzir dados confidenciais na IA implica riscos de fuga de informação, violação de segredos comerciais e incumprimento das regras de proteção de dados pessoais. Por isso, cada interação com estas ferramentas deve ser tratada como se fosse uma publicação acessível ao público.
O que nunca deve introduzir na IA?
Nos modelos disponíveis ao público, não deve introduzir as seguintes categorias de dados:
- dados pessoais – nomes, moradas, números do Cartão de Cidadão, números de telefone ou endereços de e-mail de clientes, colaboradores ou seus;
- registos médicos – históricos clínicos, resultados de exames e diagnósticos de pacientes, sujeitos a regras legais rigorosas, como o RGPD ou a HIPAA;
- informações empresariais confidenciais – relatórios financeiros ainda não publicados, estratégias de marketing, bases de dados de clientes e planos de fusões, aquisições ou despedimentos;
- segredos comerciais – código-fonte de software, fórmulas de produção, algoritmos exclusivos ou documentação técnica interna da empresa;
- palavras-passe e credenciais – chaves API, dados de acesso, tokens de autenticação, dados de cartões de pagamento e quaisquer chaves de encriptação;
- materiais protegidos por direitos de autor – textos integrais de livros, artigos científicos pagos ou guiões para os quais não possui as licenças necessárias;
- conteúdos ilegais – materiais que promovam a violência ou o ódio, bem como instruções para atividades contrárias à lei aplicável.
O que acontece aos dados introduzidos na inteligência artificial?
Os dados enviados aos fornecedores de serviços na nuvem passam por várias etapas de tratamento e análise. O ciclo de vida dessas informações não se limita à geração de uma resposta.
Treino dos modelos
Os dados introduzidos nas versões de consumo padrão das ferramentas de IA generativa são frequentemente utilizados para continuar a treinar os modelos. Isto significa que as informações fornecidas podem influenciar os parâmetros da rede neuronal e, em teoria, voltar a surgir numa resposta gerada para outro utilizador.
Revisão humana e moderação
Além do tratamento automatizado, os sistemas de IA têm filtros de segurança. Se um algoritmo considerar uma pergunta suspeita, por exemplo, por poder violar os termos de utilização, a conversa pode ser sinalizada e encaminhada para revisão humana. Nesse caso, colaboradores do fornecedor ou revisores externos, conhecidos como anotadores de dados, podem ter acesso direto ao conteúdo introduzido para ajudar a melhorar os mecanismos de moderação.
Armazenamento de dados e cópias de segurança
Os fornecedores de IA guardam registos das conversas nos seus servidores para assegurar a continuidade do serviço, diagnosticar erros e preservar o contexto para sessões futuras. Importa notar que apagar uma conversa na interface raramente significa que a informação é imediatamente eliminada dos servidores. Os dados podem permanecer durante algum tempo nos sistemas de cópias de segurança do fornecedor, aumentando o risco de exposição de informações confidenciais em caso de ciberataque bem-sucedido à infraestrutura na nuvem.
Contas pessoais e empresariais: diferenças na proteção
O nível de segurança da IA varia consideravelmente consoante o tipo de subscrição e a forma como a ferramenta é implementada.
As contas pessoais padrão, gratuitas ou pagas de muitos serviços populares tratam, por predefinição, as informações enviadas para fins de treino. Assim, se forem partilhados recursos confidenciais, cada sessão pode originar uma divulgação não controlada.
Nos ambientes empresariais — por exemplo, contas Enterprise ou serviços disponibilizados em nuvens privadas através das API de fornecedores como Microsoft Azure, AWS ou Google Cloud —, as normas de proteção são mais rigorosas. Os fornecedores asseguram a conformidade com normas de segurança, como ISO 27001 e SOC 2, e com o RGPD. Além disso, declaram contratualmente, através de SLA e DPA, que os dados dos clientes não são utilizados para treinar modelos públicos de base. Nestes ambientes, as restrições aos dados introduzidos podem ser menos apertadas, mas continuam a exigir políticas de gestão de riscos e controlo de acessos.
O que pode introduzir na IA com segurança?
Apesar das várias restrições, há muitas informações que podem ser fornecidas e tratadas pela IA sem preocupações especiais. Entre elas estão:
- materiais disponíveis ao público – artigos de acesso livre, publicações em blogues, relatórios de mercado públicos, legislação ou conteúdos de sítios na Internet, como a Wikipédia;
- informações não confidenciais – instruções gerais, perguntas sobre conceitos teóricos, regras gramaticais e ortográficas, equações matemáticas ou consultas de vocabulário;
- excertos de documentação anonimizados – modelos de cartas e contratos ou fragmentos de código dos quais tenham sido removidas todas as variáveis identificáveis, chaves, nomes de clientes e referências à arquitetura interna;
- textos criativos da sua autoria – rascunhos de e-mails, publicações para redes sociais, planos de apresentações ou artigos sem dados empresariais sensíveis;
- conjuntos de dados abertos – dados sintéticos ou estatísticas de repositórios públicos, utilizados para aprender a analisar e formatar informação.
Como anonimizar eficazmente mensagens e dados antes de os enviar à IA?
Antes de enviar documentos confidenciais a um modelo de linguagem, é necessário prepará-los e remover as informações sensíveis. Desta forma, pode trabalhar com o texto sem expor dados confidenciais.
Substituição de identificadores e tokenização
A tokenização consiste em substituir dados sensíveis por identificadores fictícios. Por exemplo, pode trocar o nome «João Silva» por «[Cliente_1]» e «Empresa ABC» por «[Organizacao_A]». Assim, o modelo de linguagem conserva a estrutura, a sintaxe e o contexto do documento, sem conseguir identificar a pessoa ou entidade original.
Técnicas de ocultação de informações sensíveis
A ocultação consiste em esconder diretamente sequências de caracteres críticas, geralmente substituindo-as por símbolos especiais, como no número de cartão 4532 **** **** ****. Outra técnica eficaz é generalizar os dados: em vez de indicar um valor exato, como um salário de 3 200 EUR, apresenta-se um intervalo, como «salário entre 3 000 e 4 000 EUR». Isto reduz o risco de reidentificação.
Automatização do processo com ferramentas DLP e RegEx
A remoção manual de informações em textos longos está sujeita a falhas. Em contextos profissionais, utilizam-se scripts baseados em expressões regulares (RegEx) ou sistemas DLP (Data Loss Prevention). Estas ferramentas podem analisar automaticamente uma instrução antes do envio e detetar, bloquear ou substituir sequências que correspondam a formatos de números do Cartão de Cidadão, NIF, endereços de e-mail ou números de contas bancárias.
Como impedir que os seus dados sejam usados para treinar modelos de IA?
Configurar a própria ferramenta também ajuda a reduzir os riscos associados ao envio de informações para a IA. A maioria dos fornecedores permite desativar a utilização dos conteúdos para treino.
- ChatGPT (OpenAI) – nas definições da conta (Settings), em «Data controls», encontra a opção «Improve the model for everyone». Desativá-la impede a utilização de novos textos introduzidos para treinar o modelo. Na versão atual da interface, esta alteração não remove as conversas da vista do utilizador: o histórico mantém-se. Independentemente desta definição, a OpenAI conserva os registos nos seus servidores durante 30 dias para fins de segurança e deteção de abusos, antes de os eliminar definitivamente.
- Gemini (Google) – nas definições de privacidade, deve desativar «Gemini Apps Activity». As novas conversas deixam de ser guardadas na conta Google e de ser utilizadas para treinar modelos. No entanto, esta alteração não elimina imediatamente os registos da infraestrutura do fornecedor: a Google conserva-os durante um máximo de 72 horas para proteger a segurança do serviço.
- Claude (Anthropic) – nas versões de consumo gratuitas e padrão, as definições atuais permitem, por predefinição, utilizar os dados introduzidos para melhorar os algoritmos. Trata-se de uma mudança significativa face à fase inicial da empresa, quando a Anthropic salientava que não usava as conversas dos utilizadores para treino. Para desativar esta utilização, aceda à secção de privacidade nas definições da conta e desligue a opção de partilha de dados «Help improve Claude».
Tenha em conta que as alterações às definições de privacidade e a desativação do treino só produzem efeitos futuros. As informações enviadas anteriormente que já tenham sido incorporadas no processo de treino não são retiradas dos parâmetros do modelo.
Resumo
- Cada interação com versões de consumo de ferramentas de IA deve ser tratada como uma publicação acessível ao público. Não introduza dados pessoais, registos médicos, palavras-passe ou segredos comerciais.
- As informações enviadas podem passar por várias etapas de tratamento, incluindo treino de modelos, moderação e armazenamento em cópias de segurança nos servidores do fornecedor.
- A anonimização prévia, a ocultação de dados sensíveis, a tokenização e as ferramentas DLP ajudam a trabalhar com modelos de IA de forma mais segura.
- As contas Enterprise e os ambientes empresariais dedicados oferecem normas de proteção mais rigorosas e condições contratuais que impedem a utilização dos dados dos clientes para treinar modelos públicos.
- Alterar as definições de privacidade e desativar a utilização de dados para treino só produz efeitos futuros: não remove informações já incorporadas no treino do modelo.
Deixe um comentário