Computação confidencial em GPU: por que ela muda o que é possível

Por mais de uma década, ambientes de execução confiáveis protegeram apenas a CPU. Com Hopper e Blackwell, a proteção chegou ao acelerador, e isso muda quem pode treinar modelos sobre quais dados.

Equipe Data Pelago5 min de leitura

Criptografia protege dados em repouso e em trânsito há décadas. O elo fraco sempre foi o terceiro estado: dados em uso. Para treinar um modelo, os dados precisam ser decifrados em memória, e quem controla a máquina (o provedor de nuvem, o administrador do hipervisor, qualquer processo com privilégio suficiente) pode, em princípio, lê-los. Computação confidencial é a disciplina de fechar esse elo com hardware, não com contratos.

Uma década de enclaves na CPU

A primeira geração popular veio com o Intel SGX, que isolava pequenos enclaves dentro de um processo. Funcionava, mas com memória protegida limitada e um modelo de programação exigente: era preciso reescrever a aplicação em torno do enclave. A segunda onda mudou a granularidade. AMD SEV-SNP e Intel TDX protegem máquinas virtuais inteiras, cifrando a memória da VM com chaves que o hipervisor não conhece e oferecendo atestação remota do estado inicial.

Essa evolução resolveu boa parte do problema para cargas de CPU. Só que IA moderna não roda na CPU. Enquanto a GPU ficava fora do perímetro, tudo o que era enviado ao acelerador (pesos, ativações, lotes de treinamento) saía da zona protegida e trafegava em claro pelo barramento.

Hopper abriu a porta; Blackwell escancarou

A NVIDIA H100 foi a primeira GPU com computação confidencial. Em modo confidencial, a GPU passa a fazer parte da VM confiável: a memória da placa fica protegida contra acesso externo, as transferências entre CPU e GPU são cifradas e a própria GPU emite um relatório de atestação assinado por chaves gravadas no silício.

A primeira geração tinha um custo conhecido: o tráfego cifrado passava por buffers intermediários, e a comunicação entre várias GPUs virava gargalo. A arquitetura Blackwell ataca exatamente esse ponto. Com suporte a TEE-I/O e proteção dos links NVLink, várias GPUs operam em modo confidencial como um único domínio, e a NVIDIA reporta throughput praticamente idêntico ao do modo não cifrado. Num GB300 NVL72 (72 GPUs Blackwell Ultra e 36 CPUs Grace, NVLink de 5ª geração a 1,8 TB/s por GPU e 288 GB de HBM3e por GPU), isso significa treinar modelos grandes inteiros dentro de um perímetro atestado.

Como funciona a atestação remota

A proteção só vale se quem envia os dados puder verificá-la antes de enviar. Esse é o papel da atestação remota. O fluxo que usamos segue quatro passos:

  • Raiz de confiança em hardware. CPU e GPU carregam chaves de identidade gravadas na fabricação e certificadas pelo fabricante.
  • Medições. Firmware, drivers, imagem da VM e o código de treinamento são medidos por hash durante a inicialização e registrados em relatórios assinados.
  • Verificação independente. Um verificador compara essas medições com valores de referência aprovados por cada participante, e não pela Data Pelago.
  • Liberação condicionada de chaves. Só depois da verificação o serviço de chaves de cada instituição libera a chave que decifra seus dados, e apenas para aquela execução.

Se qualquer medição divergir (um driver diferente, uma imagem alterada, uma linha de código fora da política), a chave não é liberada. Não existe exceção manual, e esse é justamente o ponto.

Contra quem isso protege, e contra quem não

O que importa é o modelo de ameaça. Com a VM confidencial e a GPU em modo confidencial, ficam do lado de fora o operador da nuvem, o hipervisor, o sistema operacional do host, quem tem acesso físico ao rack e a própria Data Pelago como operadora da plataforma. Nenhum desses atores consegue ler os dados decifrados na memória.

Honestidade também faz parte da arquitetura. Computação confidencial não é mágica, e tratamos seus limites como requisitos de projeto:

  • Canais laterais existem e continuam sendo pesquisados. Mitigá-los exige firmware atualizado, isolamento de recursos e redução contínua da superfície de ataque.
  • O modelo pode vazar o que aprendeu. Proteger a memória não impede que pesos ou saídas memorizem registros individuais. Por isso aplicamos privacidade diferencial no treinamento e limites de agregação nas saídas.
  • A raiz de confiança é do fabricante. Confiar na atestação significa confiar nas chaves e na cadeia de certificação do fornecedor do hardware.

Por que isso define nossa infraestrutura

A Data Pelago existe porque essa combinação de hardware existe. Sem GPU confidencial, treinar sobre dados de várias instituições exigiria reunir os dados em algum lugar visível, exatamente o que a regulação e o bom senso proíbem. Com Hopper, isso se tornou possível. Com Blackwell, tornou-se viável em escala e sem pedágio de desempenho.

O perímetro de confiança precisa ser tão grande quanto o modelo.

É por isso que rodamos em GPUs de última geração. Não por vaidade de especificação, mas porque é o único hardware em que confidencialidade e escala deixam de ser uma escolha entre uma coisa e outra.