Antifraude interbancário sem compartilhar um único dado

Golpes modernos atravessam várias instituições em segundos. Mostramos como uma rede neural de grafos, treinada em enclave confidencial, enxerga o que nenhum banco vê sozinho.

Equipe Data Pelago5 min de leitura

Pagamentos instantâneos mudaram a velocidade da fraude. Com o Pix, o dinheiro de uma vítima pode passar por várias contas, em instituições diferentes, em questão de segundos. Quadrilhas usam contas laranja espalhadas por bancos distintos justamente porque sabem que cada instituição enxerga apenas o trecho da rota que passa por ela.

O ponto cego de cada banco

Do ponto de vista de um único banco, uma conta laranja costuma parecer comum: recebe uma transferência, repassa em seguida, tem pouco histórico. O padrão suspeito só aparece no grafo completo, no leque que parte da vítima, se espalha por várias contas e converge para poucos destinos. Esse grafo não existe em lugar nenhum, porque está fatiado entre as instituições.

Reunir os dados resolveria o problema técnico e criaria outro, jurídico. O sigilo bancário (Lei Complementar nº 105/2001) restringe o compartilhamento de informações de clientes, e a LGPD exige finalidade, necessidade e base legal para cada tratamento. Um data lake interbancário com todas as transações é, na prática, inviável, além de ser um alvo valioso demais para existir.

O grafo inteiro, sem que ninguém o veja

A abordagem da Data Pelago inverte o fluxo. Em vez de levar os dados a um lugar central visível, levamos o treinamento a um enclave confidencial que nenhum operador consegue inspecionar. Cada banco envia suas transações cifradas, com identificadores pseudonimizados por uma chave que só existe dentro do enclave. Lá dentro, as fatias se juntam num único grafo de transações.

Sobre esse grafo treinamos uma rede neural de grafos (GNN). Ao contrário de um modelo que olha cada transação isoladamente, a GNN aprende com a vizinhança: quem enviou para quem, em que ritmo, com que formato de rede. Estruturas típicas de lavagem, como leques, cadeias curtas, ciclos e contas recém-abertas que só repassam, ficam visíveis porque o modelo enxerga as conexões entre instituições.

O que cada banco recebe

O ponto crítico é a saída. Nenhum banco recebe o grafo, as transações dos outros ou listas de clientes alheios. O que sai do enclave é restrito por política:

  • Escores de risco apenas para as próprias contas, calculados com o contexto do grafo inteiro.
  • Alertas explicáveis em termos agregados, como “a conta participa de uma estrutura em leque que envolve várias instituições”, sem expor contrapartes.
  • Recibo de contribuição, que registra o impacto de cada instituição no desempenho do modelo.
  • Pesos do modelo, somente se a política aprovada por todos permitir inferência local.

Privacidade diferencial e política como código

Mesmo sem acesso aos dados, um modelo pode memorizar exemplos raros. Por isso o treinamento usa privacidade diferencial, que limita matematicamente o quanto qualquer transação individual influencia os pesos, e as saídas passam por limites mínimos de agregação.

Tudo isso é declarado numa política versionada, aprovada por todos os participantes e medida na atestação. Se o código em execução não corresponder à política aprovada, as chaves não são liberadas. Abaixo, um exemplo ilustrativo e simplificado de como essa política pode ser escrita; não é a política de nenhum cliente real:

# Exemplo ilustrativo e simplificado
policy: antifraude-interbancario
version: 3
purpose: deteccao-de-fraude
participants: [banco-a, banco-b, fintech-c]

data:
  retention_days: 90
  identifiers: pseudonymized_in_enclave

training:
  model: gnn-transacoes
  differential_privacy:
    epsilon: 4.0
    delta: 1.0e-6

outputs:
  - type: risk_score
    scope: own_accounts_only
  - type: model_weights
    allowed: false

attestation:
  gpu_confidential_mode: required
  approved_measurements: antifraude/v3

Cada campo tem uma consequência verificável: finalidade, prazo de retenção, orçamento de privacidade, formato das saídas e exigência de GPU em modo confidencial. Mudar qualquer um deles exige nova aprovação de todos os participantes, e a mudança fica registrada.

Fraude é um problema de rede. Enquanto cada instituição defende apenas o próprio trecho, as quadrilhas exploram as fronteiras entre elas. Computação confidencial permite atacar o problema na escala certa, a do sistema inteiro, sem abrir mão do sigilo que protege cada cliente.