Quanto vale o seu dado? Valoração de Shapley em treinamento conjunto

Quando várias instituições treinam um modelo juntas, alguém precisa medir quem contribuiu com o quê. O valor de Shapley dá a resposta mais justa, e ela custa caro em GPU.

Equipe Data Pelago5 min de leitura

Treinamento multi-institucional cria um problema econômico antes de criar um problema técnico. Se um hospital traz milhares de exames de uma doença rara e outro traz um volume muito maior de exames de rotina, quem contribuiu mais para o modelo final? Volume não responde. Qualidade, raridade e complementaridade importam, e só aparecem quando medimos o efeito de cada conjunto de dados no desempenho do modelo.

A intuição do valor de Shapley

O valor de Shapley vem da teoria dos jogos cooperativos e foi formulado por Lloyd Shapley em 1953. A ideia é simples de enunciar: imagine todas as ordens possíveis em que os participantes poderiam entrar numa coalizão. Em cada ordem, meça quanto o desempenho melhora quando um participante entra. O valor de Shapley desse participante é a média dessas contribuições marginais sobre todas as ordens.

Ele é o único critério de divisão que satisfaz, ao mesmo tempo, um conjunto de propriedades desejáveis:

  • Eficiência: a soma das contribuições é igual ao ganho total do modelo.
  • Simetria: dois participantes com efeito idêntico recebem o mesmo valor.
  • Nulidade: quem não altera o desempenho recebe zero.
  • Aditividade: o valor calculado sobre várias métricas é a soma dos valores em cada uma.

Para dividir receita entre instituições que competem entre si, essas propriedades não são detalhe acadêmico. São o que torna a divisão defensável diante de um conselho, de um auditor ou de um concorrente desconfiado.

O problema: custo exponencial

O cálculo exato exige avaliar o modelo em todas as coalizões possíveis. Com n participantes, são 2^n subconjuntos, e cada avaliação, em princípio, pede um modelo treinado só com aquele subconjunto. Com dez instituições, são 1.024 treinamentos; com trinta, mais de um bilhão. Ninguém faz isso. O que se faz é aproximar, com garantias estatísticas.

Aproximações que funcionam na prática

  • Leave-one-out como linha de base: treinar sem cada participante e medir a queda. É barato, mas falha quando dois participantes têm dados redundantes. Cada um parece dispensável isoladamente, embora juntos sejam essenciais.
  • Monte Carlo por permutações: sortear ordens aleatórias de entrada e calcular as contribuições marginais apenas nelas. O erro cai com o número de amostras, e a execução pode parar quando a estimativa se estabiliza.
  • TMC-Shapley (Monte Carlo truncado): interromper cada permutação quando o desempenho já está próximo do modelo completo, porque as contribuições restantes tendem a ser pequenas. Isso corta boa parte do custo.
  • Métodos baseados em gradiente e influência: estimar o efeito de cada conjunto de dados a partir de gradientes ou funções de influência ao longo do treinamento, sem retreinar do zero. São mais baratos, mas precisam ser calibrados contra estimativas por amostragem.

Nossa abordagem combina os dois mundos: aproximações por gradiente acompanham a contribuição de cada ilha durante o treinamento, e rodadas periódicas de Monte Carlo truncado recalibram essas estimativas.

Dentro do enclave, sobre validação separada

A valoração roda no mesmo perímetro confidencial do treinamento. Ninguém precisa ver os dados de ninguém para medir contribuições: o enclave treina os submodelos, avalia cada um num conjunto de validação separado e acordado entre os participantes, e publica apenas os valores agregados por instituição, assinados junto com a atestação da execução.

Esse detalhe é decisivo. Se a métrica ou o conjunto de validação fossem escolhidos por um único participante, ele poderia puxar o valor para si. Por isso a política de valoração (métrica, dados de validação, número de amostras, critério de parada) faz parte do contrato em código que todos aprovam antes da execução.

Volume não é contribuição. Contribuição é o quanto o modelo piora sem você.

De recibo a dividendo, e o custo disso

Cada treinamento gera um recibo com a contribuição estimada de cada ilha e o intervalo de confiança da estimativa. Quando o modelo é usado, a receita é dividida conforme esses recibos. É isso que chamamos de dividendos de dados: o dado deixa de ser apenas risco regulatório e passa a render.

Há um preço, e ele é computacional. Valoração séria significa dezenas ou centenas de treinamentos parciais e avaliações a cada rodada, o que pode rivalizar com o custo do próprio treinamento principal. Esse é mais um motivo para rodarmos em hardware da classe Blackwell: valoração justa só vira rotina quando retreinar é rápido e barato o suficiente para não ser a exceção.