Você sabe o que faz o cientista de dados?
Um cavalo que fazia contas em 1904 e os ratos sem rabo de Hanói em 1902 explicam o ofício melhor que qualquer descrição de vaga. Em tempos de IA, o cientista de dados é quem faz a segunda pergunta.
A resposta pronta
Pergunte, numa mesa de café, o que faz um cientista de dados, e a resposta chega antes do segundo gole: alguma versão de "treina modelos de IA". Não está errado. Só está ficando velho. Em 2026, um modelo razoável se treina em poucas linhas de código, e a própria IA escreve essas linhas se você pedir com educação. Se o trabalho fosse só esse, a profissão já podia pedir a conta.
Não pode, e o motivo cabe em duas histórias antigas que transformei em dois vídeos de menos de um minuto. Nenhuma das duas começa com um computador.
O cavalo que sabia contar
Em 1904, Berlim tinha um cavalo que fazia contas. Hans, um garanhão preto, ouvia a pergunta e batia a resposta com o casco. Somava, subtraía, dizia as horas. Uma comissão com treze examinadores, entre eles um veterinário, um oficial de cavalaria, o diretor do zoológico e um diretor de circo, observou o animal e não encontrou truque nenhum. Hans acertava até com estranhos perguntando.
Então um jovem psicólogo, Oskar Pfungst, fez uma pergunta diferente. Que o cavalo acertava, todo mundo já tinha visto. Ele quis saber o que acontecia se quem pergunta não soubesse a resposta. Com um interrogador que sabia a conta, Hans acertou 89% das vezes. Com um que não sabia, 6%.
Hans nunca tinha contado nada. Ele lia um sinal minúsculo e involuntário: quando o casco chegava ao número certo, quem perguntava relaxava e erguia de leve a cabeça. Hans parava ali. Era um leitor extraordinário de gente, talento raro até entre humanos, e ninguém tinha pensado em testar isso.
Mais de um século depois, e de novo em Berlim, o mesmo cavalo reapareceu dentro de um computador. Um grupo de pesquisadores examinou um classificador de imagens que reconhecia cavalos com ótimo desempenho no teste. Um mapa de relevância, que mostra em quais pixels o modelo se apoia para decidir, acendeu num lugar inesperado: o canto da imagem, onde cerca de um quinto das fotos de cavalo do conjunto trazia a marca d'água de um fotógrafo. Os pesquisadores pegaram a foto de uma Ferrari, que o modelo classificava corretamente como carro, e colaram a marca d'água nela. Resposta: cavalo.
A literatura chama isso de shortcut learning, aprendizado por atalho, e batizou esses modelos, com toda a justiça, de "preditores Clever Hans". O modelo acertava pelo motivo errado, e a acurácia, a métrica que todo mundo olha primeiro, não tinha como avisar.
A acurácia diz que o modelo acertou. Nunca diz por quê.
Os ratos de Hanói
Hanói, 1902. A administração colonial francesa tinha acabado de construir uma rede de esgotos no bairro europeu, e os túneis viraram o endereço ideal para ratos. Com medo da peste, o governo pagou equipes de caça e ofereceu uma recompensa à população: um centavo por rato morto. Como prova, bastava entregar o rabo.
Os números subiram depressa. Houve dia com mais de vinte mil ratos registrados (20.112 em 21 de junho). Então começaram a aparecer, pelas ruas, ratos vivos e sem rabo. Pegar, cortar, soltar, deixar procriar: cada rato solto era uma fábrica de rabos futuros. Surgiram criações de ratos nos arredores. Em 1903, a peste chegou a Hanói.
Ninguém ali foi burro. As pessoas fizeram exatamente o que o número pagava. O defeito estava no desenho do incentivo: a meta era ter menos ratos, e a medida era contar rabos. Quando a medida virou meta, as duas se separaram. A ideia ficou conhecida como lei de Goodhart e cabe numa frase: quando uma medida vira meta, deixa de ser uma boa medida.
A IA faz o mesmo que os moradores de Hanói, só que mais rápido e sem nenhum constrangimento. Em 2016, a OpenAI treinou um agente para jogar CoastRunners, um jogo de corrida de barcos em que a pontuação vem de acertar alvos pela pista. O agente achou uma lagoa onde três alvos reapareciam e passou a girar ali em círculos, para sempre, pegando fogo, batendo em outros barcos, sem nunca terminar a corrida. Fez em média 20% mais pontos que os jogadores humanos. O nome técnico é reward hacking, e hoje ele tira o sono de quem treina modelos grandes.
Então, o que faz o cientista de dados?
Nas duas histórias, a tecnologia funcionou. O cavalo respondia, o modelo classificava, a recompensa gerava rabos, o barco pontuava. O que faltou, até alguém aparecer, foi a segunda pergunta. É ali que mora o ofício.
Pelo que venho aprendendo, boa parte do ofício é fazer perguntas desconfortáveis a números satisfeitos:
- O que o modelo está olhando? Acertar no teste é o começo. Mapas de relevância, testes com a variável suspeita removida e análise dos erros mostram se ele aprendeu o cavalo ou a marca d'água.
- O que a métrica está contando? Toda métrica é um rabo de rato em potencial. Antes de otimizar um número, vale perguntar como alguém (ou algo) poderia fazê-lo subir sem que aquilo que importa melhore.
- De onde vieram esses dados? A marca d'água estava no conjunto de fotos antes de estar no modelo. Quem coletou, como, com que filtro e o que ficou de fora decidem o que o modelo consegue aprender.
- Isso vale fora daqui? Um modelo que brilha nos dados de treino pode falhar no hospital vizinho, no ano seguinte ou na população que não estava na amostra.
- Esse número muda alguma decisão? Análise que não altera nenhuma escolha é decoração.
Na medicina, aprendemos isso do jeito caro. Nos anos 1980, era comum tratar com antiarrítmicos os pacientes que, depois de um infarto, tinham extrassístoles ventriculares, porque essas arritmias se associavam à morte súbita. Os remédios cumpriam a meta: as extrassístoles sumiam do eletrocardiograma. Quando o ensaio CAST comparou dois deles com placebo, a mortalidade no grupo tratado foi de 7,7%, contra 3,0% no placebo. O marcador melhorou, e o paciente morreu mais. Desfecho substituto é o rabo de rato da medicina.
A gestão de saúde tem os seus. Quando um serviço recebe por exame e procedimento realizado, e não pelo quanto o paciente melhora, a receita cresce pedindo mais: a tomografia que não muda a conduta, o check-up com trinta exames, a cirurgia que o protocolo não indicava. Cada item é faturado e a planilha sobe. O valor para o paciente, que é a saúde obtida por aquilo que se gastou, fica igual ou piora, porque cada exame desnecessário traz achados incidentais, novos exames e riscos. É o barco girando na lagoa: a pontuação sobe, e a corrida nunca termina.
Essas histórias têm algo em comum que vai além de cavalos e ratos. Diante de uma pergunta difícil (o cavalo pensa? o paciente vai viver mais? o serviço está cuidando bem?), a mente troca, sem avisar, por uma pergunta fácil que tem resposta à vista: ele acertou? a arritmia sumiu? quantos exames fizemos? A psicologia cognitiva chama essa troca de substituição. Ela se soma a outros vieses que todos carregamos, como acreditar mais depressa no que confirma o que já esperávamos. A primeira impressão é rápida e convincente, e erra de modo previsível. O que corrigiu cada uma dessas histórias foi método: o interrogador que não sabia a resposta, o mapa de relevância, o grupo placebo. É para isso que servem os dados e a ciência: medir as dimensões que a primeira impressão achata.
Por isso a IA não aposenta o cientista de dados. Ela barateia a parte de responder e, com isso, encarece a parte de perguntar. Quanto mais fácil fica treinar, mais modelos acertam pelo motivo errado.
De onde eu olho
Estou no primeiro ano de Ciência da Computação na FIAP, e ciência de dados faz parte do curso: regressão, manipulação de dados, avaliação de modelos. Sou iniciante nessa área, e foi justamente como iniciante que essas histórias me pegaram.
O que reconheci nelas veio da pediatria, pelo caminho de sempre, errando e vendo errar: o exame normal que escondia uma criança doente, o sintoma que apontava para outro lugar, a pergunta que ninguém tinha feito e que resolvia o caso. Sigo aprendendo a fazer a segunda pergunta, nos dois ofícios.
A IA responde cada vez melhor à primeira pergunta. O cientista de dados é quem faz a segunda.
Sobre os vídeos
Os dois vídeos nasceram para o desafio AI for Creativity, da DataCamp: uma explicação de até um minuto feita com IA. A versão em inglês do cavalo é a minha inscrição. Imagens do GPT Image, movimento do Kling 3.0, narração, trilha e efeitos do ElevenLabs, edição em ffmpeg automatizada com o Claude Code. Letreiros, mapas de calor e placar foram feitos na pós-produção, e cada número na tela vem das fontes abaixo.
Fontes
- Pfungst, O. Clever Hans (The Horse of Mr. Von Osten). 1907; tradução inglesa de 1911. Project Gutenberg.
- Lapuschkin, S. et al. Unmasking Clever Hans predictors and assessing what machines really learn. Nature Communications 10, 1096 (2019). Artigo.
- Vann, M. G. Of Rats, Rice, and Race: The Great Hanoi Rat Massacre, an Episode in French Colonial History. French Colonial History 4 (2003): 191–203. Project MUSE.
- Strathern, M. "Improving ratings": audit in the British University system. European Review 5, 3 (1997): 305–321.
- Clark, J.; Amodei, D. Faulty reward functions in the wild. OpenAI, 2016. Post.
- The Cardiac Arrhythmia Suppression Trial (CAST) Investigators. Preliminary report: effect of encainide and flecainide on mortality in a randomized trial of arrhythmia suppression after myocardial infarction. New England Journal of Medicine 321 (1989): 406–412. Artigo.
- Porter, M. E. What is value in health care? New England Journal of Medicine 363, 26 (2010): 2477–2481. Artigo.