TabFM vs CatBoost — Estudo Comparativo
Comparação prática entre o TabFM (Foundation Model para dados tabulares do Google) e o CatBoost em uma tarefa de detecção de fraude em cartões de crédito.
- Problem
- Comparar o desempenho e o custo computacional do TabFM, um Foundation Model para dados tabulares baseado em In-Context Learning, com o CatBoost em uma tarefa de detecção de fraude em cartões de crédito.
- Context
- Estudo exploratório realizado a partir do artigo 'Testando o TabFM: uma comparação inicial com o CatBoost para dados tabulares', publicado no blog do MRScience, após o lançamento do TabFM pelo Google.
- Approach
- 3 execuções de cada modelo (TabFM e CatBoost), usando as configurações padrão, a mesma seed e a mesma GPU em todas as execuções, com reinicialização do kernel entre elas para evitar interferência entre os testes. Avaliação em um dataset sintético de detecção de fraude em cartões de crédito (Kaggle), comparando precisão, recall, F1-score e tempo de treinamento/inferência.
Contexto
O Google lançou o TabFM, um Foundation Model para dados tabulares capaz de realizar tarefas de regressão e classificação via In-Context Learning (ICL) — usando um modelo pré-treinado em grandes volumes de dados sintéticos para prever em novos conjuntos de dados, sem treinamento específico nem otimização de hiperparâmetros para cada tarefa.
Este estudo nasceu da curiosidade de comparar essa abordagem com um modelo de referência consolidado para dados tabulares: o CatBoost. O problema escolhido foi detecção de fraude em cartões de crédito, usando um dataset sintético com variáveis numéricas e categóricas.
Resultados
TabFM — Precisão: 0,63 · Recall: 0,26 · F1-score: 0,37
CatBoost — Precisão: 0,68 · Recall: 0,23 · F1-score: 0,34
As métricas de qualidade ficaram bastante próximas entre os dois modelos. A diferença relevante apareceu no custo computacional:
- Tempo médio de predição do TabFM: ~23 minutos
- Tempo médio de predição do CatBoost: ~12 milissegundos
- Tempo médio de treinamento do CatBoost: ~43,5 segundos
(ambos os modelos avaliados na mesma GPU)
Lessons Learned
O TabFM entregou uma qualidade de previsão próxima à do CatBoost mesmo sem nenhuma etapa de treinamento específica para o problema — um resultado que mostra potencial, especialmente pela simplicidade do fluxo de inferência. Por outro lado, o tempo de predição (~23 min) ainda é uma limitação real para cenários que exigem resposta rápida ou processamento em tempo real, onde o CatBoost continua sendo a escolha mais prática.
Este foi um experimento único, em um único dataset — avaliações em outros domínios, volumes de dados e tarefas ainda são necessárias para entender melhor em quais cenários modelos como o TabFM podem complementar ou competir com algoritmos tradicionais de dados tabulares.
Mais detalhes e discussão completa no artigo Testando o TabFM: uma comparação inicial com o CatBoost para dados tabulares. Código do experimento disponível no repositório do GitHub (link acima).