Fine-tuning ou RAG? Se você treina modelos de linguagem, essa dúvida provavelmente já passou pela sua cabeça — e provavelmente mais de uma vez.
Um novo estudo no arXiv compara as duas abordagens para construir modelos de mundo (WMs) baseados em LLMs.
E a resposta, segundo os dados, é mais nuançada do que o hype sugere.
O paper que acende o debate
O trabalho se chama "How To Train Your World Model: Fine-tuning vs RAG for LM-based World Modeling" e foi assinado por Dhananjay Ashok, Shantanu Agarwal, Vivek Datla, Jonathan May e Alfy Samuel.
Segundo o paper no arXiv, modelos de mundo simulam as dinâmicas de transição de um ambiente, permitindo que agentes planejem as consequências de suas ações.
Em ambientes textuais, fazer fine-tuning de um LM para atuar como WM virou o paradigma dominante.
> "Apesar do sucesso de abordagens não-paramétricas como RAG, o uso de retrieval para world modeling com LMs permanece subexplorado."
É essa lacuna que o estudo ataca.
Como a comparação foi feita
Ok, mas como medir isso de forma justa? Os pesquisadores conduziram uma avaliação sistemática em cinco ambientes diversos, cobrindo três tipos de cenário:
- Embodied: ambientes com agentes corporificados
- Web navigation: navegação na web
- Social settings: cenários de interação social
O critério de comparação foi direto: qual abordagem permite que agentes obtenham maiores recompensas ao planejar ações.
O resultado que chama atenção
Aqui está o pulo do gato.
Segundo o estudo, fine-tuning frequentemente supera RAG: modelos de mundo ajustados permitiram que agentes obtivessem recompensas maiores em 15 de 20 configurações.
> "Fine-tuned WMs enabling agents to obtain higher rewards on 15/20 settings."
Para quem assume que retrieval resolve tudo com menos custo de treino, o dado é um alerta.
Nem tudo está decidido
Só que nem tudo são flores para o fine-tuning.
O estudo aponta que ambos os paradigmas se beneficiam de exploração adicional e mais diversa. Ou seja, a qualidade dos dados de interação com o ambiente importa, independentemente do método de construção.
O abstract também indica que abordagens baseadas em RAG apresentam características próprias — mas o texto disponível está truncado nesse ponto.
A fonte não detalha em quais condições específicas o RAG seria preferível, nem os custos computacionais comparados das duas abordagens.
O que o estudo sobre fine-tuning e RAG significa para quem constrói agentes
Se você constrói agentes que planejam em ambientes textuais, o estudo sugere que o paradigma dominante tem fundamento empírico.
Em geral, a escolha entre fine-tuning e RAG depende de fatores como dados disponíveis e frequência de atualização do conhecimento — mas o paper não traz essa análise de custo, então qualquer recomendação de cenário seria especulação.
O que os dados sustentam é isto: para world modeling com LLMs, o fine-tuning entregou recompensas maiores na ampla maioria das configurações testadas.
Próximos passos
O trabalho está disponível para leitura completa no arXiv, incluindo o PDF e a versão HTML experimental.
Vale acompanhar os cinco ambientes usados na avaliação — eles definem o alcance das conclusões.
E você, qual abordagem usa nos seus agentes: treina o modelo ou busca o contexto?