Retrieval-Augmented Generation: Levantamento da Literatura Acadêmica (2020–2026)
Resumo
RAG designa a arquitetura que combina modelos de linguagem (LLMs) com sistemas de recuperação de informação externa, condicionando a geração de texto a conhecimento recuperado em tempo real. O problema central que resolve é duplo: a limitação de knowledge cutoff inerente ao pré-treinamento é a tendência a alucinação (geração factualmente incorreta) dos LLMs puros.
Introdução
Este documento constitui a Fase I de uma pesquisa exploratória sobre a tecnologia de Retrieval-Augmented Generation (RAG). O objetivo é construir um mapa conceitual da evolução, do ecossistema de atores é do impacto da tecnologia, fundamentado em literatura acadêmica de venues de primeira linha — NeurIPS, ICLR, ACL, EMNLP, NAACL, KDD, SIGIR — complementada por preprints de alta citação no arXiv. RAG designa a arquitetura que combina modelos de linguagem (LLMs) com sistemas de recuperação de informação externa, condicionando a geração de texto a conhecimento recuperado em tempo real. O problema central que resolve é duplo: a limitação de knowledge cutoff inerente ao pré-treinamento é a tendência a alucinação (geração factualmente incorreta) dos LLMs puros.
1.1 Delimitação metodológica
O levantamento segue protocolo exploratório-descritivo. Fontes primárias: papers peer-reviewed em venues Q1 de AI/NLP (ACL Anthology, NeurIPS, ICLR, ICML), preprints arXiv com citação significativa (>50), documentação técnica oficial de projetos-chave, e relatórios de mercado. Limitação explícita: trata-se de revisão narrativa, não de revisão sistemática com proto...
Leia o artigo completo
Baixe gratuitamente o PDF com o conteúdo integral deste artigo, incluindo todas as seções, tabelas, referências bibliográficas e análise completa.
17 min de leitura | Acesso gratuito mediante cadastro
Sumário do artigo
- 1.1 Delimitação metodológica
- 1.2 Escopo e estrutura
- 2 Papers fundacionais e surveys
- 2.1 O paper seminal
- 2.2 Surveys abrangentes
- 3 Variantes arquiteturais
- 3.1 Self-RAG: retrieval auto-reflexivo
- 3.2 Corrective RAG (CRAG)
- 3.3 RAPTOR: retrieval hierárquico
- 3.4 Ecossistema Graph RAG
- 3.5 Outras variantes de top venues
- 3.6 Agentic RAG
- 4 Mecanismos de retrieval
- 4.1 Dense retrieval e HyDE
- 4.2 Modelos de embedding
- 4.3 Reranking e busca híbrida
- 4.4 Query transformation
- 5 Frameworks de avaliação e benchmarks
- 5.1 Frameworks automatizados
- 5.2 Benchmarks purpose-built
- 6 Aplicações domain-specific
- 6.1 Healthcare
- 6.2 Legal
- 6.3 Finanças
- 7 RAG multimodal
- 7.1 ColPali: eliminação do bottleneck OCR
- 7.2 Outros avanços
- 8 Otimização de pipeline
- 8.1 O fenômeno “Lost in the Middle”
- 8.2 Compressão de contexto
- 8.3 Chunking: evidência empírica
- 8.4 Best practices
- 9 RAG vs. fine-tuning vs. long context
- 9.1 RAG e fine-tuning: complementares
- 9.2 O debate long context
- 10 De RAG a Context Engineering
- 10.1 A metamorfose conceitual
- 10.2 Três gerações de RAG
- 10.3 O Context Engine: três pilares
- 10.4 Validação via coding agents
- 10.5 Consolidação de mercado
- 11 Síntese e direções de pesquisa
- 11.1 Desenvolvimentos consequentes
- 11.2 Problemas abertos
- 11.3 Trajetória projetada