Educação financeira · artigo prático
Chunking e reranking em sistemas RAG
Duas técnicas que melhoram a qualidade de sistemas RAG — como dividir documentos para recuperação e como reordenar resultados por relevância real.
RAG combina busca com geração: em vez de depender só do conhecimento de treinamento, o modelo recebe trechos recuperados de uma base relevante à pergunta — o mecanismo descrito em o que é RAG. A qualidade dessa recuperação depende de duas decisões subestimadas: como os documentos foram divididos (chunking) e como os resultados são reordenados (reranking).
Nenhuma das duas etapas aparece na explicação simplificada de RAG, mas são frequentemente onde a diferença entre um sistema que funciona bem e um que devolve respostas irrelevantes realmente mora.
Chunking — como dividir documentos para recuperação
Indexar um documento inteiro raramente funciona — documentos longos misturam assuntos. Divisão em chunks tem trade-off entre precisão e continuidade de contexto. Esse problema de segmentar tem paralelo direto com o projeto de Triagem Inteligente de Documentos deste portfólio, e com a captura descrita em digitalização de documentos com scanners industriais, onde o desafio central também era decidir onde um documento termina e outro começa, para classificá-lo corretamente.
Reranking — refinando a ordem dos resultados recuperados
A primeira busca por similaridade vetorial (retrieval) prioriza velocidade e cobertura: ela retorna rapidamente um conjunto de candidatos plausíveis, mas nem sempre na ordem ideal de relevância. Reranking aplica um segundo modelo, mais preciso (e mais lento) sobre esse conjunto reduzido de candidatos, reordenando-os por um critério de relevância mais fino antes de enviar apenas os melhores ao LLM.
- Transformar pergunta em vetor e buscar chunks mais próximos
- Selecionar um conjunto reduzido de candidatos (top-k)
- Reordenar por critério de relevância mais preciso (reranking)
- Enviar apenas os trechos mais relevantes (top-n) ao modelo
Ferramenta interativa