Tutoriais

Como o RAG faz a IA responder com seus documentos

Resposta rápida

RAG (retrieval-augmented generation) é a técnica que busca trechos relevantes dos seus documentos num banco vetorial e injeta esse texto no prompt antes da IA responder, sem treinar o modelo de novo. Diferente do fine-tuning, que muda os pesos do modelo, o RAG muda só o que o modelo lê antes de responder.

Monte o seu agente e veja ele respondendo com as informações do seu negócio.

Criar meu agente de graça Montar é livre, sem cadastro e sem cartão.

O que você vai encontrar neste artigo

· Leitura de 5 min

RAG: como a IA aprende com seus documentos

Em resumo

  • RAG busca trechos dos seus documentos num banco vetorial antes de responder.
  • Embeddings viram vetores de texto; chunking divide documentos em pedaços pesquisáveis.
  • Fine-tuning muda os pesos do modelo; RAG só muda o que ele lê.

O que é RAG na prática

RAG significa retrieval-augmented generation, ou geração aumentada por busca. A ideia central é simples: antes de responder, o modelo busca trechos de texto relevantes num banco de dados e cola esses trechos dentro do prompt. O modelo não aprende nada novo. Ele só lê um texto extra na hora de responder.

  1. O usuário faz uma pergunta.
  2. O sistema transforma essa pergunta num embedding (um vetor de números).
  3. O banco vetorial procura os pedaços de texto com embedding mais parecido.
  4. Esses pedaços entram no prompt, junto com a pergunta original.
  5. O modelo de linguagem gera a resposta usando esse texto como base.

RAG não muda o modelo. Ele muda o que o modelo lê antes de responder.

Como funcionam os embeddings no RAG

Embedding é um vetor de números que representa o significado de um texto. Frases parecidas em sentido ficam com vetores próximos no espaço; frases sem relação ficam distantes. Um modelo de embedding transforma cada frase, parágrafo ou documento nesse vetor antes de guardar no banco.

A busca não compara palavras iguais, compara distância entre vetores, normalmente usando similaridade de cosseno. É por isso que uma pergunta como 'como cancelar minha assinatura' acha um trecho que fala em 'encerrar o plano', mesmo sem repetir as mesmas palavras. Modelos de embedding conhecidos incluem os da OpenAI, os da Cohere e opções abertas como a família BGE.

O que é chunking e por que ele importa

Chunking é dividir um documento grande em pedaços menores antes de gerar os embeddings. Um contrato de 40 páginas não cabe inteiro numa busca útil: o sistema precisa achar o parágrafo certo, não o documento inteiro. Cada pedaço vira um embedding separado e entra no banco vetorial como um item independente.

Qual o tamanho certo para um chunk?

Não existe tamanho único. Chunk pequeno demais perde contexto: o trecho recuperado não faz sentido sozinho. Chunk grande demais dilui o significado: o embedding mistura vários assuntos e a busca fica menos precisa.

  • Textos com definições curtas: chunks pequenos, de um parágrafo.
  • Manuais e contratos com raciocínio encadeado: chunks maiores, com sobreposição entre pedaços vizinhos.
  • Sobreposição de frases entre chunks evita cortar uma ideia no meio.

O que é banco vetorial e para que serve

Banco vetorial é o banco de dados feito para guardar embeddings e achar os mais parecidos rápido, mesmo com milhões de itens. Ele usa índices como HNSW para encontrar vizinhos próximos sem comparar vetor por vetor um por um; uma busca exata seria lenta demais em escala.

TipoExemploQuando usar
Banco vetorial dedicadoPinecone, Weaviate, QdrantProjeto que já nasce em escala, com time de dados
Extensão de banco relacionalpgvector no PostgresTime que já usa Postgres e quer menos peças novas
Busca localChroma, FAISSProtótipo, teste ou projeto pequeno sem servidor dedicado

Para um protótipo ou uma base pequena, pgvector dentro do Postgres já resolve. Só vale trocar por um banco vetorial dedicado quando o volume de documentos ou o número de buscas por segundo pedir um servidor a mais para manter.

RAG ou fine-tuning: qual usar

Fine-tuning é treinar o modelo de novo com exemplos, mudando os pesos internos dele. O modelo passa a 'saber' aquilo de cor, sem precisar buscar nada na hora da resposta. RAG faz o oposto: o modelo continua o mesmo, e o conhecimento novo entra como texto no prompt, a cada pergunta.

CritérioRAGFine-tuning
Dado muda com frequênciaAtualiza na hora, só troca o documentoPrecisa treinar de novo a cada mudança
Custo para manterMenor, é mais texto no promptMaior, exige rodada de treino
Ensinar um tom ou estilo de respostaFraco nissoForte nisso
Mostrar de onde veio a respostaFácil, dá pra citar o trechoDifícil, a resposta se mistura nos pesos

Para responder com base em documentos que mudam, como contrato, manual ou base de conhecimento, RAG é a escolha certa. Fine-tuning vale quando o objetivo é mudar o jeito do modelo escrever ou raciocinar, não o que ele sabe.

Quando o RAG não funciona bem

RAG depende inteiro da qualidade da busca. Se o chunk certo não é achado, o modelo responde sem essa informação e pode inventar uma resposta que soa certa mesmo assim. Isso não é falha do RAG em si; é falha de busca, que geralmente vem de chunking ruim ou de uma pergunta escrita muito diferente do documento original.

  • Perguntas que exigem juntar informação espalhada em vários documentos diferentes
  • Perguntas que pedem comparar números que estão em várias tabelas
  • Base de documentos desatualizada ou com informação contraditória entre arquivos

Nesses casos, aumentar o número de trechos buscados de uma vez ajuda um pouco. Mas o ganho maior quase sempre vem de revisar o chunking e testar a busca com perguntas reais antes de confiar no sistema em produção.

Leia também

Perguntas frequentes

RAG substitui o fine-tuning?
Não. Eles resolvem problemas diferentes: RAG traz informação nova para o prompt, fine-tuning muda o comportamento do modelo. Muitos sistemas usam os dois juntos.
Preciso saber matemática para usar RAG?
Não. As bibliotecas de embedding e os bancos vetoriais escondem a conta de similaridade; o trabalho do desenvolvedor é escolher o modelo de embedding certo e ajustar o chunking.
RAG funciona com PDF e planilha?
Sim, desde que o texto seja extraído antes do chunking. Tabela e imagem dentro do PDF costumam precisar de um passo extra de conversão para não perder a estrutura.
Quanto custa montar um sistema de RAG?
O custo depende do modelo de embedding, do banco vetorial escolhido e do volume de texto guardado. Consulte a página de preços oficial de cada provedor antes de decidir.
Certu
Automação com IA para o seu negócio