RAG (Retrieval-Augmented Generation) e o padrao arquitetural para injetar conhecimento externo ao FM em tempo de inferencia: documentos internos, eventos pos-treinamento e dados proprietarios. Este guia cobre o pipeline RAG completo, do pre-processamento a otimizacao de recuperacao.
Pre-processamento de dados
A qualidade RAG e determinada principalmente na etapa de qualidade dos dados. Os passos principais incluem: remocao de ruido (cabecalhos, rodapes, anuncios), normalizacao de codificacao (UTF-8), preservacao de estrutura (tabelas, codigo) e deduplicacao entre versoes. AWS Glue e a escolha padrao para pipelines ETL em lote. Kinesis lida com fluxos de documentos em tempo real. Step Functions orquestra pipelines multi-etapa complexos com ramificacao e logica de reprocessamento.
Selecao de banco de dados vetorial
OpenSearch Serverless e o armazenamento vetorial padrao para o Bedrock Knowledge Bases: escalonamento automatico, pesquisa hibrida, integracao nativa. Aurora PostgreSQL + pgvector reutiliza infraestrutura existente com filtragem SQL combinada. Neptune Analytics combina busca vetorial com travessia de grafos. Pinecone e Redis Enterprise Cloud sao suportados como opcoes de terceiros.
Modelos de embedding e estrategias de fragmentacao
Titan Embeddings V2 suporta dimensoes variaveis (256/512/1024) via Matryoshka embeddings. Cohere Embed Multilingual cobre 100+ idiomas para RAG multilingue.
Fragmentacao de tamanho fixo: 256-512 tokens com sobreposicao de 50-100 tokens. Semantica: divide nos limites de significado usando similaridade de cosseno. Hierarquica: fragmentos pai (secao completa) + filho (paragrafos granulares) para recuperacao pequeno-para-grande.
!Diagrama da etapa de indexação (offline)
!Diagrama da etapa de recuperação e geração
Amazon Bedrock Knowledge Bases e recuperacao avancada
Bedrock Knowledge Bases fornece uma camada RAG totalmente gerenciada com conectores de fonte de dados (S3, web crawler, Confluence, SharePoint, Salesforce). A API realiza recuperacao e geracao em uma unica chamada. A pesquisa hibrida combina similaridade vetorial + BM25 via RRF. O reranking (Cohere Rerank) reavalia os 20-50 resultados iniciais e seleciona os 5-10 melhores. A reescrita de consultas expande a consulta original para melhorar o recall.