AIP-C01: Pipelines de dados e arquitetura RAG

Fundamentos do exame AIP-C01: analise profunda do pre-processamento de dados de entrada de FM, selecao de banco de dados vetorial, estrategias de fragmentacao, design de pipeline RAG e Amazon Bedrock Knowledge Bases.

RAG (Retrieval-Augmented Generation) e o padrao arquitetural para injetar conhecimento externo ao FM em tempo de inferencia: documentos internos, eventos pos-treinamento e dados proprietarios. Este guia cobre o pipeline RAG completo, do pre-processamento a otimizacao de recuperacao.

 

Pre-processamento de dados

A qualidade RAG e determinada principalmente na etapa de qualidade dos dados. Os passos principais incluem: remocao de ruido (cabecalhos, rodapes, anuncios), normalizacao de codificacao (UTF-8), preservacao de estrutura (tabelas, codigo) e deduplicacao entre versoes. AWS Glue e a escolha padrao para pipelines ETL em lote. Kinesis lida com fluxos de documentos em tempo real. Step Functions orquestra pipelines multi-etapa complexos com ramificacao e logica de reprocessamento.

 

Selecao de banco de dados vetorial

OpenSearch Serverless e o armazenamento vetorial padrao para o Bedrock Knowledge Bases: escalonamento automatico, pesquisa hibrida, integracao nativa. Aurora PostgreSQL + pgvector reutiliza infraestrutura existente com filtragem SQL combinada. Neptune Analytics combina busca vetorial com travessia de grafos. Pinecone e Redis Enterprise Cloud sao suportados como opcoes de terceiros.

 

Modelos de embedding e estrategias de fragmentacao

Titan Embeddings V2 suporta dimensoes variaveis (256/512/1024) via Matryoshka embeddings. Cohere Embed Multilingual cobre 100+ idiomas para RAG multilingue.

Fragmentacao de tamanho fixo: 256-512 tokens com sobreposicao de 50-100 tokens. Semantica: divide nos limites de significado usando similaridade de cosseno. Hierarquica: fragmentos pai (secao completa) + filho (paragrafos granulares) para recuperacao pequeno-para-grande.

!Diagrama da etapa de indexação (offline)

!Diagrama da etapa de recuperação e geração

Amazon Bedrock Knowledge Bases e recuperacao avancada

Bedrock Knowledge Bases fornece uma camada RAG totalmente gerenciada com conectores de fonte de dados (S3, web crawler, Confluence, SharePoint, Salesforce). A API realiza recuperacao e geracao em uma unica chamada. A pesquisa hibrida combina similaridade vetorial + BM25 via RRF. O reranking (Cohere Rerank) reavalia os 20-50 resultados iniciais e seleciona os 5-10 melhores. A reescrita de consultas expande a consulta original para melhorar o recall.

Voltar à lista do blog