AIP-C01: Pipelines de datos y arquitectura RAG

Fundamentos del examen AIP-C01: analisis profundo del preprocesamiento de datos de entrada de FM, seleccion de bases de datos vectoriales, estrategias de fragmentacion, diseno de pipelines RAG y Amazon Bedrock Knowledge Bases.

RAG (Retrieval-Augmented Generation) es el patron arquitectonico para inyectar conocimiento externo al FM en tiempo de inferencia: documentos internos, eventos posteriores al entrenamiento y datos propietarios. Esta guia cubre el pipeline RAG completo desde el preprocesamiento hasta la optimizacion de recuperacion.

 

Preprocesamiento de datos

La calidad RAG se determina principalmente en la etapa de calidad de datos. Los pasos clave incluyen: eliminacion de ruido (encabezados, pies de pagina, anuncios), normalizacion de codificacion (UTF-8), preservacion de estructura (tablas, codigo) y deduplicacion entre versiones. AWS Glue es la opcion estandar para pipelines ETL por lotes. Kinesis maneja flujos de documentos en tiempo real. Step Functions orquesta pipelines multi-paso complejos.

 

Seleccion de base de datos vectorial

| BD Vectorial | Caso de uso ideal | |-------------|------------------| | OpenSearch Serverless | Bedrock nativo, escalado automatico, busqueda hibrida | | Aurora PostgreSQL + pgvector | Reutilizar infra existente, filtrado SQL complejo | | Neptune Analytics | Busqueda vectorial + travesia de grafo | | Pinecone / Redis | Infraestructura existente de terceros |

 

Modelos de embedding

Titan Embeddings V2 soporta dimensiones variables (256/512/1024) minimizando la perdida de calidad. Cohere Embed Multilingual cubre 100+ idiomas para RAG multilingue. Siempre use el mismo modelo de embedding en la indexacion y en el momento de la consulta.

 

Estrategias de fragmentacion

Tamano fijo: 256-512 tokens con solapamiento de 50-100 tokens. Simple pero puede cortar unidades semanticas. Semantica: divide en limites de significado usando similitud de coseno entre oraciones. Mejor calidad, mas costosa. Jerarquica: fragmentos padre (seccion completa) + hijo (parrafo granular). Recuperacion pequena a grande (small-to-big retrieval).

!Diagrama de la etapa de indexación (offline)

!Diagrama de la etapa de recuperación y generación

Busqueda avanzada

La busqueda hibrida combina similitud vectorial + BM25 mediante Reciprocal Rank Fusion. El reranking (Cohere Rerank) reevalua 20-50 resultados iniciales y selecciona los 5-10 mejores. La reescritura de consultas expande la consulta original para mejorar el recall de recuperacion.

Volver a la lista del blog