Ingestión de datos de alto rendimiento

Aprende sobre Kinesis, Glue, Athena y Lake Formation para ingestion y analisis de datos.

En el examen SAA-C03, las preguntas sobre pipelines de datos representan aproximadamente el 16% del total. Si entiendes si procesar datos en tiempo real o en lotes, y que combinaciones de servicios son optimas, podras responder esta seccion con confianza.

 

Que es el streaming en tiempo real?

Imagina una cinta transportadora en una fabrica. Los productos se mueven continuamente y los trabajadores procesan cada uno sin detenerse. Eso es procesamiento en streaming. En cambio, recolectar los productos de un dia en un almacen y procesarlos todos de noche es procesamiento por lotes (batch).

En el examen, cuando veas "tiempo real", "inmediatamente" o "flujo continuo de datos", piensa en streaming. Cuando veas "procesamiento nocturno", "transformacion masiva de datos" o "ejecucion periodica", piensa en batch.

 

Amazon Kinesis — El nucleo del streaming en tiempo real

Kinesis es una plataforma para recopilar y procesar grandes cantidades de datos en tiempo real. Tiene tres servicios.

 

Kinesis Data Streams

Recopila datos en tiempo real y permite que multiples consumidores los procesen cada uno a su manera. Como varios equipos en una fabrica que recogen lo que necesitan de la misma cinta transportadora.

Los datos se conservan 24 horas por defecto (hasta 365 dias) La capacidad se gestiona en shards: cada shard maneja 1 MB/s de entrada y 2 MB/s de salida Multiples consumidores (Lambda, Kinesis Data Analytics, apps EC2) pueden leer el mismo stream simultaneamente Debes implementar tu propia logica de procesamiento personalizado

Cuando elegir Kinesis Data Streams: busca "ingestion en tiempo real + procesamiento personalizado", "multiples consumidores leen el mismo stream", "necesidad de reproducir datos".

 

Kinesis Data Firehose

Recibe datos en tiempo real y los entrega automaticamente a destinos como S3, Redshift, OpenSearch o Splunk. Completamente administrado y sin servidor, sin necesidad de gestionar shards.

Como un clasificador automatico al final de una cinta transportadora que envia cada producto al almacen correcto.

Almacena datos en buffer antes de entregarlos (cada 60 segundos o cada 1-128 MB) Puedes adjuntar una funcion Lambda para transformar datos antes de la entrega No se necesita codigo de consumidor, los datos llegan automaticamente al destino

Cuando elegir Kinesis Data Firehose: busca "guardar automaticamente datos en tiempo real en S3/Redshift", "streaming sin servidor", "sin necesidad de codigo de consumidor personalizado".

 

Kinesis Data Analytics

Ejecuta SQL o Apache Flink en datos de streaming para analitica en tiempo real. Como ver los elementos moverse por la cinta transportadora y realizar agregacion, filtrado o deteccion de anomalias al instante.

Util para agregaciones por segundo, medias moviles y deteccion de anomalias Puede enviar resultados de vuelta a Kinesis Data Streams o Firehose

 

Procesamiento por lotes y ETL

 

AWS Glue — ETL sin servidor

ETL significa Extraer, Transformar, Cargar. Glue automatiza este proceso sin necesidad de gestionar servidores.

Crawlers de Glue: escanean automaticamente S3, RDS y otras fuentes para detectar esquemas Catalogo de datos de Glue: almacena metadatos de esquemas descubiertos (referenciado por Athena y EMR) Trabajos ETL de Glue: ejecutan scripts Python o Scala para transformar datos Glue Studio: construye visualmente pipelines ETL sin escribir codigo

Cuando elegir AWS Glue: busca "ETL sin servidor", "descubrimiento automatico de esquemas", "catalogo de datos", "automatizar transformacion de datos en S3".

 

Amazon EMR — Clusters Hadoop/Spark a gran escala

EMR ejecuta frameworks de big data como Hadoop, Spark, Hive y Presto en clusters de EC2. Usalo para transformacion de datos a gran escala, preprocesamiento de machine learning y analitica compleja.

Glue vs EMR: Glue es sin servidor (sin necesidad de gestion). EMR te permite configurar clusters por tu cuenta para una personalizacion mas flexible.

Cuando elegir Amazon EMR: busca "Hadoop/Spark", "transformacion de datos a gran escala", "gestionar clusters directamente", "frameworks personalizados de big data".

 

AWS DataSync

Transfiere rapidamente grandes cantidades de datos desde sistemas de archivos on-premises a S3, EFS o FSx. Usalo para migraciones de datos o tareas de sincronizacion periodica.

Cuando elegir DataSync: busca "transferencia masiva de datos on-premises a S3" o "sincronizacion periodica de archivos".

 

Servicios de analitica

 

Amazon Athena — SQL sobre S3

Analiza datos almacenados en S3 directamente usando SQL, sin mover datos a una base de datos separada. Se integra con el Catalogo de datos de Glue para obtener automaticamente las definiciones de tablas.

Completamente sin servidor: pagas solo por los datos escaneados por tus consultas Soporta CSV, JSON, Parquet, ORC y otros formatos Usar formatos en columnas (Parquet) optimiza tanto la velocidad de consulta como el costo

Cuando elegir Athena: busca "consultar datos S3 con SQL", "consultas sin servidor", "analizar datos S3 directamente sin base de datos separada".

 

Amazon Redshift — Almacen de datos

Un almacen de datos para analizar datos estructurados a escala de petabytes con alto rendimiento. Optimizado para OLAP, grandes consultas de agregacion para analitica.

Redshift Spectrum: consulta datos de S3 directamente desde Redshift sin moverlos Recuerda: OLTP (transacciones) = RDS/Aurora/DynamoDB. OLAP (analitica) = Redshift.

Cuando elegir Redshift: busca "almacen de datos a gran escala", "OLAP", "grandes consultas de agregacion y analitica".

 

Amazon QuickSight — Visualizacion BI

Una herramienta BI sin servidor que se conecta a Athena, Redshift, S3 y otras fuentes para crear paneles y graficos.

Cuando elegir QuickSight: busca "panel BI" o "visualizacion de datos".

 

AWS Lake Formation — Gestion del lago de datos

Facilita la construccion de un lago de datos centrado en S3 y gestiona permisos de acceso a datos detallados. Se integra con Glue, Athena y Redshift.

Cuando elegir Lake Formation: busca "construir un lago de datos", "control centralizado de acceso a datos", "seguridad a nivel de columna".

 

Volver a la lista del blog