Análisis y Visualización de Datos

Resume SQL Athena, tableros QuickSight, análisis SQL de Redshift, cuadernos Spark.

Almacenar y procesar datos es solo la mitad del trabajo. Para crear valor empresarial, necesita encontrar patrones e insights ocultos dentro de los datos. El paso de análisis transforma los datos brutos en respuestas a preguntas de negocio. La visualización luego presenta esas respuestas como gráficos y dashboards que los no expertos pueden entender. Las preguntas del examen DEA-C01 sobre análisis preguntan qué servicio elegir en una situación dada y cómo optimizar el costo y el rendimiento.

 

Comparación de servicios de análisis

AWS ofrece varios servicios para análisis de datos. Cada uno tiene diferentes fortalezas y se adapta a diferentes situaciones.

| Servicio | Características | Mejor situación | |---------|----------------|----------------| | Athena | SQL serverless, consulta S3 directamente | Análisis ad-hoc, eficiencia de costos | | Redshift SQL | Almacén de datos a escala de petabytes | Agregaciones complejas, grandes conjuntos estructurados | | Athena Notebooks | SQL + PySpark interactivo | Análisis exploratorio, preprocesamiento ML | | DataBrew | Análisis visual sin código | Exploración de datos sin desarrolladores, verificación de calidad |

Cómo elegir: Los datos están en S3 y los consulta ocasionalmente → Athena Miles de consultas complejas cada día con alto rendimiento → Redshift Mezcla SQL y Python para análisis exploratorio → Athena Notebooks Explorar datos visualmente sin escribir SQL → DataBrew

 

Optimización de Athena

Athena cobra según la cantidad de datos escaneados por consulta. Escanear menos significa consultas más rápidas y económicas.

Particionamiento: Almacene datos en carpetas organizadas por fecha, región, categoría u otras dimensiones. Cuando una consulta filtra por una columna de partición, Athena escanea solo las carpetas de partición relevantes en lugar de todos los datos.

Formatos columnares (Parquet, ORC): CSV almacena datos fila por fila. Incluso si solo necesita dos columnas, lee cada columna de cada fila. Parquet y ORC almacenan datos columna por columna. Una consulta como lee solo las columnas name y age: todos los demás datos de columnas se omiten por completo. Esto reduce drásticamente la cantidad escaneada, reduciendo tanto el costo como el tiempo de consulta.

Compresión: Aplicar compresión Snappy o Gzip reduce el tamaño de los archivos, lo que reduce los costos de escaneo. Usar Parquet con compresión Snappy juntos es una práctica recomendada estándar.

Controles de costo: Establecer bytes máximos escaneados por consulta en la configuración del workgroup Especificar solo las columnas necesarias en lugar de SELECT Incluir siempre columnas de partición en cláusulas WHERE Usar LIMIT en consultas exploratorias para evitar leer el conjunto completo

 

QuickSight — Dashboards interactivos

Amazon QuickSight es la herramienta de inteligencia empresarial (BI) de AWS. Los usuarios crean gráficos y dashboards mediante arrastrar y soltar sin escribir SQL.

Motor SPICE: SPICE (Super-fast, Parallel, In-memory Calculation Engine) es la caché en memoria de QuickSight. Importe datos a SPICE una vez, y QuickSight sirve las consultas desde memoria sin acceder a la base de datos de origen cada vez. Los grandes conjuntos de datos se cargan rápido, y sin importar cuántos usuarios estén viendo dashboards simultáneamente, la base de datos de origen no experimenta carga.

Fuentes de datos: QuickSight se conecta a una amplia variedad de fuentes: S3 (a través de Athena) Redshift RDS / Aurora DynamoDB Servicios SaaS como Salesforce y SAP Cargas de archivo directas (CSV, Excel)

Incrustación: Incruste dashboards de QuickSight directamente dentro de su propia aplicación web. Los usuarios ven los dashboards dentro de la aplicación sin iniciar sesión en la consola de AWS.

ML Insights: Funciones de aprendizaje automático integradas en QuickSight. Detecte anomalías automáticamente en datos, pronostique valores futuros o realice análisis de contribución (qué factores impulsaron un cambio). No se requiere experiencia en aprendizaje automático.

 

Técnicas de análisis SQL

Varios patrones SQL aparecen frecuentemente en el trabajo de análisis de datos y en las preguntas del examen DEA-C01.

Funciones de agregación:

Funciones de ventana: Calculan valores agregados por fila dentro de un grupo sin colapsar las filas como lo hace GROUP BY. Úselas para clasificación, totales acumulados y promedios móviles mientras se mantiene el detalle de fila individual.

Pivot: Transforma valores de filas en columnas. Redshift implementa pivot usando CASE WHEN.

CTE (Common Table Expression): Divide una consulta compleja en pasos nombrados y legibles usando cláusulas WITH.

 

Puntos clave del examen

"Análisis SQL serverless de datos S3" → Athena "Procesamiento de alto rendimiento de consultas grandes y complejas" → Redshift "Reducir costo de Athena con estructura de carpetas" → Particionamiento "Reducir costo de Athena con formato de archivo" → Parquet u ORC "Dashboards QuickSight rápidos" → Caché en memoria SPICE "Detección automática de anomalías en QuickSight" → ML Insights "Incrustar QuickSight en su aplicación" → Incrustación "Calcular agregados de grupo manteniendo filas individuales" → Funciones de ventana "Dividir una consulta compleja en pasos legibles" → CTE

Volver a la lista del blog