Athena - Guía Completa

Cuando un escenario de pregunta menciona "consultar datos en S3 con SQL sin administrar infraestructura," la respuesta es Athena. Recuerda: es serverless y solo pagas por los datos escaneados.

Amazon Athena - Guia Completa (Claves para el Examen DEA-C01)

Introduccion

Amazon Athena aparece con frecuencia tanto en Domain 1: Data Ingestion and Transformation (34%) como en Domain 3: Data Operations and Support (22%) del examen DEA-C01.

Cuando el escenario menciona "analizar datos de S3 directamente con SQL", la respuesta es Athena. Es serverless, no requiere gestion de infraestructura y cobra solo por la cantidad de datos escaneados.

Esta guia cubre los conceptos clave que necesitas conocer para preparar el examen.

---

Que es Amazon Athena?

Empecemos con los fundamentos de Athena.

| Aspecto | Detalle | | --- | --- | | Definicion | Servicio de consultas interactivas serverless para analizar datos de S3 con SQL estandar | | Gestion de infraestructura | No necesaria (serverless) | | Modelo de precios | $5.00 por TB de datos escaneados | | Motor de consultas | Basado en Apache Presto | | Gestion de metadatos | Integrado con AWS Glue Data Catalog | | Visualizacion | Amazon QuickSight |

Puntos clave para el examen:

"Analizar datos de S3 con SQL serverless" → Amazon Athena El costo es proporcional a la cantidad de datos escaneados, por lo que escanear menos significa menor costo

---

Formatos de datos soportados y eficiencia de costos

Comprender los formatos que Athena soporta ayuda a resolver preguntas de optimizacion de costos.

| Formato | Tipo | Caracteristicas | Eficiencia de costo | | --- | --- | --- | --- | | CSV / TSV | Basado en filas | Simple y universal, pero ineficiente para grandes volumenes | Baja | | JSON | Semiestructurado | Soporta datos anidados, adecuado para logs | Baja | | Parquet | Columnar | Escaneo a nivel de columna, alta eficiencia de compresion | Alta | | ORC | Columnar | Similar a Parquet, soporta procesamiento dividido | Alta | | Avro | Basado en filas (divisible) | Soporta evolucion de esquema, adecuado para datos de streaming | Media |

Cuando el examen pregunta "Como reducir los costos de Athena?", la respuesta es el formato Parquet u ORC. Los formatos columnares escanean solo las columnas necesarias para la consulta, reduciendo el volumen de escaneo y los costos.

---

Cinco estrategias de optimizacion de costos

La optimizacion de costos de Athena es un tema frecuente en el examen.

| Estrategia | Descripcion | | --- | --- | | Usar formatos columnares | Convertir a Parquet u ORC para escanear solo las columnas necesarias | | Compresion de datos | Aplicar compresion reduce la cantidad de datos escaneados | | Particionamiento | Separar datos de S3 por fecha, region, etc. para escanear solo particiones relevantes | | CTAS | Crear nuevas tablas a partir de resultados SELECT para convertir CSV a Parquet o crear tablas resumen | | Reutilizacion de resultados | Cachear y reutilizar resultados de consultas identicas para evitar re-escaneo |

Para escenarios de reduccion de costos, la combinacion de particionamiento + formato Parquet + compresion de datos suele ser la respuesta correcta.

!5 estrategias de optimización de costos de Athena

Integracion con AWS Glue

El patron de integracion estandar entre Athena y Glue.

Caracteristicas principales:

Glue Crawler escanea S3 y genera automaticamente los esquemas de tablas Athena utiliza Glue Data Catalog como su almacen de metadatos Cuando se agregan nuevas particiones directamente a S3, usar MSCK REPAIR TABLE para sincronizar metadatos

La combinacion Athena + Glue Data Catalog es el patron estandar de consulta de data lake serverless en AWS.

---

Control de costos y gestion de acceso con Workgroups

Los Workgroups permiten separar la ejecucion de consultas en grupos logicos para su gestion.

| Funcion | Detalle | | --- | --- | | Aislamiento de historial | Aislar el historial de consultas por equipo o departamento | | Control de costos | Establecer limites de escaneo por workgroup con terminacion automatica al excederlos | | Gestion de acceso | Controlar permisos de usuario por workgroup mediante integracion con IAM | | Asignacion de costos | Rastrear costos de consultas por departamento |

Cuando el examen presenta un escenario sobre "limitar los costos de Athena por equipo", la respuesta es establecer limites de escaneo de datos en Workgroups.

---

Federated Query para multiples fuentes de datos

Federated Query permite consultar no solo S3 sino diversas fuentes de datos de AWS con una unica sentencia SQL.

Las fuentes de datos soportadas incluyen Amazon RDS, Redshift, DynamoDB y S3.

Caracteristicas principales:

Unir y analizar multiples fuentes sin ETL Usa SQL y PartiQL Implementado a traves de conectores de fuentes de datos basados en Lambda

Cuando el examen pregunta sobre "analizar multiples bases de datos con SQL sin ETL complejo", la respuesta es Athena Federated Query.

---

Transacciones ACID y Apache Iceberg

Athena soporta transacciones ACID.

| Funcion | Detalle | | --- | --- | | Soporte ACID | Consistencia de datos para operaciones INSERT, UPDATE, DELETE y MERGE | | Implementacion | AWS Glue Data Catalog + formato de tabla Apache Iceberg | | Viaje en el tiempo | Consultar datos en puntos especificos del pasado | | Evolucion de esquema | Modificar esquemas sin interrumpir consultas en ejecucion | | Optimizacion de datos | El comando OPTIMIZE fusiona archivos pequenos para mantener el rendimiento |

Cuando el examen requiere soporte de UPDATE o DELETE en Athena, el punto clave es que se necesita el formato de tabla Apache Iceberg.

---

User Defined Functions (UDFs)

Athena tambien soporta funciones definidas por el usuario.

Crear funciones personalizadas mediante AWS Lambda y llamarlas desde SQL Encapsular logica compleja (ej: indexacion geoespacial) Ejecutar operaciones en Athena que son dificiles de implementar solo con SQL estandar

---

Casos de uso principales

| Caso de uso | Descripcion | | --- | --- | | Analisis de logs | Analisis de VPC Flow Logs, logs de ELB, logs de CloudTrail | | Analisis de costos y uso | Consultar AWS Cost & Usage Reports directamente desde S3 | | BI y reportes | Integracion con QuickSight, Tableau, Power BI | | Exploracion de data lake | Consultar datos brutos de S3 al instante sin esquemas predefinidos |

---

Resumen rapido de referencia

| Palabra clave | Concepto clave | | --- | --- | | SQL serverless | Consulta directa de datos en S3, sin infraestructura | | $5/TB | Se cobra solo por los datos escaneados | | Parquet / ORC | Formatos columnares para reduccion de costos | | Particionamiento | Escanear solo datos relevantes para optimizar rendimiento y costos | | Glue Data Catalog | Almacen de metadatos de Athena | | MSCK REPAIR TABLE | Sincronizar metadatos de nuevas particiones en S3 | | Workgroups | Control de costos y acceso por equipo | | Federated Query | Consulta SQL unica a multiples fuentes de datos | | Apache Iceberg | Transacciones ACID, soporte de viaje en el tiempo | | UDF | Funciones definidas por el usuario basadas en Lambda |

---

Conclusion

Amazon Athena es un servicio recurrente en DEA-C01 para preguntas sobre consulta de data lake y escenarios de optimizacion de costos.

Para el examen, es especialmente importante comprender claramente lo siguiente:

Reduccion de costos mediante formatos Parquet/ORC y particionamiento Patrones de integracion con Glue Data Catalog Consulta de multiples fuentes mediante Federated Query Soporte de transacciones ACID a traves de Apache Iceberg

Dominar estos conceptos te preparara para responder la mayoria de las preguntas sobre consultas de data lake del DEA-C01**.

Volver a la lista del blog