Amazon Athena - Guia Completo (Pontos-Chave para o Exame DEA-C01)
Introducao
O Amazon Athena aparece com frequencia tanto no Domain 1: Data Ingestion and Transformation (34%) quanto no Domain 3: Data Operations and Support (22%) do exame DEA-C01.
Quando o cenario menciona "analisar dados do S3 diretamente com SQL", a resposta e Athena. E serverless, nao requer gestao de infraestrutura e cobra apenas pela quantidade de dados escaneados.
Este guia cobre os conceitos essenciais que voce precisa conhecer para se preparar para o exame.
---
O que e o Amazon Athena?
Vamos comecar com os fundamentos do Athena.
| Aspecto | Detalhe | | --- | --- | | Definicao | Servico de consultas interativas serverless para analisar dados do S3 com SQL padrao | | Gestao de infraestrutura | Nao necessaria (serverless) | | Modelo de precos | $5,00 por TB de dados escaneados | | Motor de consultas | Baseado no Apache Presto | | Gestao de metadados | Integrado com AWS Glue Data Catalog | | Visualizacao | Amazon QuickSight |
Pontos-chave para o exame:
"Analisar dados do S3 com SQL serverless" → Amazon Athena O custo e proporcional a quantidade de dados escaneados, portanto escanear menos significa menor custo
---
Formatos de dados suportados e eficiencia de custos
Compreender os formatos que o Athena suporta ajuda a resolver questoes de otimizacao de custos.
| Formato | Tipo | Caracteristicas | Eficiencia de custo | | --- | --- | --- | --- | | CSV / TSV | Baseado em linhas | Simples e universal, mas ineficiente para grandes volumes | Baixa | | JSON | Semiestruturado | Suporta dados aninhados, adequado para logs | Baixa | | Parquet | Colunar | Escaneamento por coluna, alta eficiencia de compressao | Alta | | ORC | Colunar | Similar ao Parquet, suporta processamento dividido | Alta | | Avro | Baseado em linhas (divisivel) | Suporta evolucao de esquema, adequado para dados de streaming | Media |
Quando o exame pergunta "Como reduzir os custos do Athena?", a resposta e o formato Parquet ou ORC. Os formatos colunares escaneiam apenas as colunas necessarias para a consulta, reduzindo o volume de escaneamento e os custos.
---
Cinco estrategias de otimizacao de custos
A otimizacao de custos do Athena e um tema frequente no exame.
| Estrategia | Descricao | | --- | --- | | Usar formatos colunares | Converter para Parquet ou ORC para escanear apenas as colunas necessarias | | Compressao de dados | Aplicar compressao reduz a quantidade de dados escaneados | | Particionamento | Separar dados do S3 por data, regiao, etc. para escanear apenas particoes relevantes | | CTAS | Criar novas tabelas a partir de resultados SELECT para converter CSV em Parquet ou criar tabelas resumo | | Reutilizacao de resultados | Cachear e reutilizar resultados de consultas identicas para evitar re-escaneamento |
Para cenarios de reducao de custos, a combinacao de particionamento + formato Parquet + compressao de dados costuma ser a resposta correta.
!5 estratégias de otimização de custo do Athena
Integracao com o AWS Glue
O padrao de integracao entre o Athena e o Glue.
Caracteristicas principais:
O Glue Crawler escaneia o S3 e gera automaticamente os esquemas das tabelas O Athena utiliza o Glue Data Catalog como seu armazem de metadados Quando novas particoes sao adicionadas diretamente ao S3, usar MSCK REPAIR TABLE para sincronizar metadados
A combinacao Athena + Glue Data Catalog e o padrao de consulta de data lake serverless na AWS.
---
Controle de custos e gestao de acesso com Workgroups
Os Workgroups permitem separar a execucao de consultas em grupos logicos para gerenciamento.
| Funcao | Detalhe | | --- | --- | | Isolamento de historico | Isolar o historico de consultas por equipe ou departamento | | Controle de custos | Definir limites de escaneamento por workgroup com encerramento automatico ao exceder | | Gestao de acesso | Controlar permissoes de usuario por workgroup via integracao com IAM | | Alocacao de custos | Rastrear custos de consultas por departamento |
Quando o exame apresenta um cenario sobre "limitar os custos do Athena por equipe", a resposta e definir limites de escaneamento de dados nos Workgroups.
---
Federated Query para multiplas fontes de dados
O Federated Query permite consultar nao apenas o S3, mas diversas fontes de dados da AWS com uma unica instrucao SQL.
As fontes de dados suportadas incluem Amazon RDS, Redshift, DynamoDB e S3.
Caracteristicas principais:
Unir e analisar multiplas fontes sem ETL Usa SQL e PartiQL Implementado por meio de conectores de fontes de dados baseados em Lambda
Quando o exame pergunta sobre "analisar multiplos bancos de dados com SQL sem ETL complexo", a resposta e Athena Federated Query.
---
Transacoes ACID e Apache Iceberg
O Athena suporta transacoes ACID.
| Funcao | Detalhe | | --- | --- | | Suporte ACID | Consistencia de dados para operacoes INSERT, UPDATE, DELETE e MERGE | | Implementacao | AWS Glue Data Catalog + formato de tabela Apache Iceberg | | Viagem no tempo | Consultar dados em pontos especificos do passado | | Evolucao de esquema | Modificar esquemas sem interromper consultas em execucao | | Otimizacao de dados | O comando OPTIMIZE mescla arquivos pequenos para manter o desempenho |
Quando o exame requer suporte a UPDATE ou DELETE no Athena, o ponto-chave e que o formato de tabela Apache Iceberg e necessario.
---
User Defined Functions (UDFs)
O Athena tambem suporta funcoes definidas pelo usuario.
Criar funcoes personalizadas via AWS Lambda e chama-las a partir de SQL Encapsular logica complexa (ex: indexacao geoespacial) Executar operacoes no Athena que sao dificeis de implementar apenas com SQL padrao
---
Principais casos de uso
| Caso de uso | Descricao | | --- | --- | | Analise de logs | Analise de VPC Flow Logs, logs do ELB, logs do CloudTrail | | Analise de custos e uso | Consultar AWS Cost & Usage Reports diretamente do S3 | | BI e relatorios | Integracao com QuickSight, Tableau, Power BI | | Exploracao de data lake | Consultar dados brutos do S3 instantaneamente sem esquemas predefinidos |
---
Resumo rapido de referencia
| Palavra-chave | Conceito-chave | | --- | --- | | SQL serverless | Consulta direta de dados no S3, sem infraestrutura | | $5/TB | Cobra-se apenas pelos dados escaneados | | Parquet / ORC | Formatos colunares para reducao de custos | | Particionamento | Escanear apenas dados relevantes para otimizar desempenho e custos | | Glue Data Catalog | Armazem de metadados do Athena | | MSCK REPAIR TABLE | Sincronizar metadados de novas particoes no S3 | | Workgroups | Controle de custos e acesso por equipe | | Federated Query | Consulta SQL unica a multiplas fontes de dados | | Apache Iceberg | Transacoes ACID, suporte a viagem no tempo | | UDF | Funcoes definidas pelo usuario baseadas em Lambda |
---
Conclusao
O Amazon Athena e um servico recorrente no DEA-C01 para questoes sobre consulta de data lake e cenarios de otimizacao de custos.
Para o exame, e especialmente importante compreender claramente o seguinte:
Reducao de custos por meio de formatos Parquet/ORC e particionamento Padroes de integracao com o Glue Data Catalog Consulta de multiplas fontes via Federated Query Suporte a transacoes ACID por meio do Apache Iceberg
Dominar esses conceitos ira prepara-lo para responder a maioria das questoes sobre consultas de data lake do DEA-C01**.