Athena - Guia Completo

Sempre que um cenário de questão mencionar "consultar dados no S3 com SQL sem gerenciar infraestrutura," a resposta é Athena. Lembre-se: é serverless e você paga apenas pelos dados escaneados.

Amazon Athena - Guia Completo (Pontos-Chave para o Exame DEA-C01)

Introducao

O Amazon Athena aparece com frequencia tanto no Domain 1: Data Ingestion and Transformation (34%) quanto no Domain 3: Data Operations and Support (22%) do exame DEA-C01.

Quando o cenario menciona "analisar dados do S3 diretamente com SQL", a resposta e Athena. E serverless, nao requer gestao de infraestrutura e cobra apenas pela quantidade de dados escaneados.

Este guia cobre os conceitos essenciais que voce precisa conhecer para se preparar para o exame.

---

O que e o Amazon Athena?

Vamos comecar com os fundamentos do Athena.

| Aspecto | Detalhe | | --- | --- | | Definicao | Servico de consultas interativas serverless para analisar dados do S3 com SQL padrao | | Gestao de infraestrutura | Nao necessaria (serverless) | | Modelo de precos | $5,00 por TB de dados escaneados | | Motor de consultas | Baseado no Apache Presto | | Gestao de metadados | Integrado com AWS Glue Data Catalog | | Visualizacao | Amazon QuickSight |

Pontos-chave para o exame:

"Analisar dados do S3 com SQL serverless" → Amazon Athena O custo e proporcional a quantidade de dados escaneados, portanto escanear menos significa menor custo

---

Formatos de dados suportados e eficiencia de custos

Compreender os formatos que o Athena suporta ajuda a resolver questoes de otimizacao de custos.

| Formato | Tipo | Caracteristicas | Eficiencia de custo | | --- | --- | --- | --- | | CSV / TSV | Baseado em linhas | Simples e universal, mas ineficiente para grandes volumes | Baixa | | JSON | Semiestruturado | Suporta dados aninhados, adequado para logs | Baixa | | Parquet | Colunar | Escaneamento por coluna, alta eficiencia de compressao | Alta | | ORC | Colunar | Similar ao Parquet, suporta processamento dividido | Alta | | Avro | Baseado em linhas (divisivel) | Suporta evolucao de esquema, adequado para dados de streaming | Media |

Quando o exame pergunta "Como reduzir os custos do Athena?", a resposta e o formato Parquet ou ORC. Os formatos colunares escaneiam apenas as colunas necessarias para a consulta, reduzindo o volume de escaneamento e os custos.

---

Cinco estrategias de otimizacao de custos

A otimizacao de custos do Athena e um tema frequente no exame.

| Estrategia | Descricao | | --- | --- | | Usar formatos colunares | Converter para Parquet ou ORC para escanear apenas as colunas necessarias | | Compressao de dados | Aplicar compressao reduz a quantidade de dados escaneados | | Particionamento | Separar dados do S3 por data, regiao, etc. para escanear apenas particoes relevantes | | CTAS | Criar novas tabelas a partir de resultados SELECT para converter CSV em Parquet ou criar tabelas resumo | | Reutilizacao de resultados | Cachear e reutilizar resultados de consultas identicas para evitar re-escaneamento |

Para cenarios de reducao de custos, a combinacao de particionamento + formato Parquet + compressao de dados costuma ser a resposta correta.

!5 estratégias de otimização de custo do Athena

Integracao com o AWS Glue

O padrao de integracao entre o Athena e o Glue.

Caracteristicas principais:

O Glue Crawler escaneia o S3 e gera automaticamente os esquemas das tabelas O Athena utiliza o Glue Data Catalog como seu armazem de metadados Quando novas particoes sao adicionadas diretamente ao S3, usar MSCK REPAIR TABLE para sincronizar metadados

A combinacao Athena + Glue Data Catalog e o padrao de consulta de data lake serverless na AWS.

---

Controle de custos e gestao de acesso com Workgroups

Os Workgroups permitem separar a execucao de consultas em grupos logicos para gerenciamento.

| Funcao | Detalhe | | --- | --- | | Isolamento de historico | Isolar o historico de consultas por equipe ou departamento | | Controle de custos | Definir limites de escaneamento por workgroup com encerramento automatico ao exceder | | Gestao de acesso | Controlar permissoes de usuario por workgroup via integracao com IAM | | Alocacao de custos | Rastrear custos de consultas por departamento |

Quando o exame apresenta um cenario sobre "limitar os custos do Athena por equipe", a resposta e definir limites de escaneamento de dados nos Workgroups.

---

Federated Query para multiplas fontes de dados

O Federated Query permite consultar nao apenas o S3, mas diversas fontes de dados da AWS com uma unica instrucao SQL.

As fontes de dados suportadas incluem Amazon RDS, Redshift, DynamoDB e S3.

Caracteristicas principais:

Unir e analisar multiplas fontes sem ETL Usa SQL e PartiQL Implementado por meio de conectores de fontes de dados baseados em Lambda

Quando o exame pergunta sobre "analisar multiplos bancos de dados com SQL sem ETL complexo", a resposta e Athena Federated Query.

---

Transacoes ACID e Apache Iceberg

O Athena suporta transacoes ACID.

| Funcao | Detalhe | | --- | --- | | Suporte ACID | Consistencia de dados para operacoes INSERT, UPDATE, DELETE e MERGE | | Implementacao | AWS Glue Data Catalog + formato de tabela Apache Iceberg | | Viagem no tempo | Consultar dados em pontos especificos do passado | | Evolucao de esquema | Modificar esquemas sem interromper consultas em execucao | | Otimizacao de dados | O comando OPTIMIZE mescla arquivos pequenos para manter o desempenho |

Quando o exame requer suporte a UPDATE ou DELETE no Athena, o ponto-chave e que o formato de tabela Apache Iceberg e necessario.

---

User Defined Functions (UDFs)

O Athena tambem suporta funcoes definidas pelo usuario.

Criar funcoes personalizadas via AWS Lambda e chama-las a partir de SQL Encapsular logica complexa (ex: indexacao geoespacial) Executar operacoes no Athena que sao dificeis de implementar apenas com SQL padrao

---

Principais casos de uso

| Caso de uso | Descricao | | --- | --- | | Analise de logs | Analise de VPC Flow Logs, logs do ELB, logs do CloudTrail | | Analise de custos e uso | Consultar AWS Cost & Usage Reports diretamente do S3 | | BI e relatorios | Integracao com QuickSight, Tableau, Power BI | | Exploracao de data lake | Consultar dados brutos do S3 instantaneamente sem esquemas predefinidos |

---

Resumo rapido de referencia

| Palavra-chave | Conceito-chave | | --- | --- | | SQL serverless | Consulta direta de dados no S3, sem infraestrutura | | $5/TB | Cobra-se apenas pelos dados escaneados | | Parquet / ORC | Formatos colunares para reducao de custos | | Particionamento | Escanear apenas dados relevantes para otimizar desempenho e custos | | Glue Data Catalog | Armazem de metadados do Athena | | MSCK REPAIR TABLE | Sincronizar metadados de novas particoes no S3 | | Workgroups | Controle de custos e acesso por equipe | | Federated Query | Consulta SQL unica a multiplas fontes de dados | | Apache Iceberg | Transacoes ACID, suporte a viagem no tempo | | UDF | Funcoes definidas pelo usuario baseadas em Lambda |

---

Conclusao

O Amazon Athena e um servico recorrente no DEA-C01 para questoes sobre consulta de data lake e cenarios de otimizacao de custos.

Para o exame, e especialmente importante compreender claramente o seguinte:

Reducao de custos por meio de formatos Parquet/ORC e particionamento Padroes de integracao com o Glue Data Catalog Consulta de multiplas fontes via Federated Query Suporte a transacoes ACID por meio do Apache Iceberg

Dominar esses conceitos ira prepara-lo para responder a maioria das questoes sobre consultas de data lake do DEA-C01**.

Voltar à lista do blog