Amazon EMR - Guia Completo (Pontos-Chave para o Exame DEA-C01)
Introducao
O Amazon EMR (Elastic MapReduce) aparece tanto no Domain 1: Data Ingestion and Transformation (34%) quanto no Domain 2: Data Store Management (26%) do exame DEA-C01.
O EMR e um servico totalmente gerenciado que facilita a execucao de frameworks de big data como Hadoop e Spark na AWS. O exame avalia com frequencia a arquitetura do cluster, as opcoes de armazenamento e os tipos de cluster.
Este guia cobre os conceitos essenciais que voce precisa conhecer para se preparar para o exame.
---
O que e o Amazon EMR?
Vamos comecar com os fundamentos do EMR.
| Aspecto | Detalhe | | --- | --- | | Definicao | Servico de processamento de big data totalmente gerenciado baseado no Apache Hadoop | | Frameworks suportados | Hadoop, Apache Spark, HBase, Presto, Flink | | Casos de uso principais | Analise de logs, analise financeira, trabalhos ETL | | Infraestrutura | Amazon EC2 + Amazon S3 | | Metodos de acesso | Console AWS, CLI, SDK, API do EMR, SSH |
O EMR roda sobre EC2 e permite acesso direto ao SO via SSH. Embora seja totalmente gerenciado, a capacidade de acessar o SO subjacente o distingue de outros servicos gerenciados.
---
Arquitetura de nos do cluster (3 tipos de nos)
Os clusters do EMR sao compostos por tres tipos de nos conforme seus papeis. Essa estrutura aparece no exame regularmente.
| Tipo de no | Papel | Armazenamento | Computacao | Observacoes | | --- | --- | --- | --- | --- | | Master Node | Coordena e gerencia todo o cluster | X | X | Atribuicao de tarefas, recuperacao de falhas, gestao do estado | | Core Node | Armazenamento + computacao | O | O | Trata a replicacao de dados, essencial para a operacao | | Task Node | Apenas computacao (opcional) | X | O | Pode usar instancias Spot para reducao de custos |
Os Task Nodes nao armazenam dados e realizam apenas computacao. Cenarios com instancias Spot em Task Nodes para reducao de custos aparecem frequentemente no exame.
!Tipos de nó de cluster do EMR: Master, Core, Task
Comparacao de opcoes de armazenamento (HDFS vs EMRFS vs Local)
A comparacao de opcoes de armazenamento e uma questao comum no DEA-C01.
| Armazenamento | Descricao | Persistencia | Casos de uso principais | | --- | --- | --- | --- | | HDFS | Sistema de arquivos distribuido, divisao em blocos de 128MB e replicacao | Temporario (excluido ao encerrar o cluster) | Dados de processamento intermediario, armazenamento temporario | | EMRFS | Usa o S3 como sistema de arquivos compativel com Hadoop | Persistente (mantido apos encerrar o cluster) | Dados de entrada/saida, retencao de longo prazo | | Local File System | Disco local da instancia EC2 | Temporario (excluido ao encerrar a instancia) | Cache, dados de processamento temporario |
Quando o exame apresenta um cenario sobre "manter dados apos encerrar o cluster", a resposta e EMRFS (S3). Os dados do HDFS sao perdidos quando o cluster e encerrado.
---
Metastore externo
Por padrao, o metastore do Hive e armazenado em um banco de dados MySQL local no Master Node. Quando o cluster e encerrado, o metastore e perdido junto com ele.
Para resolver isso, metastores externos sao utilizados.
| Opcao | Caracteristicas | | --- | --- | | AWS Glue Data Catalog | Totalmente gerenciado, integra-se com Athena e Redshift | | Amazon RDS / Aurora | Alta disponibilidade e durabilidade, adequado para gestao de metadados em larga escala |
Quando arquivos sao adicionados diretamente ao HDFS ou S3, o Hive pode nao reconhecer as novas particoes. O comando MSCK REPAIR TABLE resolve isso.
Esse comando escaneia o sistema de arquivos em busca de novas particoes e as sincroniza com o metastore do Hive.
---
Tipos de cluster: transitorio vs de longa duracao
| Tipo | Cluster transitorio | Cluster de longa duracao | | --- | --- | --- | | Duracao | Encerra automaticamente apos completar o trabalho | Executa continuamente | | Casos de uso principais | ETL em lote, trabalhos de processamento periodico | Analise interativa, servicos permanentes | | Custo | Cobrado apenas pelo tempo de execucao, muito eficiente em custos | Cobranca continua pelo tempo de atividade do cluster |
O processamento periodico em lote usa clusters transitorios, enquanto o acesso permanente requer clusters de longa duracao.
---
Amazon EMR Serverless
O EMR Serverless e uma opcao serverless que permite executar aplicacoes Spark ou Hive sem provisionar ou gerenciar clusters.
Caracteristicas principais:
A AWS gerencia automaticamente a otimizacao e o escalamento da capacidade do cluster Suporta Apache Spark e Apache Hive Permite focar em cargas de trabalho analiticas sem a sobrecarga de gestao de infraestrutura
Quando o exame apresenta um cenario sobre "executar trabalhos Spark sem gerenciar clusters", a resposta e EMR Serverless.
---
AWS Graviton2 e sobrecarga de memoria do Spark
Instancias AWS Graviton2
Processadores personalizados baseados em ARM que oferecem ate 40% melhor relacao preco-desempenho comparado com instancias x86 equivalentes. Particularmente eficazes para cargas de trabalho intensivas em dados como Spark e Hadoop.
Sobrecarga de memoria do Spark
O Spark gera aproximadamente 10% de sobrecarga adicional de memoria sobre a memoria solicitada para o driver e os executors. Isso e utilizado para operacoes internas como tarefas de shuffle e execucao de tarefas. Essa sobrecarga deve ser considerada na configuracao de memoria para prevenir erros OOM (Out-of-Memory).
---
Resumo rapido de referencia
| Palavra-chave | Conceito-chave | | --- | --- | | EMR + Spark | Processamento de big data em memoria | | Master Node | Apenas gestao do cluster (sem armazenamento nem computacao) | | Core Node | Armazenamento + computacao (obrigatorio) | | Task Node | Apenas computacao (opcional, compativel com instancias Spot) | | HDFS | Armazenamento temporario (excluido ao encerrar o cluster) | | EMRFS | Armazenamento persistente baseado em S3 | | MSCK REPAIR TABLE | Sincronizacao de metadados de particoes do Hive | | Cluster transitorio | ETL em lote, eficiente em custos | | EMR Serverless | Sem necessidade de gestao de cluster | | Graviton2 | Ate 40% melhor relacao preco-desempenho vs x86 |
---
Conclusao
O Amazon EMR e um servico essencial para cenarios de processamento de big data no DEA-C01.
Para o exame, e especialmente importante compreender claramente o seguinte:
As diferencas de papeis entre os tres tipos de nos A diferenca de persistencia entre HDFS e EMRFS A diferenca de custos entre clusters transitorios e de longa duracao
Dominar esses conceitos ira prepara-lo para responder a maioria das questoes sobre processamento de big data do DEA-C01.