EMR - Guia Completo

Amazon EMR é o serviço ideal para executar Hadoop, Spark e outros frameworks de big data na AWS em escala.

Amazon EMR - Guia Completo (Pontos-Chave para o Exame DEA-C01)

Introducao

O Amazon EMR (Elastic MapReduce) aparece tanto no Domain 1: Data Ingestion and Transformation (34%) quanto no Domain 2: Data Store Management (26%) do exame DEA-C01.

O EMR e um servico totalmente gerenciado que facilita a execucao de frameworks de big data como Hadoop e Spark na AWS. O exame avalia com frequencia a arquitetura do cluster, as opcoes de armazenamento e os tipos de cluster.

Este guia cobre os conceitos essenciais que voce precisa conhecer para se preparar para o exame.

---

O que e o Amazon EMR?

Vamos comecar com os fundamentos do EMR.

| Aspecto | Detalhe | | --- | --- | | Definicao | Servico de processamento de big data totalmente gerenciado baseado no Apache Hadoop | | Frameworks suportados | Hadoop, Apache Spark, HBase, Presto, Flink | | Casos de uso principais | Analise de logs, analise financeira, trabalhos ETL | | Infraestrutura | Amazon EC2 + Amazon S3 | | Metodos de acesso | Console AWS, CLI, SDK, API do EMR, SSH |

O EMR roda sobre EC2 e permite acesso direto ao SO via SSH. Embora seja totalmente gerenciado, a capacidade de acessar o SO subjacente o distingue de outros servicos gerenciados.

---

Arquitetura de nos do cluster (3 tipos de nos)

Os clusters do EMR sao compostos por tres tipos de nos conforme seus papeis. Essa estrutura aparece no exame regularmente.

| Tipo de no | Papel | Armazenamento | Computacao | Observacoes | | --- | --- | --- | --- | --- | | Master Node | Coordena e gerencia todo o cluster | X | X | Atribuicao de tarefas, recuperacao de falhas, gestao do estado | | Core Node | Armazenamento + computacao | O | O | Trata a replicacao de dados, essencial para a operacao | | Task Node | Apenas computacao (opcional) | X | O | Pode usar instancias Spot para reducao de custos |

Os Task Nodes nao armazenam dados e realizam apenas computacao. Cenarios com instancias Spot em Task Nodes para reducao de custos aparecem frequentemente no exame.

!Tipos de nó de cluster do EMR: Master, Core, Task

Comparacao de opcoes de armazenamento (HDFS vs EMRFS vs Local)

A comparacao de opcoes de armazenamento e uma questao comum no DEA-C01.

| Armazenamento | Descricao | Persistencia | Casos de uso principais | | --- | --- | --- | --- | | HDFS | Sistema de arquivos distribuido, divisao em blocos de 128MB e replicacao | Temporario (excluido ao encerrar o cluster) | Dados de processamento intermediario, armazenamento temporario | | EMRFS | Usa o S3 como sistema de arquivos compativel com Hadoop | Persistente (mantido apos encerrar o cluster) | Dados de entrada/saida, retencao de longo prazo | | Local File System | Disco local da instancia EC2 | Temporario (excluido ao encerrar a instancia) | Cache, dados de processamento temporario |

Quando o exame apresenta um cenario sobre "manter dados apos encerrar o cluster", a resposta e EMRFS (S3). Os dados do HDFS sao perdidos quando o cluster e encerrado.

---

Metastore externo

Por padrao, o metastore do Hive e armazenado em um banco de dados MySQL local no Master Node. Quando o cluster e encerrado, o metastore e perdido junto com ele.

Para resolver isso, metastores externos sao utilizados.

| Opcao | Caracteristicas | | --- | --- | | AWS Glue Data Catalog | Totalmente gerenciado, integra-se com Athena e Redshift | | Amazon RDS / Aurora | Alta disponibilidade e durabilidade, adequado para gestao de metadados em larga escala |

Quando arquivos sao adicionados diretamente ao HDFS ou S3, o Hive pode nao reconhecer as novas particoes. O comando MSCK REPAIR TABLE resolve isso.

Esse comando escaneia o sistema de arquivos em busca de novas particoes e as sincroniza com o metastore do Hive.

---

Tipos de cluster: transitorio vs de longa duracao

| Tipo | Cluster transitorio | Cluster de longa duracao | | --- | --- | --- | | Duracao | Encerra automaticamente apos completar o trabalho | Executa continuamente | | Casos de uso principais | ETL em lote, trabalhos de processamento periodico | Analise interativa, servicos permanentes | | Custo | Cobrado apenas pelo tempo de execucao, muito eficiente em custos | Cobranca continua pelo tempo de atividade do cluster |

O processamento periodico em lote usa clusters transitorios, enquanto o acesso permanente requer clusters de longa duracao.

---

Amazon EMR Serverless

O EMR Serverless e uma opcao serverless que permite executar aplicacoes Spark ou Hive sem provisionar ou gerenciar clusters.

Caracteristicas principais:

A AWS gerencia automaticamente a otimizacao e o escalamento da capacidade do cluster Suporta Apache Spark e Apache Hive Permite focar em cargas de trabalho analiticas sem a sobrecarga de gestao de infraestrutura

Quando o exame apresenta um cenario sobre "executar trabalhos Spark sem gerenciar clusters", a resposta e EMR Serverless.

---

AWS Graviton2 e sobrecarga de memoria do Spark

Instancias AWS Graviton2

Processadores personalizados baseados em ARM que oferecem ate 40% melhor relacao preco-desempenho comparado com instancias x86 equivalentes. Particularmente eficazes para cargas de trabalho intensivas em dados como Spark e Hadoop.

Sobrecarga de memoria do Spark

O Spark gera aproximadamente 10% de sobrecarga adicional de memoria sobre a memoria solicitada para o driver e os executors. Isso e utilizado para operacoes internas como tarefas de shuffle e execucao de tarefas. Essa sobrecarga deve ser considerada na configuracao de memoria para prevenir erros OOM (Out-of-Memory).

---

Resumo rapido de referencia

| Palavra-chave | Conceito-chave | | --- | --- | | EMR + Spark | Processamento de big data em memoria | | Master Node | Apenas gestao do cluster (sem armazenamento nem computacao) | | Core Node | Armazenamento + computacao (obrigatorio) | | Task Node | Apenas computacao (opcional, compativel com instancias Spot) | | HDFS | Armazenamento temporario (excluido ao encerrar o cluster) | | EMRFS | Armazenamento persistente baseado em S3 | | MSCK REPAIR TABLE | Sincronizacao de metadados de particoes do Hive | | Cluster transitorio | ETL em lote, eficiente em custos | | EMR Serverless | Sem necessidade de gestao de cluster | | Graviton2 | Ate 40% melhor relacao preco-desempenho vs x86 |

---

Conclusao

O Amazon EMR e um servico essencial para cenarios de processamento de big data no DEA-C01.

Para o exame, e especialmente importante compreender claramente o seguinte:

As diferencas de papeis entre os tres tipos de nos A diferenca de persistencia entre HDFS e EMRFS A diferenca de custos entre clusters transitorios e de longa duracao

Dominar esses conceitos ira prepara-lo para responder a maioria das questoes sobre processamento de big data do DEA-C01.

Voltar à lista do blog