No exame SAA-C03, questoes sobre pipelines de dados representam aproximadamente 16% do total. Se voce entender se processar dados em tempo real ou em lotes, e quais combinacoes de servicos sao otimas, podera responder esta secao com confianca.
O que e streaming em tempo real?
Imagine uma esteira transportadora em uma fabrica. Os produtos se movem continuamente e os trabalhadores processam cada um sem parar. Isso e processamento em streaming. Por outro lado, coletar os produtos de um dia em um deposito e processa-los todos a noite e processamento em lote (batch).
No exame, quando voce ver "tempo real", "imediatamente" ou "fluxo continuo de dados", pense em streaming. Quando voce ver "processamento noturno", "transformacao em massa de dados" ou "execucao periodica", pense em batch.
Amazon Kinesis — O nucleo do streaming em tempo real
O Kinesis e uma plataforma para coletar e processar grandes quantidades de dados em tempo real. Possui tres servicos.
Kinesis Data Streams
Coleta dados em tempo real e permite que varios consumidores os processem cada um a seu modo. Como varias equipes em uma fabrica pegando o que precisam da mesma esteira transportadora.
Os dados sao retidos por 24 horas por padrao (ate 365 dias) A capacidade e gerenciada em shards: cada shard lida com 1 MB/s de entrada e 2 MB/s de saida Varios consumidores (Lambda, Kinesis Data Analytics, apps EC2) podem ler o mesmo stream simultaneamente Voce deve implementar sua propria logica de processamento personalizado
Quando escolher Kinesis Data Streams: procure por "ingestao em tempo real + processamento personalizado", "varios consumidores lendo o mesmo stream", "necessidade de reproduzir dados".
Kinesis Data Firehose
Recebe dados em tempo real e os entrega automaticamente para destinos como S3, Redshift, OpenSearch ou Splunk. Totalmente gerenciado e sem servidor, sem necessidade de gerenciar shards.
Como um classificador automatico no final de uma esteira transportadora que envia cada produto para o deposito correto.
Armazena dados em buffer antes de entrega-los (a cada 60 segundos ou a cada 1-128 MB) Pode anexar uma funcao Lambda para transformar dados antes da entrega Nenhum codigo de consumidor necessario, os dados chegam automaticamente ao destino
Quando escolher Kinesis Data Firehose: procure por "salvar automaticamente dados em tempo real no S3/Redshift", "streaming sem servidor", "sem necessidade de codigo de consumidor personalizado".
Kinesis Data Analytics
Executa SQL ou Apache Flink em dados de streaming para analitica em tempo real. Como observar itens se mover pela esteira transportadora e realizar agregacao instantanea, filtragem ou deteccao de anomalias.
Util para agregacoes por segundo, medias moveis e deteccao de anomalias Pode enviar resultados de volta para o Kinesis Data Streams ou Firehose
Processamento em lote e ETL
AWS Glue — ETL sem servidor
ETL significa Extrair, Transformar, Carregar. O Glue automatiza esse processo sem gerenciamento de servidor.
Crawlers do Glue: varrem automaticamente S3, RDS e outras fontes para detectar esquemas Catalogo de dados do Glue: armazena metadados de esquemas descobertos (referenciado pelo Athena e EMR) Jobs ETL do Glue: executam scripts Python ou Scala para transformar dados Glue Studio: cria visualmente pipelines ETL sem escrever codigo
Quando escolher AWS Glue: procure por "ETL sem servidor", "descoberta automatica de esquemas", "catalogo de dados", "automatizar transformacao de dados no S3".
Amazon EMR — Clusters Hadoop/Spark em grande escala
O EMR executa frameworks de big data como Hadoop, Spark, Hive e Presto em clusters EC2. Use para transformacao de dados em grande escala, pre-processamento de machine learning e analitica complexa.
Glue vs EMR: o Glue e sem servidor (sem necessidade de gerenciamento). O EMR permite configurar clusters voce mesmo para personalizacao mais flexivel.
Quando escolher Amazon EMR: procure por "Hadoop/Spark", "transformacao de dados em grande escala", "gerenciar clusters diretamente", "frameworks personalizados de big data".
AWS DataSync
Transfere rapidamente grandes quantidades de dados de sistemas de arquivos on-premises para S3, EFS ou FSx. Use para migracoes de dados ou tarefas de sincronizacao periodica.
Quando escolher DataSync: procure por "transferencia em massa de dados on-premises para S3" ou "sincronizacao periodica de arquivos".
Servicos de analitica
Amazon Athena — SQL sobre S3
Analisa dados armazenados no S3 diretamente usando SQL, sem mover dados para um banco de dados separado. Integra com o Catalogo de dados do Glue para obter automaticamente definicoes de tabelas.
Totalmente sem servidor: voce paga apenas pelos dados varridos pelas suas consultas Suporta CSV, JSON, Parquet, ORC e outros formatos Usar formatos em colunas (Parquet) otimiza tanto a velocidade de consulta quanto o custo
Quando escolher Athena: procure por "consultar dados S3 com SQL", "consultas sem servidor", "analisar dados S3 diretamente sem banco de dados separado".
Amazon Redshift — Data Warehouse
Um data warehouse para analisar dados estruturados em escala de petabytes com alto desempenho. Otimizado para OLAP, grandes consultas de agregacao para analitica.
Redshift Spectrum: consulta dados de S3 diretamente do Redshift sem move-los Lembre-se: OLTP (transacoes) = RDS/Aurora/DynamoDB. OLAP (analitica) = Redshift.
Quando escolher Redshift: procure por "data warehouse em grande escala", "OLAP", "grandes consultas de agregacao e analitica".
Amazon QuickSight — Visualizacao BI
Uma ferramenta BI sem servidor que se conecta ao Athena, Redshift, S3 e outras fontes para criar paineis e graficos.
Quando escolher QuickSight: procure por "painel BI" ou "visualizacao de dados".
AWS Lake Formation — Gerenciamento do data lake
Facilita a construcao de um data lake centrado no S3 e gerencia permissoes de acesso a dados detalhadas. Integra com Glue, Athena e Redshift.
Quando escolher Lake Formation: procure por "construir um data lake", "controle centralizado de acesso a dados", "seguranca no nivel de coluna".