Armazenar e processar dados é apenas metade do trabalho. Para criar valor de negócio, você precisa encontrar padrões e insights escondidos dentro dos dados. A etapa de análise transforma dados brutos em respostas para perguntas de negócio. A visualização então apresenta essas respostas como gráficos e dashboards que não especialistas podem entender. As questões do exame DEA-C01 sobre análise perguntam qual serviço escolher em uma determinada situação e como otimizar custo e desempenho.
Comparando serviços de análise
A AWS oferece vários serviços para análise de dados. Cada um tem diferentes pontos fortes e se encaixa em diferentes situações.
| Serviço | Características | Melhor situação | |---------|----------------|----------------| | Athena | SQL serverless, consulta S3 diretamente | Análise ad-hoc, eficiência de custo | | Redshift SQL | Data warehouse em escala de petabytes | Agregações complexas, grandes conjuntos estruturados | | Athena Notebooks | SQL + PySpark interativo | Análise exploratória, pré-processamento ML | | DataBrew | Análise visual sem código | Exploração de dados sem desenvolvedores, verificações de qualidade |
Como escolher: Os dados estão no S3 e você os consulta ocasionalmente → Athena Milhares de consultas complexas todos os dias com alto desempenho → Redshift Misture SQL e Python para análise exploratória → Athena Notebooks Explore dados visualmente sem escrever SQL → DataBrew
Otimização do Athena
O Athena cobra com base na quantidade de dados escaneados por consulta. Escanear menos significa consultas mais rápidas e baratas.
Particionamento: Armazene dados em pastas organizadas por data, região, categoria ou outras dimensões. Quando uma consulta filtra em uma coluna de partição, o Athena escaneia apenas as pastas de partição relevantes em vez de todos os dados.
Formatos colunares (Parquet, ORC): CSV armazena dados linha por linha. Mesmo que você precise de apenas duas colunas, lê cada coluna de cada linha. Parquet e ORC armazenam dados coluna por coluna. Uma consulta como lê apenas as colunas name e age — todos os outros dados de colunas são ignorados completamente. Isso reduz dramaticamente a quantidade escaneada, reduzindo tanto o custo quanto o tempo de consulta.
Compressão: Aplicar compressão Snappy ou Gzip reduz o tamanho dos arquivos, o que reduz os custos de escaneamento. Usar Parquet com compressão Snappy juntos é uma prática recomendada padrão.
Controles de custo: Definir bytes máximos escaneados por consulta nas configurações do workgroup Especificar apenas colunas necessárias em vez de SELECT Sempre incluir colunas de partição em cláusulas WHERE Usar LIMIT em consultas exploratórias para evitar ler o conjunto completo
QuickSight — Dashboards interativos
O Amazon QuickSight é a ferramenta de business intelligence (BI) da AWS. Os usuários criam gráficos e dashboards através de arrastar e soltar sem escrever SQL.
Motor SPICE: SPICE (Super-fast, Parallel, In-memory Calculation Engine) é o cache em memória do QuickSight. Importe dados para o SPICE uma vez, e o QuickSight serve consultas a partir da memória sem acessar o banco de dados de origem a cada vez. Grandes conjuntos de dados carregam rapidamente, e não importa quantos usuários estejam visualizando dashboards simultaneamente, o banco de dados de origem não vê nenhuma carga.
Fontes de dados: O QuickSight se conecta a uma ampla variedade de fontes: S3 (via Athena) Redshift RDS / Aurora DynamoDB Serviços SaaS como Salesforce e SAP Uploads diretos de arquivos (CSV, Excel)
Embedding: Embed dashboards do QuickSight diretamente dentro de sua própria aplicação web. Os usuários visualizam dashboards dentro da aplicação sem fazer login no console AWS.
ML Insights: Recursos de aprendizado de máquina integrados ao QuickSight. Detecte anomalias automaticamente nos dados, preveja valores futuros ou execute análise de contribuição (quais fatores causaram uma mudança). Nenhum conhecimento de aprendizado de máquina é necessário.
Técnicas de análise SQL
Vários padrões SQL aparecem frequentemente no trabalho de análise de dados e nas questões do exame DEA-C01.
Funções de agregação:
Funções de janela: Calculam valores agregados por linha dentro de um grupo sem colapsar linhas como o GROUP BY faz. Use-as para classificação, totais acumulados e médias móveis enquanto mantém o detalhe de linha individual.
Pivot: Transforma valores de linhas em colunas. O Redshift implementa pivot usando CASE WHEN.
CTE (Common Table Expression): Divide uma consulta complexa em etapas nomeadas e legíveis usando cláusulas WITH.
Pontos-chave do exame
"Análise SQL serverless de dados S3" → Athena "Processamento de alto desempenho de consultas grandes e complexas" → Redshift "Reduzir custo do Athena com estrutura de pastas" → Particionamento "Reduzir custo do Athena com formato de arquivo" → Parquet ou ORC "Dashboards QuickSight rápidos" → Cache em memória SPICE "Detecção automática de anomalias no QuickSight" → ML Insights "Embed QuickSight na sua aplicação" → Embedding "Calcular agregados de grupo mantendo linhas individuais" → Funções de janela "Dividir uma consulta complexa em etapas legíveis" → CTE