CDL cobre solucoes de dados em aproximadamente 15-20% do exame. Saber qual servico de armazenamento usar e quando, e como construir pipelines de dados sao as habilidades essenciais.
Por que os dados importam
Os dados sao como o petroleo moderno: dados brutos nao tem valor, mas quando refinados por analise, impulsionam decisoes de negocios. Um supermercado que analisa padroes de compra toma decisoes muito mais precisas do que um que depende da intuicao.
Tres tipos de dados
| Tipo | Formato | Armazenamento | |------|---------|---------------| | Estruturado | Tabelas, linhas/colunas | Cloud SQL, Spanner, BigQuery | | Semiestruturado | JSON, XML | Firestore, Bigtable | | Nao estruturado | Imagens, videos, arquivos | Cloud Storage |
Servicos de armazenamento do Google Cloud
Cloud Storage armazena qualquer tipo de arquivo em buckets. Durabilidade de 11 noves. Usado como data lake. Classes por frequencia de acesso: Standard (frequente), Nearline (mensal, min. 30 dias), Coldline (trimestral, min. 90 dias), Archive (anual, min. 365 dias, mais barato).
Cloud SQL e MySQL/PostgreSQL/SQL Server totalmente gerenciado. O Google cuida de patches, backups, replicacao e failover. Ideal para apps web existentes e cargas OLTP. Escalonamento vertical facil; horizontal com limites.
Cloud Spanner e um banco de dados relacional distribuido globalmente. Mantem transacoes ACID completas com escalonamento horizontal ilimitado em todo o mundo. Ideal para sistemas financeiros globais e apps de missao critica.
Cloud Bigtable e um banco de dados NoSQL de colunas largas. Processa milhoes de leituras/escritas por segundo e escala para petabytes. Ideal para: IoT, series temporais, analise de comportamento. Nao suporta SQL.
BigQuery e o data warehouse serverless do Google. Analisa terabytes/petabytes com SQL padrao sem gerenciar servidores. Otimizado para OLAP. Combina armazenamento e computacao.
Firestore e um banco de dados NoSQL de documentos JSON totalmente gerenciado. Recurso principal: sincronizacao em tempo real com todos os clientes conectados. Ideal para apps moveis/web.
| Servico | Tipo | Caso de uso principal | |---------|------|----------------------| | Cloud Storage | Armazenamento de objetos | Arquivos, imagens, videos, backups | | Cloud SQL | Relacional (gerenciado) | Apps web, migracao MySQL/PostgreSQL | | Cloud Spanner | Relacional (global) | Transacoes globais, escala ilimitada | | Bigtable | NoSQL (colunas largas) | IoT, series temporais | | BigQuery | Data warehouse | SQL analitico em grande escala | | Firestore | NoSQL (documentos) | Apps moveis/web, sincronizacao real |
Pipelines de dados
Pub/Sub e um servico de mensageria assincrona publicador-assinante. Desacopla produtores e consumidores de dados. Ideal para IoT e arquiteturas orientadas a eventos. Dataflow (baseado em Apache Beam, serverless) processa dados em batch e streaming com o mesmo codigo. Looker e a plataforma BI para criar dashboards interativos sobre BigQuery.
Pipeline tipico: Pub/Sub → Dataflow → BigQuery → Looker
!Etapas do pipeline de dados: ingestão, processamento, análise, visualização
Pontos-chave do exame
"Tabelas, linhas/colunas, SQL" -- Dados estruturados
"JSON/XML, estrutura flexivel" -- Dados semiestruturados
"Imagens, videos, sem formato fixo" -- Dados nao estruturados
"Armazenar qualquer arquivo, objeto" -- Cloud Storage
"Acesso frequente" -- Standard / "Mensal" -- Nearline / "Trimestral" -- Coldline / "Anual" -- Archive
"MySQL/PostgreSQL gerenciado, apps web" -- Cloud SQL
"Transacoes globais, escala ilimitada" -- Cloud Spanner
"IoT, series temporais, milhoes de ops/seg" -- Cloud Bigtable
"SQL analitico em grande escala, serverless" -- BigQuery
"Apps moveis/web, sincronizacao real" -- Firestore
"Mensageria async publicador-assinante" -- Pub/Sub
"Batch+streaming unificado, Apache Beam" -- Dataflow
"Dashboards BI, LookML" -- Looker