CDL cubre soluciones de datos en aproximadamente 15-20% del examen. Saber que servicio de almacenamiento usar y cuando, y como construir pipelines de datos son las habilidades clave.
Por que importan los datos
Los datos son como el petroleo moderno: los datos brutos no tienen valor, pero cuando se refinan a traves del analisis, impulsan las decisiones empresariales. Un supermercado que analiza los patrones de compra toma decisiones mucho mas precisas que uno que depende de la intuicion.
Tres tipos de datos
| Tipo | Formato | Almacenamiento | |------|---------|----------------| | Estructurado | Tablas, filas/columnas | Cloud SQL, Spanner, BigQuery | | Semiestructurado | JSON, XML | Firestore, Bigtable | | No estructurado | Imagenes, videos, archivos | Cloud Storage |
Servicios de almacenamiento de Google Cloud
Cloud Storage almacena cualquier tipo de archivo en buckets. Durabilidad de 11 nueves. Usado como data lake. Clases por frecuencia de acceso: Standard (frecuente), Nearline (mensual, min. 30 dias), Coldline (trimestral, min. 90 dias), Archive (anual, min. 365 dias, mas barato).
Cloud SQL es MySQL/PostgreSQL/SQL Server completamente gestionado. Google maneja parches, backups, replicacion y failover. Ideal para apps web existentes y cargas OLTP. Escala vertical facil; horizontal con limites.
Cloud Spanner es una base de datos relacional distribuida globalmente. Mantiene transacciones ACID completas con escala horizontal ilimitada a nivel mundial. Ideal para sistemas financieros globales y apps de mision critica.
Cloud Bigtable es una base de datos NoSQL de columnas anchas. Procesa millones de lecturas/escrituras por segundo y escala a petabytes. Ideal para: IoT, series temporales, analisis de comportamiento. No soporta SQL.
BigQuery es el almacen de datos serverless de Google. Analiza terabytes/petabytes con SQL estandar sin gestionar servidores. Optimizado para OLAP (consultas analiticas a gran escala). Combina almacenamiento y computo.
Firestore es una base de datos NoSQL de documentos JSON completamente gestionada. Caracteristica clave: sincronizacion en tiempo real con todos los clientes conectados. Ideal para apps moviles/web.
| Servicio | Tipo | Caso de uso principal | |---------|------|----------------------| | Cloud Storage | Almacenamiento de objetos | Archivos, imagenes, videos, backups | | Cloud SQL | Relacional (gestionado) | Apps web, migracion MySQL/PostgreSQL | | Cloud Spanner | Relacional (global) | Transacciones globales, escala ilimitada | | Bigtable | NoSQL (columnas anchas) | IoT, series temporales | | BigQuery | Almacen de datos | SQL analitico a gran escala | | Firestore | NoSQL (documentos) | Apps moviles/web, sincronizacion real |
Pipelines de datos
Pub/Sub es un servicio de mensajeria asincrona publicador-suscriptor. Desacopla productores y consumidores de datos. Ideal para IoT, arquitecturas orientadas a eventos. Dataflow (basado en Apache Beam, serverless) procesa datos en batch y streaming con el mismo codigo. Looker es la plataforma BI para crear dashboards interactivos sobre BigQuery.
Pipeline tipico: Pub/Sub → Dataflow → BigQuery → Looker
!Etapas del pipeline de datos: ingestar, procesar, analizar, visualizar
Puntos clave del examen
"Tablas, filas/columnas, SQL" -- Datos estructurados
"JSON/XML, estructura flexible" -- Datos semiestructurados
"Imagenes, videos, sin formato fijo" -- Datos no estructurados
"Almacenar cualquier archivo, objeto" -- Cloud Storage
"Acceso frecuente" -- Standard / "Mensual" -- Nearline / "Trimestral" -- Coldline / "Anual" -- Archive
"MySQL/PostgreSQL gestionado, apps web" -- Cloud SQL
"Transacciones globales, escala ilimitada" -- Cloud Spanner
"IoT, series temporales, millones de ops/seg" -- Cloud Bigtable
"SQL analitico a gran escala, serverless" -- BigQuery
"Apps moviles/web, sincronizacion real" -- Firestore
"Mensajeria async publicador-suscriptor" -- Pub/Sub
"Batch+streaming unificado, Apache Beam" -- Dataflow
"Dashboards BI, LookML" -- Looker