D
Cloud M14 intermedio 14 min

Capitulo 04

Google Cloud Platform para Datos

El mejor ROI de certificacion cloud para este segmento de mercado: GCP le gana a AWS 15% a 9%

BigQuery, Cloud Storage, Dataflow, Dataproc, Apps Script y que certificacion de GCP conviene para un perfil de Analista de Datos.

GCP por sobre AWS en esta muestra

En el analisis de mercado, GCP aparecio en el 15% de las ofertas contra el 9% de AWS. Si vas a invertir en una certificacion cloud, esta muestra sugiere que GCP tiene mejor retorno para este segmento — sin ignorar AWS del todo (siguiente capitulo).

4.1 BigQuery: el corazon analitico de GCP

BigQuery

M14

Data warehouse serverless de Google Cloud. Ejecuta SQL estandar sobre datasets de terabytes/petabytes sin que el usuario administre infraestructura. El costo se calcula por bytes escaneados, no por tiempo de computo reservado.

#gcp #cloud
sql query_bigquery.sql
-- BigQuery usa SQL estandar, con extensiones propias para arrays y structs
SELECT
    region,
    DATE_TRUNC(fecha, MONTH) AS mes,
    SUM(monto) AS total
FROM `mi-proyecto.ventas.transacciones`
WHERE fecha BETWEEN '2026-01-01' AND '2026-12-31'
GROUP BY region, mes
ORDER BY mes, total DESC;

Particionamiento y Clustering (BigQuery)

M14

El particionamiento divide fisicamente una tabla por una columna (tipicamente fecha), de forma que una query con filtro de fecha solo escanea la particion relevante. El clustering ordena los datos DENTRO de cada particion segun otra columna, acelerando filtros adicionales. Ambos reducen directamente el costo, porque BigQuery cobra por bytes escaneados.

#gcp #bigquery
Trampa comun en entrevistas

Decir “BigQuery es rapido porque es de Google” sin poder explicar POR QUE: es serverless (no administras clusters), separa storage de computo (escala cada uno independientemente), y usa un motor columnar (Dremel) optimizado para agregaciones sobre muchas filas y pocas columnas — el patron tipico de una query analitica.

Caso real: dashboard operacional sobre terabytes

El nicho “Google Workspace analytics” de la muestra de mercado (LATAM Airlines) consulta tablas de BigQuery con datos de vuelos y operaciones que crecen varios GB por dia. Sin particionar por fecha, un dashboard que muestra “operacion del ultimo mes” escanearia TODO el historico cada vez que alguien lo abre — con particionamiento por fecha, solo escanea los ~30 dias relevantes, bajando el costo y el tiempo de respuesta en ordenes de magnitud.

1. Usar SELECT * sobre una tabla particionada sin filtrar la particion
✗ SELECT * FROM ventas -- escanea la tabla completa aunque este particionada, si no filtras por la columna de particion
✓ SELECT columnas_necesarias FROM ventas WHERE fecha >= '2026-07-01' -- el filtro sobre la columna de particion es lo que activa el ahorro real

4.2 Cloud Storage: la base de cualquier data lake en GCP

Cloud Storage es el servicio de almacenamiento de objetos de GCP (equivalente a S3 en AWS). Los formatos columnares como Parquet y Avro son el estandar para guardar datos en un data lake, porque permiten leer solo las columnas necesarias en vez de la fila completa.

4.3 Dataflow: pipelines batch y streaming

Dataflow (Apache Beam)

M14

Servicio gestionado de GCP para ejecutar pipelines de procesamiento de datos, tanto batch (por lotes) como streaming (en tiempo real), basado en el modelo de programacion open-source Apache Beam.

#gcp #pipelines

A nivel conceptual: un pipeline de Dataflow lee de una fuente (Pub/Sub para streaming, Cloud Storage para batch), aplica transformaciones (map, filter, agregaciones con ventanas de tiempo), y escribe el resultado (tipicamente en BigQuery).

Por que Dataflow y no un script Python corriendo en un cron

Un script batch corriendo en un cron funciona para volumenes chicos, pero no escala automaticamente ni maneja fallos parciales (que pasa si el proceso muere a la mitad de 10 millones de eventos). Dataflow gestiona el paralelismo, los reintentos y el escalado de recursos por ti — la razon para elegirlo es cuando el volumen o la necesidad de tiempo real (streaming) supera lo que un script simple puede manejar de forma confiable.

Caso real: procesamiento de eventos en tiempo real

Una app que registra clicks/eventos de usuarios puede usar Dataflow en modo streaming para agregar metricas (ej. “eventos por minuto por region”) a medida que llegan, en vez de esperar un batch nocturno — util cuando el negocio necesita reaccionar el mismo dia, no al dia siguiente.

4.4 Dataproc: Spark y Hadoop gestionados

Dataproc es el servicio de GCP para correr clusters de Spark y Hadoop sin administrar la infraestructura subyacente. Es la opcion cuando ya existe codigo Spark (por ejemplo, migrando desde on-premise) y no se quiere reescribirlo en Beam/Dataflow.

4.5 Apps Script: el nicho “Google Workspace analytics”

Un hallazgo especifico del analisis de mercado: hay ofertas (la mejor pagada de control operacional en la muestra) que combinan BigQuery + Google Sheets avanzado + Looker Studio + Apps Script/AppSheet + IA generativa. No es el stack clasico de Data Analyst, pero vale la pena tenerlo mapeado.

ConceptoDescripcion
Apps Script JavaScript que corre dentro de Google Sheets/Docs/Forms, permite automatizar tareas repetitivas (generar reportes, enviar correos, sincronizar con APIs externas). Util cuando el negocio vive en Sheets pero necesita mas automatizacion.
AppSheet Plataforma no-code de Google para construir apps moviles/web usando una hoja de calculo como base de datos. Comun en operaciones/logistica para digitalizar procesos rapido.
Looker Studio Herramienta de dashboards que se conecta directo a BigQuery, Sheets y otras fuentes de Google. La opcion de BI "gratis" del ecosistema Google, alternativa a Power BI/Tableau.

4.6 Que certificacion conviene

Recomendacion de ROI para este perfil

El Google Cloud Digital Leader es introductorio, no requiere experiencia hands-on profunda, y valida conocimiento general de la nube — buen punto de partida. Si ya tienes experiencia practica con BigQuery/SQL, el siguiente paso natural es el Associate Data Practitioner o el Professional Data Engineer, mas tecnicos y con mejor señal para roles de Data Engineer/Analyst senior.

4.7 Recursos

Articulo: Google Cloud: BigQuery Documentation (documentacion oficial, empezar por "Introduction to BigQuery")
Curso: Google Cloud Skills Boost: "Google Cloud Digital Leader" learning path (gratuito con cuenta GCP)
Articulo: Google Cloud: "Partitioning and clustering in BigQuery" (guia oficial de optimizacion de costos)

4.8 Preguntas de entrevista

Q: ¿Por que BigQuery cobra por bytes escaneados y no por tiempo de computo?

Porque BigQuery separa el almacenamiento del computo: no reservas un cluster fijo, el servicio escala automaticamente los recursos necesarios para ejecutar tu query. El costo real para Google es proporcional a cuantos datos tuvo que leer, por eso ese es el modelo de cobro. Practicamente, esto significa que particionar/clusterizar tablas y evitar SELECT * reduce el costo directamente.

🪤 No conectar el modelo de costos con las practicas de optimizacion (particionamiento, evitar SELECT *).
Practica: analitica sobre un dataset publico de BigQuery intermedio
  1. Crea una cuenta de GCP (el tier gratuito alcanza) y abri BigQuery.
  2. Explora uno de los datasets publicos disponibles (ej. bigquery-public-data.covid19 o similar).
  3. Escribi 3 queries analiticas usando window functions del capitulo anterior.
  4. Revisa el “bytes processed” que muestra la consola antes de ejecutar cada query, y compara el costo de una query con SELECT * contra una con columnas especificas.