Capitulo 06
AWS Basico: Complemento a GCP
No lo ignores solo porque tu apuesta principal sea GCP — aparece en ofertas de Data Engineering con buen fit de seniority junior
S3, Athena, Lambda, EMR y CloudWatch: los servicios de AWS que aparecen concentrados en ofertas de Data Engineering.
En la muestra analizada, AWS aparecio sobre todo en ofertas de Data Engineering (Infosys: Athena, Lambda, EMR, CloudWatch). No es tu prioridad si vas por GCP, pero reconocer estos 5 servicios te cubre la mayoria de esas conversaciones.
6.1 S3: el almacenamiento base
Amazon S3
M16Servicio de almacenamiento de objetos de AWS. Es la base de la mayoria de los data lakes en esa nube: los archivos (CSV, Parquet, JSON) se guardan en 'buckets' organizados por carpetas logicas.
6.2 Athena: SQL directo sobre S3
Amazon Athena
M16Servicio serverless de AWS para ejecutar consultas SQL directamente sobre archivos almacenados en S3, sin necesidad de cargar los datos en una base de datos tradicional. Cobra por bytes escaneados, igual que BigQuery.
-- Athena usa Presto/Trino SQL sobre una tabla externa definida en el Glue Data Catalog
SELECT region, SUM(monto) AS total
FROM ventas_s3
WHERE anio = 2026 AND mes = 7
GROUP BY region
ORDER BY total DESC; Athena es al ecosistema AWS lo que BigQuery es a GCP en cuanto al modelo de “SQL serverless sobre almacenamiento de objetos, cobrando por bytes escaneados” — pero Athena consulta datos que YA estan en S3 en vez de tener su propio almacenamiento gestionado como BigQuery.
En la muestra de mercado, Infosys pide Athena/Lambda/EMR/CloudWatch para un rol de Data Engineer con buen fit de seniority junior. Un caso tipico: datos de logs de aplicacion llegan a S3 en formato JSON, y en vez de montar una base de datos completa solo para consultarlos ocasionalmente, se define una tabla externa en Athena sobre esos archivos — cero infraestructura que mantener para un caso de uso esporadico.
6.3 Lambda: computo serverless por eventos
AWS Lambda
M16Servicio de computo serverless: ejecuta una funcion en respuesta a un evento (un archivo nuevo en S3, una llamada HTTP, un mensaje en una cola) sin que el usuario administre servidores. Se cobra solo por el tiempo de ejecucion real.
Un patron tipico en pipelines de datos: un archivo se sube a S3 → dispara una funcion Lambda → la funcion valida/transforma el archivo → escribe el resultado en otra ubicacion o dispara el siguiente paso del pipeline.
Un servidor tradicional corriendo 24/7 solo para procesar un archivo que llega cada tanto desperdicia computo (y dinero) el resto del tiempo. Lambda se ejecuta solo cuando el evento ocurre y se cobra por milisegundos de ejecucion real — la eleccion correcta cuando el trabajo es esporadico y reactivo a eventos, no constante.
6.4 EMR: Spark y Hadoop gestionados
EMR (Elastic MapReduce) es el equivalente de AWS a Dataproc en GCP: clusters gestionados de Spark y Hadoop, usados cuando el volumen de datos requiere procesamiento distribuido y ya existe codigo Spark que no se quiere reescribir.
6.5 CloudWatch: logs y monitoreo
CloudWatch centraliza logs y metricas de todos los servicios de AWS. En un pipeline de datos, es donde revisas si una funcion Lambda fallo, cuanto tiempo tardo un job de EMR, o configuras alertas automaticas ante errores.
6.6 IAM, a nivel conceptual
IAM (Identity and Access Management) es el sistema de permisos de AWS: define QUIEN (usuario, servicio) puede hacer QUE (leer, escribir, ejecutar) sobre QUE recursos. No hace falta profundizar como Data Analyst, pero es importante saber que existe y que ningun servicio de AWS deberia tener permisos “abiertos por defecto”.
6.7 Comparativa rapida GCP vs AWS
| Necesidad | GCP | AWS |
|---|---|---|
| 1 | BigQuery | |
| 2 | Cloud Storage | |
| 3 | Cloud Functions | |
| 4 | Dataproc |
6.8 Recursos
6.9 Preguntas de entrevista
Q: ¿Cual es la diferencia entre Athena y BigQuery?
Ambos son motores SQL serverless que cobran por bytes escaneados, pero difieren en donde vive el dato: Athena consulta archivos que YA estan en S3 (necesitas definir una tabla externa sobre esos archivos), mientras que BigQuery tiene su propio almacenamiento gestionado donde cargas los datos. En la practica, Athena es mas flexible si el dato ya vive en un data lake S3; BigQuery da mejor rendimiento si puedes cargar los datos dentro de su storage nativo.
🪤 Decir que son 'exactamente lo mismo' sin mencionar la diferencia de donde reside el almacenamiento.- Crea una cuenta AWS (free tier) y sube un dataset publico en formato Parquet a un bucket S3.
- Define una tabla externa en el Glue Data Catalog que apunte a ese bucket.
- Ejecuta 2-3 queries analiticas con Athena sobre esa tabla, incluyendo al menos una window function del primer capitulo.
- Revisa en CloudWatch cuanto tiempo tardo cada query y cuantos bytes escaneo.