Glosario
22 conceptos que tienes que tener en la cabeza
Cada termino esta definido en su contexto y enlazado desde los capitulos donde se usa.
M11 SQL Avanzado para Analistas
Window Function
IFuncion que calcula un valor sobre un conjunto de filas relacionadas (una "ventana") sin colapsarlas en una sola fila, a diferencia de GROUP BY.
Ej: ROW_NUMBER() OVER (PARTITION BY cliente ORDER BY fecha DESC)
CTE (Common Table Expression)
ITabla temporal nombrada definida con WITH, valida solo dentro de la query. Mejora legibilidad frente a subqueries anidadas.
CTE Recursiva
ACTE que se referencia a si misma, usada para queries jerarquicas (organigramas, arboles de categorias).
Star Schema
IModelo de datos con una tabla de hechos central rodeada de tablas de dimension, optimizado para consultas analiticas y BI.
Optimizacion de Queries
APracticas para reducir el costo de una consulta: usar indices, evitar SELECT *, revisar el plan de ejecucion con EXPLAIN.
M12 Python para Analisis y Automatizacion
Automatizacion de Reportes
IReemplazar la generacion manual de reportes recurrentes por scripts que leen, consolidan y exportan datos automaticamente.
resample (Pandas)
IMetodo de Pandas para cambiar la frecuencia de una serie temporal (diaria a mensual, por ejemplo), agregando valores en el proceso.
M13 ETL: el Patron, no la Herramienta
ETL (Extract, Transform, Load)
IPatron de integracion de datos: extraer de una fuente, transformar (limpiar, tipar, aplicar reglas) y cargar en un destino de consumo.
ETL vs ELT
IELT carga los datos crudos primero y transforma despues, dentro del data warehouse (aprovechando su poder de computo). Comun en BigQuery/Snowflake.
Idempotencia
APropiedad de un proceso que produce el mismo resultado sin efectos secundarios adicionales si se ejecuta mas de una vez con la misma entrada.
Carga Incremental
IEstrategia de ETL que procesa solo los datos nuevos o modificados desde la ultima ejecucion, en vez de recargar todo (full load).
M14 Google Cloud Platform para Datos
BigQuery
IData warehouse serverless de Google Cloud. Ejecuta SQL sobre datasets masivos, cobra por bytes escaneados.
Particionamiento y Clustering (BigQuery)
ATecnicas para reducir el costo de una query: particionar divide la tabla por columna (ej. fecha), clustering ordena fisicamente los datos dentro de cada particion.
Dataflow (Apache Beam)
AServicio de GCP para pipelines de datos batch y streaming, basado en el modelo de programacion Apache Beam.
M15 Git y Control de Versiones para Analistas
Feature Branch
IRama de Git creada para desarrollar una funcionalidad de forma aislada, luego integrada al branch principal via Pull Request.
Merge vs Rebase
IDos formas de integrar cambios de un branch a otro: merge preserva el historial con un commit de fusion, rebase reescribe el historial linealmente.
Pull Request (PR)
ISolicitud para fusionar cambios de un branch a otro, con revision de codigo y comentarios antes de aceptarla.
M16 AWS Basico: Complemento a GCP
Amazon S3
IServicio de almacenamiento de objetos de AWS. Base de la mayoria de los data lakes en esa nube.
Amazon Athena
IServicio serverless de AWS para ejecutar SQL directamente sobre archivos en S3, sin necesidad de cargar los datos en una base.
AWS Lambda
IServicio de computo serverless de AWS: ejecuta funciones en respuesta a eventos, sin gestionar servidores.
M17 ML Aplicado e IA Generativa como Herramienta
Prompting
IPractica de redactar instrucciones efectivas para un modelo de lenguaje (LLM), de forma que genere el resultado deseado.
Integracion de LLMs en el flujo de trabajo
IUso de APIs de modelos de lenguaje (OpenAI, Anthropic) o herramientas ya integradas (Copilot en Excel/Power BI) para automatizar tareas analiticas, sin entrenar modelos propios.