Glosario
23 conceptos que tienes que tener en la cabeza
Cada termino esta definido en su contexto y enlazado desde los capitulos donde se usa.
M0 Fundamentos para Machine Learning
Tipado dinamico
IModelo de Python en el que el tipo se asocia al valor en tiempo de ejecucion y no necesita declararse antes de asignar una variable.
Ej: precio = 19.99 crea una variable float sin declarar el tipo.
f-string
ICadena formateada que permite insertar expresiones de Python dentro de llaves y controlar su presentacion.
Ej: f"Total: ${total:.2f}"
Guard clause
IValidacion temprana que resuelve un caso borde y retorna antes de ejecutar la logica principal.
Ej: if not valores: return 0
Modelo relacional
IForma de organizar datos en tablas relacionadas mediante filas, columnas y claves.
NULL en SQL
IValor que representa un dato desconocido o ausente. No equivale a cero ni a una cadena vacia y se consulta con IS NULL.
GROUP BY
IClausula SQL que agrupa filas para aplicar funciones de agregacion como SUM, COUNT o AVG.
HAVING
IClausula que filtra grupos despues de una agregacion. WHERE filtra filas antes de agrupar.
Problem statement
IDescripcion verificable del problema de negocio, el objetivo, el target, las restricciones y la metrica de exito.
Variable objetivo (target)
IVariable que un modelo intenta predecir o explicar. Debe tener una definicion operativa y un horizonte temporal claros.
M1 Fundamentos de Bases de Datos
Esquema relacional
IDefinicion estructural de tablas, columnas, tipos, restricciones y relaciones de una base de datos.
DML
IData Manipulation Language: conjunto de sentencias para consultar y modificar datos, principalmente SELECT, INSERT, UPDATE y DELETE.
DCL
IData Control Language: sentencias para administrar permisos y acceso a datos, como GRANT y REVOKE.
Normalizacion
IProceso de organizar tablas para reducir redundancia y evitar dependencias incorrectas, usando formas normales.
SQLite
IMotor de base de datos relacional embebido, sin servidor, que almacena una base completa en un archivo local.
Pipeline de datos
ISecuencia reproducible de pasos para extraer, transformar, validar y entregar datos a un consumidor o modelo.
Aprendizaje supervisado
ITipo de Machine Learning que aprende una relacion entre variables de entrada y una etiqueta objetivo conocida.
Aprendizaje no supervisado
ITipo de Machine Learning que busca estructura o patrones en datos sin una etiqueta objetivo proporcionada.
M3 Introducción a Machine Learning y Data Acquisition I
Ciclo de vida de Machine Learning
ISecuencia iterativa que va de la pregunta de negocio a la adquisicion, preparacion, modelado, evaluacion y despliegue. Cada etapa condiciona la siguiente y la evaluacion puede obligar a volver a los datos.
Data acquisition
IProceso de obtener datos desde una fuente externa (archivo, API, base) y dejarlos disponibles para validar, transformar y analizar dentro del pipeline.
Ej: Leer ventas_mensuales.csv con pandas y configuracion_tienda.json con json.load registrando origen y encoding.
Imputación por mediana
IReemplazo de valores faltantes numéricos por la mediana de la columna. Es robusta a valores extremos, a diferencia de la media.
Ej: gasto_mensual con valores [150, 250, 300, 400, 50000] → mediana 300, media 10220.
train_test_split
IFunción de scikit-learn que divide un dataset en conjuntos de entrenamiento y prueba. test_size controla la proporción y random_state garantiza reproducibilidad.
Ej: train_test_split(X, y, test_size=0.2, random_state=123) → 80% train, 20% test reproducibles.
Data leakage
IFuga de información del conjunto de test o del futuro hacia el entrenamiento. Produce métricas artificialmente optimistas que colapsan en producción.
Ej: Calcular la mediana o ajustar un scaler sobre todo el dataset antes de separar train/test.
pathlib.Path
IMódulo de Python para manejar rutas de archivos de forma portable entre sistemas operativos. Evita rutas absolutas hardcodeadas y resuelve separadores automáticamente.
Ej: Path("data") / "ventas.csv" en lugar de "C:\\Users\\...\\ventas.csv"