1Las etapas: CRISP-DM + MLOps

CRISP-DM (1999) sigue siendo el modelo de referencia; la industria le añadió las etapas de operación (MLOps).

EtapaQué se haceTiempo típicoLo que suele salir mal
1. Comprensión del negocioTraducir "queremos usar los datos" a una pregunta con una decisión y un valor mediblePoco, y es el errorSaltársela: modelo excelente para una pregunta que no importa
2. Comprensión de los datosInventariar, cargar, explorar (EDA)MedioDescubrir tarde que el dato clave no existe
3. PreparaciónLimpiar, unir, construir variablesLa mayor parte (~80 %)Fuga de información (leakage)
4. ModeladoElegir y entrenar técnicasMenos de lo que se creeEmpezar por el modelo complejo sin línea base
5. EvaluaciónMedir en datos no vistos; comprobar sesgosMedioOptimizar la métrica equivocada
6. DespliegueIntegrar en un sistema o procesoMás de lo previstoFunciona en el notebook y no se integra nunca
7. MonitorizaciónVigilar deriva de datos y de concepto; reentrenarContinuoNadie lo hace: el modelo de 2019 decide en 2026

Las etapas no son secuenciales: la evaluación devuelve a la comprensión del negocio, el modelado a la preparación, la monitorización a los datos. Encaja mejor con los ciclos iterativos (UD1-05) que con una cascada — salvo la etapa 1, que sí conviene cerrar antes de gastar.

Dos matices 2024-2026Con LLM, para texto las etapas 3-4 se comprimen (no se entrena, se escribe un prompt y se construye un conjunto de evaluación), pero 1, 5, 6 y 7 son idénticas — y la 5 es donde fracasan los proyectos de IA generativa lanzados sin conjunto de pruebas.

2Los cuatro niveles de la analítica

NivelPreguntaNecesita IA
Descriptiva¿Qué pasó?No
Diagnóstica¿Por qué pasó?No (a veces ML para factores)
Predictiva¿Qué pasará?Sí (ML clásico casi siempre)
Prescriptiva¿Qué deberíamos hacer?A veces; y siempre un proceso que actúe

La observación honesta: la mayoría de las empresas obtiene la mayor parte del valor de los dos primeros niveles, y muchas que compran "IA" necesitaban un cuadro de mando fiable.

3Cuándo no hacer ciencia de datos

  • No hay pregunta con una decisión detrás.
  • No hay datos suficientes o son de mala calidad (primero el ciclo de vida).
  • Una regla simple resuelve el 95 %: "avisar si el stock baja de 10" no necesita un modelo.
  • No hay verdad con la que evaluar.
  • El coste del error es inaceptable y el modelo no es explicable.

4Errores clásicos

ErrorQué es
Correlación ≠ causalidadVentas de helado y ahogamientos suben juntos: los une el verano
Fuga de informaciónEntrenar con un dato que en producción no existiría
Sesgo de supervivenciaAnalizar solo lo que sobrevivió
Ley de GoodhartCuando una métrica se convierte en objetivo, deja de ser buena métrica
SobreajusteEl modelo memoriza el ruido del entrenamiento
Métrica inadecuada99 % de accuracy detectando fraude cuando el 99 % no lo es

5Los roles, y por qué se confunden

RolQué haceLo que lo distingue
Analista de datosInformes, cuadros de mandoNiveles descriptivo/diagnóstico
Científico de datosModelos y análisis avanzadosNiveles predictivo/prescriptivo
Ingeniero de datosTuberías: ingesta, almacenamiento, calidadEl más demandado y el más cercano a DAM
Ingeniero de ML / MLOpsLleva modelos a producción y los mantieneEtapas 6-7
Ingeniero de IAApps sobre LLM: RAG, agentes, evaluaciónEn la práctica, backend con un componente no determinista

Para un alumno de DAM, los perfiles con más continuidad natural son ingeniero de datos e ingeniero de IA.

6Para debatir en clase

  • Un gimnasio quiere "predecir qué socios se darán de baja". Recorrer las 7 etapas: ¿necesita un modelo o una regla?
  • Un modelo de previsión de demanda de 2019 sin monitorización. ¿Qué pasó en marzo de 2020? ¿Qué etapa lo habría detectado?
  • Una oferta pide "científico de datos" para "dashboards y mantener el pipeline nocturno". ¿Qué rol es realmente?
  • ¿Qué pregunta del propio instituto se podría responder con analítica descriptiva ya disponible?

✓Autoevaluación — puntos que debes dominar

Adaptado de 07-ciencia-de-datos.md.