1Por qué la IA necesita datos

Entrenar un modelo es ajustar parámetros para que su salida se parezca a los ejemplos. Con pocos ejemplos el modelo memoriza (sobreajuste); con muchos y variados, generaliza. En deep learning esto se ha cuantificado: el rendimiento mejora de forma predecible con tamaño del modelo, datos y cómputo (leyes de escala, 2020).

  • Calidad antes que cantidad: un millón de registros mal etiquetados produce un modelo que aprende los errores.
  • Rendimientos decrecientes: doblar los datos no dobla la calidad; a partir de cierto punto hacen falta datos distintos.
  • Sesgo: el modelo aprende lo que hay en los datos, incluidas injusticias históricas — el AI Act lo clasifica como alto riesgo (UD1-10).
  • Con LLM, la mayoría no entrena nada: usan un modelo ya entrenado y le dan sus datos en el contexto (RAG) o lo ajustan (fine-tuning). De "datos para entrenar" a "datos para consultar".
El volante de datosMás usuarios → más datos → mejor modelo → mejor producto → más usuarios. Por eso "los datos son el nuevo petróleo" — pero el petróleo se consume y los datos no, el petróleo vale bruto y los datos solo refinados, y el petróleo no genera obligaciones legales por almacenarlo. Almacenar datos que no se usan no es un activo: es un coste y un riesgo.

2Cómo se convierte en rentabilidad

MecanismoEjemploDónde está el dinero
Predecir mejorPrevisión de demandaMenos stock inmovilizado, menos roturas
Mantenimiento predictivoCada hora de parada no planificada evitada
Detección de fraude en pagosTransacciones fraudulentas bloqueadas
AutomatizarClasificación de tickets de soporteHoras de agente por ticket
Extracción de datos de documentosHoras de administrativo por documento
PersonalizarRecomendación de productosParte relevante de las ventas de grandes plataformas
Precios dinámicosMargen por unidad según demanda y competencia

La rentabilidad exige un proceso que actúe sobre la predicción: predecir que una máquina fallará el jueves no vale nada si mantenimiento no tiene ventana el miércoles. Sin los eslabones anteriores (datos integrados, procesos definidos), es un proyecto piloto que no sale del piloto.

3Las características de Big Data: las V

VQué mideEjemplo
VolumenCantidad: no cabe en una máquinaTerabytes de logs al día
VelocidadRitmo de llegada y respuesta exigidaTransacciones que hay que aprobar en 100 ms
VariedadFormatos heterogéneosCorreos, PDF, fotos y ERP juntos
VeracidadFiabilidad, ruidoSensores descalibrados, formularios mal rellenados
ValorLo que se puede extraerLa única V que importa al negocio

Las tres primeras son la definición original (Gartner, 2001). "Big" es relativo a las herramientas: un CSV de 10 GB no es Big Data (cabe en un portátil con pandas); 10 TB diarios sí. La palabra pasó de moda hacia 2018 porque la nube hizo que lo "grande" dejara de ser un problema especial — hoy se dice "datos", "plataforma de datos" o "lakehouse" (ver UD2-08).

4Sectores con implantación más relevante

SectorAplicaciones consolidadas
Tecnología y softwareBúsqueda, recomendación, publicidad, moderación
Finanzas y segurosFraude, scoring de crédito, trading algorítmico
Comercio y distribuciónRecomendación, previsión de demanda, precios dinámicos
Sanidad y farmaciaAnálisis de imagen, descubrimiento de fármacos
Industria manufactureraInspección visual, mantenimiento predictivo
Automoción y transporteADAS, optimización de rutas, gestión de flotas

Para el sector del título — desarrollo de software — la implantación es la más profunda de todas, porque el propio proceso de producción se ha transformado (UD1-09).

5Lenguajes de programación en IA

diagrama
Capa de aplicación: consumir IA desde un producto
  cualquier lenguaje (Java, Kotlin, C#, TS, Python) vía HTTP/SDK
     ▼
Capa de investigación y modelado: entrenar, evaluar
  Python (PyTorch, JAX, scikit-learn, pandas, HF), R, Julia
     ▼
Capa de motor: los cálculos que lo hacen posible
  C++, CUDA, Rust; llama.cpp, ONNX Runtime, vLLM
LenguajePapel
PythonLengua franca del modelado — no rápido: pegamento sobre bibliotecas C++/CUDA
C++ / CUDAEl motor: CUDA es la plataforma de NVIDIA para GPU
RustSustituyendo a C++ en herramientas nuevas por seguridad de memoria
SQLImprescindible: los almacenes en la nube ejecutan ML dentro de SQL
JavaScript / TypeScriptAplicaciones sobre LLM; modelos en el navegador
Kotlin / SwiftIA en el dispositivo móvil (ML Kit, Core ML)
Lo que esto significa para DAMNo hace falta cambiar de lenguaje para "hacer IA". Integrar un LLM en una app Kotlin, Java o C# es una llamada HTTP a una API, con las mismas técnicas que cualquier integración: manejo de errores, tiempos de espera, reintentos, coste. La "ingeniería de IA" es en gran medida desarrollo backend ordinario alrededor de un componente no determinista.

¿El prompt es un lenguaje de programación? No en sentido estricto: no tiene sintaxis formal ni semántica definida. Pero hay un continuo: los prompts se versionan, se prueban y se componen como código. El prompt no es código, pero se gestiona como código.

6Para debatir en clase

  • Una PYME con 8 años de historial de ventas quiere "poner IA para predecir ventas". ¿Qué pregunta hay que hacer antes? ¿Qué proyecto es en realidad?
  • Si los LLM se han entrenado con "todo Internet", ¿por qué siguen necesitando los datos de la empresa?
  • "Python es lento, así que la IA debería hacerse en C++." Argumenta por qué esa frase es y no es verdad.
  • Busca un producto "con IA" y clasifica en qué sector está, qué tipo de modelo usa y qué datos ha necesitado.

✓Autoevaluación — puntos que debes dominar

Adaptado de 08-ia-datos-sectores-lenguajes.md.