IA y datos: por qué la IA necesita datos, dónde se aplica y con qué se programa
Un modelo de ML es una función aprendida de datos: sin datos no hay modelo, con datos malos hay un modelo malo. Por eso la IA moderna llegó después del Big Data y no antes. La rentabilidad no viene de "tener IA" sino de tres mecanismos: predecir mejor, automatizar tareas de coste alto y personalizar a escala. El lenguaje con el que se hace todo esto es casi siempre Python en la capa visible y C++/CUDA en el motor; pero consumir IA se hace en cualquier lenguaje, con una llamada HTTP.
1Por qué la IA necesita datos
Entrenar un modelo es ajustar parámetros para que su salida se parezca a los ejemplos. Con pocos ejemplos el modelo memoriza (sobreajuste); con muchos y variados, generaliza. En deep learning esto se ha cuantificado: el rendimiento mejora de forma predecible con tamaño del modelo, datos y cómputo (leyes de escala, 2020).
- Calidad antes que cantidad: un millón de registros mal etiquetados produce un modelo que aprende los errores.
- Rendimientos decrecientes: doblar los datos no dobla la calidad; a partir de cierto punto hacen falta datos distintos.
- Sesgo: el modelo aprende lo que hay en los datos, incluidas injusticias históricas — el AI Act lo clasifica como alto riesgo (UD1-10).
- Con LLM, la mayoría no entrena nada: usan un modelo ya entrenado y le dan sus datos en el contexto (RAG) o lo ajustan (fine-tuning). De "datos para entrenar" a "datos para consultar".
2Cómo se convierte en rentabilidad
| Mecanismo | Ejemplo | Dónde está el dinero |
|---|---|---|
| Predecir mejor | Previsión de demanda | Menos stock inmovilizado, menos roturas |
| Mantenimiento predictivo | Cada hora de parada no planificada evitada | |
| Detección de fraude en pagos | Transacciones fraudulentas bloqueadas | |
| Automatizar | Clasificación de tickets de soporte | Horas de agente por ticket |
| Extracción de datos de documentos | Horas de administrativo por documento | |
| Personalizar | Recomendación de productos | Parte relevante de las ventas de grandes plataformas |
| Precios dinámicos | Margen por unidad según demanda y competencia |
La rentabilidad exige un proceso que actúe sobre la predicción: predecir que una máquina fallará el jueves no vale nada si mantenimiento no tiene ventana el miércoles. Sin los eslabones anteriores (datos integrados, procesos definidos), es un proyecto piloto que no sale del piloto.
3Las características de Big Data: las V
| V | Qué mide | Ejemplo |
|---|---|---|
| Volumen | Cantidad: no cabe en una máquina | Terabytes de logs al día |
| Velocidad | Ritmo de llegada y respuesta exigida | Transacciones que hay que aprobar en 100 ms |
| Variedad | Formatos heterogéneos | Correos, PDF, fotos y ERP juntos |
| Veracidad | Fiabilidad, ruido | Sensores descalibrados, formularios mal rellenados |
| Valor | Lo que se puede extraer | La única V que importa al negocio |
Las tres primeras son la definición original (Gartner, 2001). "Big" es relativo a las herramientas: un CSV de 10 GB no es Big Data (cabe en un portátil con pandas); 10 TB diarios sí. La palabra pasó de moda hacia 2018 porque la nube hizo que lo "grande" dejara de ser un problema especial — hoy se dice "datos", "plataforma de datos" o "lakehouse" (ver UD2-08).
4Sectores con implantación más relevante
| Sector | Aplicaciones consolidadas |
|---|---|
| Tecnología y software | Búsqueda, recomendación, publicidad, moderación |
| Finanzas y seguros | Fraude, scoring de crédito, trading algorítmico |
| Comercio y distribución | Recomendación, previsión de demanda, precios dinámicos |
| Sanidad y farmacia | Análisis de imagen, descubrimiento de fármacos |
| Industria manufacturera | Inspección visual, mantenimiento predictivo |
| Automoción y transporte | ADAS, optimización de rutas, gestión de flotas |
Para el sector del título — desarrollo de software — la implantación es la más profunda de todas, porque el propio proceso de producción se ha transformado (UD1-09).
5Lenguajes de programación en IA
Capa de aplicación: consumir IA desde un producto
cualquier lenguaje (Java, Kotlin, C#, TS, Python) vía HTTP/SDK
▼
Capa de investigación y modelado: entrenar, evaluar
Python (PyTorch, JAX, scikit-learn, pandas, HF), R, Julia
▼
Capa de motor: los cálculos que lo hacen posible
C++, CUDA, Rust; llama.cpp, ONNX Runtime, vLLM
| Lenguaje | Papel |
|---|---|
| Python | Lengua franca del modelado — no rápido: pegamento sobre bibliotecas C++/CUDA |
| C++ / CUDA | El motor: CUDA es la plataforma de NVIDIA para GPU |
| Rust | Sustituyendo a C++ en herramientas nuevas por seguridad de memoria |
| SQL | Imprescindible: los almacenes en la nube ejecutan ML dentro de SQL |
| JavaScript / TypeScript | Aplicaciones sobre LLM; modelos en el navegador |
| Kotlin / Swift | IA en el dispositivo móvil (ML Kit, Core ML) |
¿El prompt es un lenguaje de programación? No en sentido estricto: no tiene sintaxis formal ni semántica definida. Pero hay un continuo: los prompts se versionan, se prueban y se componen como código. El prompt no es código, pero se gestiona como código.
6Para debatir en clase
- Una PYME con 8 años de historial de ventas quiere "poner IA para predecir ventas". ¿Qué pregunta hay que hacer antes? ¿Qué proyecto es en realidad?
- Si los LLM se han entrenado con "todo Internet", ¿por qué siguen necesitando los datos de la empresa?
- "Python es lento, así que la IA debería hacerse en C++." Argumenta por qué esa frase es y no es verdad.
- Busca un producto "con IA" y clasifica en qué sector está, qué tipo de modelo usa y qué datos ha necesitado.
✓Autoevaluación — puntos que debes dominar
Adaptado de 08-ia-datos-sectores-lenguajes.md.