Preprocesamiento de Datos en Inteligencia Artificial
Antes de entrenar un modelo de Inteligencia Artificial, los datos deben prepararse. El preprocesamiento es una de las etapas más importantes del Machine Learning: limpia, transforma y organiza los datos para que el modelo pueda aprender correctamente.
Tabla de contenidos
- Qué es el preprocesamiento
- Limpieza de datos
- Tratamiento de valores faltantes
- Normalización y estandarización
- Codificación de datos categóricos
- Ejercicios
- Mini‑proyecto
1. Qué es el preprocesamiento
El preprocesamiento consiste en preparar los datos para que un modelo pueda aprender. Si los datos están sucios, incompletos o mal formateados, el modelo fallará.
- Eliminar errores
- Completar valores faltantes
- Transformar datos
- Normalizar escalas
- Codificar categorías
2. Limpieza de datos
La limpieza elimina información incorrecta o irrelevante.
- Duplicados
- Errores tipográficos
- Valores imposibles (edad = -5)
- Filas incompletas
# Ejemplo conceptual
datos = ["Ana", "Luis", "Luis"] # duplicado
datos_limpios = list(set(datos))
3. Tratamiento de valores faltantes
Los valores faltantes son comunes en datasets reales. Se pueden eliminar o reemplazar.
- Eliminar filas: si faltan muchos datos.
- Imputar valores: reemplazar con media, mediana o moda.
# Ejemplo conceptual
edad = [23, None, 45]
edad_imputada = [23, 34, 45] # reemplazo con media
4. Normalización y estandarización
Los modelos aprenden mejor cuando los datos están en escalas similares. Por eso se normalizan o estandarizan.
- Normalización: valores entre 0 y 1.
- Estandarización: media 0 y desviación estándar 1.
# Ejemplo conceptual
valores = [10, 20, 30]
normalizados = [0.0, 0.5, 1.0]
5. Codificación de datos categóricos
Los modelos no entienden texto, solo números. Por eso las categorías deben convertirse en valores numéricos.
- Label Encoding: cada categoría recibe un número.
- One‑Hot Encoding: columnas binarias por categoría.
# Ejemplo conceptual
ciudades = ["Madrid", "Sevilla", "Madrid"]
codificado = [0, 1, 0] # Label Encoding
6. Ejercicios
- Define preprocesamiento en tus palabras.
- Enumera 3 tipos de limpieza de datos.
- Imputa un valor faltante usando la media.
- Normaliza tres valores entre 0 y 1.
- Codifica tres ciudades con Label Encoding.
# pista limpieza
"Duplicados, errores, valores imposibles."
# pista codificación
"Madrid=0, Sevilla=1, Málaga=2"
7. Mini‑proyecto: Preprocesa tu dataset
Usa el dataset que creaste en la guía anterior y:
- Limpia duplicados
- Imputa valores faltantes
- Normaliza la columna de edad
- Codifica la columna de ciudad
Este dataset preprocesado será la base para entrenar tu primer modelo en las próximas guías.