IOKELU
Nivel: IA Básico – Guía 4

Preprocesamiento de Datos en Inteligencia Artificial

Antes de entrenar un modelo de Inteligencia Artificial, los datos deben prepararse. El preprocesamiento es una de las etapas más importantes del Machine Learning: limpia, transforma y organiza los datos para que el modelo pueda aprender correctamente.

Tabla de contenidos

  • Qué es el preprocesamiento
  • Limpieza de datos
  • Tratamiento de valores faltantes
  • Normalización y estandarización
  • Codificación de datos categóricos
  • Ejercicios
  • Mini‑proyecto

1. Qué es el preprocesamiento

El preprocesamiento consiste en preparar los datos para que un modelo pueda aprender. Si los datos están sucios, incompletos o mal formateados, el modelo fallará.

2. Limpieza de datos

La limpieza elimina información incorrecta o irrelevante.

# Ejemplo conceptual
datos = ["Ana", "Luis", "Luis"]  # duplicado
datos_limpios = list(set(datos))

3. Tratamiento de valores faltantes

Los valores faltantes son comunes en datasets reales. Se pueden eliminar o reemplazar.

# Ejemplo conceptual
edad = [23, None, 45]
edad_imputada = [23, 34, 45]  # reemplazo con media

4. Normalización y estandarización

Los modelos aprenden mejor cuando los datos están en escalas similares. Por eso se normalizan o estandarizan.

# Ejemplo conceptual
valores = [10, 20, 30]
normalizados = [0.0, 0.5, 1.0]

5. Codificación de datos categóricos

Los modelos no entienden texto, solo números. Por eso las categorías deben convertirse en valores numéricos.

# Ejemplo conceptual
ciudades = ["Madrid", "Sevilla", "Madrid"]
codificado = [0, 1, 0]  # Label Encoding

6. Ejercicios

7. Mini‑proyecto: Preprocesa tu dataset

Usa el dataset que creaste en la guía anterior y:

Este dataset preprocesado será la base para entrenar tu primer modelo en las próximas guías.


Siguiente guía

Normalización de Datos →