IOKELU
Nivel: Inteligencia Artificial – Intermedio (Guía 3)

Limpieza de datos (Data Cleaning)

La limpieza de datos es uno de los pasos más importantes en Inteligencia Artificial. Un modelo solo puede ser tan bueno como los datos que recibe. En esta guía aprenderás a detectar y corregir problemas reales en datasets: valores faltantes, duplicados, tipos incorrectos y más.

Tabla de contenidos

  • Por qué es importante limpiar datos
  • Detectar valores faltantes
  • Imputación de valores
  • Eliminar duplicados
  • Corregir tipos de datos
  • Eliminar columnas irrelevantes
  • Ejercicios
  • Mini‑proyecto

1. Por qué es importante limpiar datos

Los datos reales suelen tener errores. Si no los corriges, el modelo aprenderá patrones incorrectos y tendrá un rendimiento pobre.

2. Detectar valores faltantes

Los valores faltantes son muy comunes en datasets reales.

# Detectar valores faltantes
df.isnull().sum()

Esto muestra cuántos valores faltan en cada columna.

3. Imputación de valores

La imputación consiste en reemplazar valores faltantes por un valor válido.

# Imputar con la media
df["edad"] = df["edad"].fillna(df["edad"].mean())

4. Eliminar duplicados

Los duplicados pueden distorsionar el entrenamiento del modelo.

# Eliminar duplicados
df = df.drop_duplicates()

5. Corregir tipos de datos

A veces las columnas tienen tipos incorrectos, como números guardados como texto.

# Convertir texto a número
df["edad"] = pd.to_numeric(df["edad"], errors="coerce")

6. Eliminar columnas irrelevantes

Algunas columnas no aportan información útil al modelo.

# Eliminar columnas
df = df.drop(columns=["id", "codigo_interno"])

7. Ejercicios

8. Mini‑proyecto: Limpieza completa

Toma un dataset real y realiza una limpieza completa:


Siguiente guía

Normalización de datos →