IOKELU
Nivel: Inteligencia Artificial – Intermedio (Guía 5)

División de datos (Train/Test Split)

Dividir los datos en entrenamiento y prueba es un paso esencial en cualquier proyecto de IA. Sin esta división, no puedes evaluar correctamente el rendimiento de tu modelo. En esta guía aprenderás cómo hacerlo con Scikit‑Learn y por qué es tan importante.

Tabla de contenidos

  • Qué es Train/Test Split
  • Por qué es necesario
  • Cómo dividir datos con Scikit‑Learn
  • Proporciones recomendadas
  • División estratificada
  • Ejercicios
  • Mini‑proyecto

1. Qué es Train/Test Split

Train/Test Split es el proceso de dividir un dataset en dos partes:

# Ejemplo conceptual
80% → entrenamiento
20% → prueba

2. Por qué es necesario

Si entrenas y evalúas con los mismos datos, el modelo memoriza la información y no sabes si realmente generaliza.

3. Cómo dividir datos con Scikit‑Learn

from sklearn.model_selection import train_test_split

X = df.drop(columns=["target"])
y = df["target"]

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, random_state=42
)

test_size=0.2 significa que el 20% de los datos se usan para prueba.

4. Proporciones recomendadas

5. División estratificada

En clasificación, es importante mantener la proporción de clases en train y test.

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, stratify=y
)

6. Ejercicios

7. Mini‑proyecto: División completa

Toma un dataset real y realiza:


Siguiente guía

Entrenamiento de modelos →