IOKELU
Nivel: Inteligencia Artificial – Intermedio (Guía 2)

Cargar tu primer dataset real

En esta guía aprenderás a cargar datasets reales utilizando Pandas. Este es el primer paso del flujo profesional de IA: obtener los datos y prepararlos para el entrenamiento de modelos. A partir de aquí, trabajarás con datos reales como lo hacen los equipos de Machine Learning.

Tabla de contenidos

  • Qué es un dataset
  • Formatos comunes
  • Cargar un CSV con Pandas
  • Explorar el dataset
  • Detectar problemas iniciales
  • Ejercicios
  • Mini‑proyecto

1. Qué es un dataset

Un dataset es una colección de datos organizada en filas y columnas. Cada fila representa un ejemplo y cada columna una característica.

# Ejemplo conceptual
Edad | Ciudad | Compra
-----------------------
 23  | Madrid | Sí
 45  | Sevilla| No

2. Formatos comunes

Los datasets suelen venir en formatos como:

3. Cargar un CSV con Pandas

Pandas permite cargar un dataset con una sola línea de código.

import pandas as pd

df = pd.read_csv("clientes.csv")
print(df.head())

df.head() muestra las primeras filas del dataset.

4. Explorar el dataset

Antes de entrenar un modelo, debes entender la estructura del dataset.

# Ver columnas
df.columns

# Ver información general
df.info()

# Estadísticas básicas
df.describe()

5. Detectar problemas iniciales

Al cargar un dataset real, es común encontrar problemas como:

# Detectar valores faltantes
df.isnull().sum()

# Detectar duplicados
df.duplicated().sum()

6. Ejercicios

7. Mini‑proyecto: Exploración inicial

Descarga un dataset público (por ejemplo, de Kaggle o UCI Machine Learning Repository) y realiza una exploración inicial:


Siguiente guía

Limpieza de datos →