Modelos avanzados
En esta guía aprenderás modelos más avanzados que superan a los algoritmos clásicos en muchos escenarios. Estos modelos son ampliamente usados en la industria por su capacidad de capturar relaciones complejas y ofrecer un rendimiento superior.
Tabla de contenidos
- Árboles de decisión avanzados
- Random Forest
- Gradient Boosting
- XGBoost
- LightGBM
- CatBoost
- Ejercicios
- Mini‑proyecto
1. Árboles de decisión avanzados
Los árboles de decisión son modelos potentes y fáciles de interpretar, pero pueden sobreajustarse. Por eso se usan variantes más avanzadas.
from sklearn.tree import DecisionTreeClassifier
model = DecisionTreeClassifier(max_depth=10)
model.fit(X_train, y_train)
2. Random Forest
Random Forest combina muchos árboles para mejorar la estabilidad y precisión.
from sklearn.ensemble import RandomForestClassifier
model = RandomForestClassifier(n_estimators=200)
model.fit(X_train, y_train)
3. Gradient Boosting
Gradient Boosting construye árboles secuenciales, cada uno corrigiendo los errores del anterior.
from sklearn.ensemble import GradientBoostingClassifier
model = GradientBoostingClassifier()
model.fit(X_train, y_train)
4. XGBoost
XGBoost es uno de los modelos más usados en Kaggle y en la industria. Es rápido, eficiente y ofrece gran rendimiento.
from xgboost import XGBClassifier
model = XGBClassifier()
model.fit(X_train, y_train)
5. LightGBM
LightGBM es extremadamente rápido y eficiente con datasets grandes.
from lightgbm import LGBMClassifier
model = LGBMClassifier()
model.fit(X_train, y_train)
6. CatBoost
CatBoost maneja variables categóricas automáticamente y evita mucho preprocesamiento.
from catboost import CatBoostClassifier
model = CatBoostClassifier(verbose=0)
model.fit(X_train, y_train)
7. Ejercicios
- Entrena un Random Forest.
- Entrena un Gradient Boosting.
- Entrena un modelo XGBoost.
- Entrena un modelo LightGBM.
- Explica cuándo usar CatBoost.
# pista random forest
RandomForestClassifier(n_estimators=200)
# pista xgboost
XGBClassifier()
8. Mini‑proyecto: Modelos avanzados
Toma un dataset real y realiza:
- Random Forest
- Gradient Boosting
- XGBoost
- LightGBM
- CatBoost
- Comparación de métricas entre todos los modelos