IA en Producción
Entrenar un modelo es solo el comienzo. Llevar IA a producción requiere despliegue, monitoreo, escalado, seguridad y mantenimiento continuo. En esta guía aprenderás los fundamentos para operar modelos en entornos reales.
Tabla de contenidos
- Qué significa producción
- Despliegue de modelos
- Servidores de inferencia
- Monitoreo
- Retraining y drift
- Escalado
- Buenas prácticas
- Ejemplo conceptual
- Ejercicios
1. Qué significa producción
Producción es cuando un modelo se usa por usuarios reales o sistemas reales. Requiere estabilidad, seguridad y disponibilidad.
- API estable
- Logs y métricas
- Escalado automático
- Monitorización continua
2. Despliegue de modelos
Los modelos se despliegan normalmente como servicios web.
POST /predict
{
"input": [...]
}
- Docker
- FastAPI
- Flask
- TensorFlow Serving
- TorchServe
3. Servidores de inferencia
Los servidores de inferencia están optimizados para ejecutar modelos rápidamente.
- TensorFlow Serving
- TorchServe
- ONNX Runtime
- OpenVINO
4. Monitoreo
Monitorear un modelo es esencial para detectar problemas.
- Latencia
- Errores
- Distribución de datos
- Drift
- Uso de recursos
5. Retraining y drift
El drift ocurre cuando los datos cambian con el tiempo y el modelo deja de ser preciso.
- Retraining periódico
- Retraining automático
- Alertas de drift
6. Escalado
El escalado permite manejar miles o millones de peticiones.
- Load balancers
- Autoscaling
- GPU clusters
- Batch inference
7. Buenas prácticas
- Versionar modelos
- Guardar métricas
- Pruebas automáticas
- Documentar API
- Control de acceso
8. Ejemplo conceptual
curl -X POST https://api.mi-modelo.com/predict \
-H "Content-Type: application/json" \
-d '{"input": [1,2,3]}'
9. Ejercicios
- Define qué es producción en IA.
- Menciona dos servidores de inferencia.
- Explica qué es el drift.
- ¿Qué es autoscaling?
- Escribe un ejemplo de endpoint de predicción.
# pista drift
"Cambio en la distribución de datos."
# pista endpoint
"POST /predict"