LSTM y GRU
Las arquitecturas LSTM y GRU solucionan las limitaciones de las RNN tradicionales, permitiendo aprender dependencias largas en secuencias. Son fundamentales en tareas de texto, series temporales y audio.
Tabla de contenidos
- Problema de las RNN
- Qué es una LSTM
- Puertas de la LSTM
- Qué es una GRU
- Diferencias entre LSTM y GRU
- Ejemplo con Keras
- Ejercicios
1. Problema de las RNN
Las RNN tradicionales no pueden aprender dependencias largas debido al gradiente que se desvanece. LSTM y GRU fueron creadas para resolver este problema.
2. Qué es una LSTM
Una LSTM (Long Short‑Term Memory) introduce un mecanismo de memoria controlado por puertas.
layers.LSTM(units=64)
3. Puertas de la LSTM
Las LSTM usan tres puertas para controlar el flujo de información:
- Forget gate: decide qué olvidar
- Input gate: decide qué guardar
- Output gate: decide qué mostrar
4. Qué es una GRU
Una GRU (Gated Recurrent Unit) simplifica la LSTM usando solo dos puertas.
layers.GRU(units=64)
5. Diferencias entre LSTM y GRU
- LSTM → 3 puertas
- GRU → 2 puertas
- GRU entrena más rápido
- LSTM es más precisa en secuencias largas
6. Ejemplo con Keras
import tensorflow as tf
from tensorflow.keras import layers
model = tf.keras.Sequential([
layers.GRU(64, input_shape=(50, 10)),
layers.Dense(1, activation='sigmoid')
])
model.compile(
optimizer='adam',
loss='binary_crossentropy',
metrics=['accuracy']
)
model.fit(X_train, y_train, epochs=10)
model.evaluate(X_test, y_test)
7. Ejercicios
- Explica el problema del gradiente en RNN.
- Define qué es una LSTM.
- Menciona las tres puertas de la LSTM.
- Define qué es una GRU.
- Escribe una diferencia clave entre LSTM y GRU.
# pista LSTM
"Memoria controlada por puertas."
# pista GRU
"Versión simplificada con dos puertas."