Temario del curso
1. Introducción al Aprendizaje Profundo por Refuerzo
- ¿Qué es el Aprendizaje por Refuerzo?
- Diferencias entre Aprendizaje Supervisado, No Supervisado y por Refuerzo
- Aplicaciones del DRL en 2025 (robótica, salud, finanzas, logística)
- Comprensión del bucle de interacción entre el agente y el entorno
2. Fundamentos del Aprendizaje por Refuerzo
- Procesos de Decisión de Markov (MDP)
- Estado, Acción, Recompensa, Política y funciones de Valor
- Compromiso entre Exploración y Explotación
- Métodos de Monte Carlo y aprendizaje por Diferencias Temporales (TD)
3. Implementación de Algoritmos Básicos de RL
- Métodos tabulares: Programación Dinámica, Evaluación de Política e Iteración
- Q-Learning y SARSA
- Exploración epsilon-greedy y estrategias de decaimiento
- Implementación de entornos de RL con OpenAI Gymnasium
4. Transición al Aprendizaje Profundo por Refuerzo
- Limitaciones de los métodos tabulares
- Uso de redes neuronales para la aproximación de funciones
- Arquitectura y flujo de trabajo de Deep Q-Network (DQN)
- Reproducción de experiencias (Experience replay) y redes objetivo
5. Algoritmos Avanzados de DRL
- Double DQN, Dueling DQN y Reproductividad Prioritaria de Experiencias
- Métodos de Gradiente de Política: algoritmo REINFORCE
- Arquitecturas Actor-Crítico (A2C, A3C)
- Optimización de Política Próxima (PPO)
- Soft Actor-Critic (SAC)
6. Trabajo con Espacios de Acción Continuos
- Desafíos en el control continuo
- Uso de DDPG (Gradiente Determinista Profundo de Política)
- Twin Delayed DDPG (TD3)
7. Herramientas y Marcos de Trabajo Prácticos
- Uso de Stable-Baselines3 y Ray RLlib
- Registro y monitoreo con TensorBoard
- Ajuste de hiperparámetros para modelos DRL
8. Ingeniería de Recompensas y Diseño de Entornos
- Moldeado de recompensas y equilibrio de penalizaciones
- Conceptos de transferencia de aprendizaje simulación-a-realidad
- Creación de entornos personalizados en Gymnasium
9. Entornos Parcialmente Observables y Generalización
- Manejo de información de estado incompleta (POMDPs)
- Enfoques basados en memoria utilizando LSTMs y RNNs
- Mejora de la robustez y la generalización del agente
10. Teoría de Juegos y Aprendizaje por Refuerzo Multi-Agente
- Introducción a entornos multi-agente
- Cooperación versus competencia
- Aplicaciones en entrenamiento adversarial y optimización de estrategias
11. Estudios de Caso y Aplicaciones en el Mundo Real
- Simulaciones de conducción autónoma
- Precios dinámicos y estrategias de comercio financiero
- Robótica y automatización industrial
12. Solución de Problemas y Optimización
- Diagnóstico de entrenamientos inestables
- Manejo de la escasez de recompensas y sobreajuste (overfitting)
- Escalado de modelos DRL en GPUs y sistemas distribuidos
13. Resumen y Próximos Pasos
- Repaso de la arquitectura DRL y algoritmos clave
- Tendencias de la industria y direcciones de investigación (p. ej., RLHF, modelos híbridos)
- Recursos adicionales y materiales de lectura
Requerimientos
- Dominio de la programación en Python
- Comprensión de Cálculo y Álgebra Lineal
- Conocimientos básicos de Probabilidad y Estadística
- Experiencia en la construcción de modelos de aprendizaje automático utilizando Python y NumPy o TensorFlow/PyTorch
Audiencia
- Desarrolladores interesados en la IA y los sistemas inteligentes
- Científicos de datos que exploran marcos de trabajo de aprendizaje por refuerzo
- Ingenieros de Aprendizaje Automático que trabajan con sistemas autónomos
Reseñas (2)
Fomentar la repetición en la construcción de indicaciones (prompts) entre quienes nunca han utilizado la IA, y animar a los usuarios experimentados a considerar métodos alternativos para su uso.
Matthew Gay - Tarsus Pharmaceuticals
Curso - Artificial Intelligence (AI) Overview
Traducción Automática
Trabajando desde principios fundamentales de manera enfocada y pasando a aplicar estudios de caso en el mismo día
Maggie Webb - Department of Jobs, Regions, and Precincts
Curso - Artificial Neural Networks, Machine Learning, Deep Thinking
Traducción Automática