RiskMathics Financial Institute · Curso Ejecutivo

Reasoning Models & Reinforcement Learning

9 sesiones Inicia 19 Ago 2027 Híbrido USD $2,800 + TAX
InscríbeteVer detalles
Contenido del programa

Qué dominarás.

Objetivo de aprendizaje: Entender los modelos de razonamiento (o1/o3, test-time compute) y el aprendizaje por refuerzo, de MDPs a Deep RL y su rol en el razonamiento y alineamiento de LLMs.

Temario semana a semana

  1. W1RL foundations: MDPs, valor/política, Q-learning y policy gradients
  2. W2Deep RL: DQN, PPO, Actor-Critic; RL multi-agente (panorama)
  3. W3Reasoning models: test-time compute, chain-of-thought, o1/o3 y RL para razonamiento
  4. W4RL aplicado: trading/ejecución y su conexión con agentes y alineamiento
9
Sesiones en vivo
27
Horas totales
19 Ago
Inicio · 2027
USD $2,800 + TAX
Inversión
RiskMathics