Objetivo de aprendizaje: Entender los modelos de razonamiento (o1/o3, test-time compute) y el aprendizaje por refuerzo, de MDPs a Deep RL y su rol en el razonamiento y alineamiento de LLMs.
RL foundations: MDPs, valor/política, Q-learning y policy gradients
Deep RL: DQN, PPO, Actor-Critic; RL multi-agente (panorama)
Reasoning models: test-time compute, chain-of-thought, o1/o3 y RL para razonamiento
RL aplicado: trading/ejecución y su conexión con agentes y alineamiento
Temario semana a semana
W1RL foundations: MDPs, valor/política, Q-learning y policy gradients