El aprendizaje por refuerzo se está convirtiendo en el ingrediente definitorio detrás de los agentes de IA más capaces. Desde la investigación profunda de OpenAI hasta Claude Code de Anthropic, se utiliza el aprendizaje por refuerzo para especializar modelos en razonamiento, codificación y uso de herramientas.
En este video haremos una introducción amigable al Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) y cómo construirlos utilizando la biblioteca de verificadores.
📌 además, si eres principiante: aprende a programar desde full-stack hasta IA con Scrimba
https://scrimba.com/?via=yacineMahdid (20% de descuento adicional en pro con mi enlace, gran recurso, me encanta el equipo)
# Tabla de Contenidos
00:00 - Introducción: el creciente papel del RL en la IA agente
01:10 - El ciclo RLVR: conjunto de datos, política, implementaciones, recompensas, actualizaciones
02:13 - Visión general del estado de RLVR
03:50 - RLVR de modelo pequeño: beneficios de rendimiento, latencia y costo
06:00 - RLVR vs RLHF: diferencias conceptuales clave
07:32 - Marcos de código abierto: ReasoningGym, ART, TRL y Verificadores
08:12 - profundización en los 7 pasos de los verificadores con el entorno math-python
08:25 - profundización en los verificadores | paso 1 : datos
09:09 - profundización en los verificadores | paso 2 : estilo de interacción
09:40 - profundización en los verificadores | paso 3 : lógica del entorno
10:05 - profundización en los verificadores | paso 4 : función de recompensas (rúbrica)
11:23 - profundización en los verificadores | paso 5 : analizador (opcional)
11:46 - profundización en los verificadores | paso 6 : empaquetar entorno
12:07 - profundización en los verificadores | paso 7 : ejecutar evaluación o entrenamiento
12:30 - algunos entornos de la comunidad
13:25 - Estudio de caso: Construyendo un entorno RLVR de Visión-Lenguaje con alexine
13:56 - visión SR1 - visión general
16:46 - visión SR1 - entorno 1
18:29 - visión SR1 - entorno 2
20:03 - Entrevista con prime Will Brown, creador de Verificadores
20:18 - Entrevista con prime Will Brown - historia del desarrollo de verificadores
23:16 - Entrevista con prime Will Brown - ¿cuál es la visión para el hub de entornos?
24:17 - Entrevista con prime Will Brown - ¿qué futuro hay para el entorno RL?
26:27 - 👺🦋👺🦋👺🦋
# Agradecimientos
👺 gracias will por tomarte el tiempo de bajar del cielo de gpu para charlar con nosotros sobre verificadores:
https://x.com/willccbbEntorno Comunitario:
Artículos & Videos & Enlaces Interesantes:
📌 El Aprendizaje por Refuerzo se Encuentra con Modelos de Lenguaje Grande: Una Encuesta de Avances y Aplicaciones a lo Largo del Ciclo de Vida de LLM:
https://arxiv.org/abs/2509.16679v1----
----
Sígueme en línea aquí:
___
¡Que tengas una gran semana! 👋