Hoy, quiero compartir un nuevo episodio con Aman Khan.
La mejor manera de aprender sobre evaluaciones de IA es ver a 2 PMs construirlas en vivo desde cero. En nuestro nuevo episodio, Aman y yo recorremos la creación de evaluaciones para un agente de soporte al cliente de IA — desde etiquetar un conjunto de datos dorado hasta alinear a los jueces de LLM. Este es el curso completo de evaluaciones de IA para principiantes que has estado esperando.
Aman y yo hablamos sobre:
(00:00) ¿Qué son las evaluaciones de IA y cómo mejorar en ellas?
(02:52) Los 4 tipos de evaluaciones de IA que todos deberían conocer
(06:08) Demostración en vivo: Construyendo evaluaciones para un agente de soporte al cliente
(10:29) Usando la consola de Anthropic para generar excelentes prompts
(15:13) Creando los criterios de evaluación
(17:40) Agregando etiquetas humanas al conjunto de datos dorado
(31:05) Escalando evaluaciones con prompts de jueces de LLM
(38:21) Cómo alinear a los jueces de LLM con el juicio humano
Dónde encontrar a Aman:
📌 Suscríbete a este canal – ¡más entrevistas próximamente!