Golden sets: cómo saber si tu IA ha mejorado o solo lo parece
Cambias el prompt, el modelo, una skill o las herramientas de un agente, y parece que va mejor. Guía para montar un golden set y un pipeline de evaluación que lo demuestren, con un ejemplo ejecutable sobre Ollama en local.
Leer artículo