🚨Los LLMs están empezando a aprender por sí mismos.
Pero hay un dilema importante...
Los métodos basados en entornos ofrecen feedback preciso, aunque suelen estar limitados a dominios estrechos
La self-generation amplía el espacio de aprendizaje, pero introduce otro problema y es el... ¿cómo verificar de forma fiable lo que genera el propio modelo?
Skill Self-Play propone una solución utilizar skills como unidad de autoevolución
¿Cómo funciona?
1️⃣ El modelo genera skills verificables, como “extraer fechas” o “resumir contratos”
2️⃣ Crea nuevas instancias de esas skills con dificultad progresiva
3️⃣ Evalúa sus propias respuestas mediante verificaciones deterministas, sin depender de anotadores humanos
4️⃣ Modelo y skills coevolucionan en un ciclo cerrado. El modelo mejora sus capacidades y, al mismo tiempo, genera retos cada vez más exigentes.
La ventaja es que no necesita entornos cerrados, como juegos o simuladores específicos.
Además, reduce el riesgo de contaminar el proceso de entrenamiento con señales de recompensa poco fiables.
El principal trade-off es el coste computacional.
Generar, verificar y evolucionar múltiples skills en paralelo requiere una infraestructura considerable y mucho consumo de tokens...
Aun así, para construir agentes cada vez más generalistas, este enfoque abre una vía prometedora para escalar el aprendizaje sin depender exclusivamente de datasets anotados a mano.
Te dejo el paper en comentarios..
👇 👇 👇 👇 👇