Ayer pasé 4 horas debuggeando un prompt que fallaba 1 de cada 5 veces...
Mismo input. Mismo modelo. Mismo temperature (0.1).
A veces respuesta perfecta. A veces basura total.
El problema no era el prompt.
Era sampling no-determinista incluso con temperature bajo.
La solución (que nadie documenta bien):
1️⃣ Usa seed fijo en la API call
→ OpenAI y Anthropic lo soportan (parámetro 'seed')
→ Con temperature=0 + seed fijo = respuestas 99% reproducibles
2️⃣ Loguea el logprobs de tokens clave
→ Si el modelo duda entre 2 tokens (probabilidad 48% vs 45%), tu prompt es ambiguo
→ Refina el wording hasta que logprobs > 80% en el token correcto
3️⃣ Testea con 50 runs, no con 3
→ Varianza normal puede esconder problemas estructurales
Desde que aplico esto, mis prompts tienen <2% de fallos inesperados/alucinaciones
¿Usas seed en tus llamadas o confías en que "temperature=0 es suficiente"?