Ayer pasé 4 horas debuggeando un prompt que fallaba 1 de cada 5 veces...

Ayer pasé 4 horas debuggeando un prompt que fallaba 1 de cada 5 veces...

Ayer pasé 4 horas debuggeando un prompt que fallaba 1 de cada 5 veces... Mismo input. Mismo modelo. Mismo temperature (0.1). A veces respuesta perfecta. A ve…

✍️

Ayer pasé 4 horas debuggeando un prompt que fallaba 1 de cada 5 veces...

Mismo input. Mismo modelo. Mismo temperature (0.1).

A veces respuesta perfecta. A veces basura total.

El problema no era el prompt.

Era sampling no-determinista incluso con temperature bajo.

La solución (que nadie documenta bien):

1️⃣ Usa seed fijo en la API call

→ OpenAI y Anthropic lo soportan (parámetro 'seed')

→ Con temperature=0 + seed fijo = respuestas 99% reproducibles

2️⃣ Loguea el logprobs de tokens clave

→ Si el modelo duda entre 2 tokens (probabilidad 48% vs 45%), tu prompt es ambiguo

→ Refina el wording hasta que logprobs > 80% en el token correcto

3️⃣ Testea con 50 runs, no con 3

→ Varianza normal puede esconder problemas estructurales

Desde que aplico esto, mis prompts tienen <2% de fallos inesperados/alucinaciones

¿Usas seed en tus llamadas o confías en que "temperature=0 es suficiente"?

Ver post original en LinkedIn
¿Te ha resultado útil?

Cada semana publico sobre IA, cloud y arquitectura tecnológica en LinkedIn.
Más de 4.000 profesionales ya lo siguen.

Seguir en LinkedIn