Los guardrails en IA a veces son más flojetes de lo que parecen....
Y cuando eso pasa… se pueden hackear (o trampear)
Hoy probé algo que llevaba tiempo en la cabeza:
😏 Usar un chatbot de alguna empresa para programar en python, a pesar de que supuestamente no debería permitírmelo (y ya se arregló en su momento)
✅ Spoiler: it's done
Esto se llama prompt injection, básicamente, engañar al modelo para que se salga de sus límites y haga lo que no estaba previsto
Por cierto si quieres probar el prompt inyection hay un juego que se llamaGandalf de Lakera AI, es un juego donde tienes que convencer a la IA de que revele su secreto oculto
Por cierto del chatbot al que he estado haciendo prompt inyection es que el bot no usa un único modelo, sino un sistema que balancea entre varios LLM (Claude, GPT-3.5/4…) (está lleno de guardrails para que solo hable de productos… pero con un poco de creatividad los filtros no son tan sólidos)