Los guardrails en IA a veces son más flojetes de lo que parecen....

Los guardrails en IA a veces son más flojetes de lo que parecen....

Los guardrails en IA a veces son más flojetes de lo que parecen.... Y cuando eso pasa… se pueden hackear (o trampear) Hoy probé algo que llevaba tiempo en la…

✍️

Los guardrails en IA a veces son más flojetes de lo que parecen....

Y cuando eso pasa… se pueden hackear (o trampear)

Hoy probé algo que llevaba tiempo en la cabeza:

😏 Usar un chatbot de alguna empresa para programar en python, a pesar de que supuestamente no debería permitírmelo (y ya se arregló en su momento)

✅ Spoiler: it's done

Esto se llama prompt injection, básicamente, engañar al modelo para que se salga de sus límites y haga lo que no estaba previsto

Por cierto si quieres probar el prompt inyection hay un juego que se llamaGandalf de Lakera AI, es un juego donde tienes que convencer a la IA de que revele su secreto oculto

Por cierto del chatbot al que he estado haciendo prompt inyection es que el bot no usa un único modelo, sino un sistema que balancea entre varios LLM (Claude, GPT-3.5/4…) (está lleno de guardrails para que solo hable de productos… pero con un poco de creatividad los filtros no son tan sólidos)

Ver post original en LinkedIn
¿Te ha resultado útil?

Cada semana publico sobre IA, cloud y arquitectura tecnológica en LinkedIn.
Más de 4.000 profesionales ya lo siguen.

Seguir en LinkedIn