Decir que RAG ha muerto es una de las simplificaciones más peligrosas que estoy viendo últimamente y todo...
Porque como tenemos ventanas de contexto enorme pues ya estaría...
Pero... ¿qué es RAG?
RAG es una forma de dar al modelo acceso a información externa a través de un proceso (context injection) en el que ....
1️⃣ los documentos se fragmentan en chunks
2️⃣ se convierten en vectores mediante un embedding model
3️⃣ se almacenan en una vector DB
4️⃣ y después, cuando el usuario hace una pregunta, el sistema busca la información más relevante, recupera los fragmentos útiles y se los pasa al modelo antes de responder
Es decir no reentrena al modelo, le da contexto
Entonces… ¿por qué sigue siendo necesario si ahora existen modelos con ventanas de contexto gigantes?
Porque una cosa es poder meter mucho texto en un prompt
Y otra muy distinta es que eso escale bien en entornos reales
Cuando trabajas con por ejemplo...
- documentación interna (pdf, word)
- miles de archivos
- código
- wikis/sharepoint
- tickets
RAG sigue siendo clave para filtrar, encontrar y servir solo lo relevante
Sí, el long context simplifica muchos casos
Pero en empresa, donde el conocimiento es masivo y está disperso, RAG no ha muerto...
Así que no, no hay un dogfight entre RAG vs Long Context
Sino ...¿Qué arquitectura tiene sentido para este problema?
Gana lo que funciona cuando sales de la demo y entras en producción
#IA #RAG #LLM #GenAI