Mientras la API de 𝗗𝗲𝗲𝗽𝗦𝗲𝗲𝗸 𝗔𝗜 sigue dando problemas desde el lanzamiento de su modelo R1, aprovecho para pensar en alto.
Si lo que se dice es cierto, estaríamos hablando de casi un 98% más barato usar un modelo que es a priori más rápido y más listo frente al todo poderoso ChatGTP.
Uno de los temas son las tarjetas gráficas, es de bien saber, que China no tiene el liderazgo, y de la necesidad apareció la brillantez y es que los chinos usaron unas tarjetas gráficas llamadas NVIDIA H800 que serían como la hermana pequeña, pero pequeña de las NVIDIA H100.
DeepSeek viene en varios formatos y lo mejor de todos es que es código abierto:
✅DeepSeekV3 que sería el ChatGPT4o
✅DeepSeek R1 que sería el ChatGPT4o1
✅DeepSeek y sus destilados como DeepSeek-R1-Distill-Qwen-1.5B o DeepSeek-R1-Distill-Llama-70B (es decir modelos para todos los bolsillos).
Ahora bien, aquí unos conceptos básicos para entender este tipo de documentación: https://lnkd.in/d9SP7GVg
1️⃣¿Qué es un modelo de IA? 🧠
¿No os viene a la cabeza un cerebro cuándo se habla de IA? Pues eso, es un modelo, un cerebro que aprende cosas. Hacer que funcione un cerebro grande y vaya aprendiendo y contestando a tus preguntas requiere más recursos (energía, computación, etc.), por eso, los modelos más famosos vienen con varios tamaños. Modelos para todos los bolsillos.
2️⃣¿Qué significa la '𝐁' en los modelos?
La B es de "billones" (de parámetros). Los parámetros son como las "conexiones cerebrales" de la IA. Por ejemplo:
↳1.5B: Modelo ligero, ideal para cosas como que lea el email por ti.
↳7B: Modelo intermedio, útil para tareas más complejas como chatbots o análisis de texto. 💬
↳70B: Modelo pesado, diseñado para tareas avanzadas como traducción automática o generación de contenido complejo. El buen profe de matemáticas (depende del modelo será mejor o peor profe)
⚠️Ojo cuidado, que más parámetros significa más gasto en energía y computación, así que muchas veces más parámetros NO siempre es mejor.
3️⃣ ¿Qué es la destilación?
Es lo que permite comprimir un modelo grande en uno más pequeño sin perder demasiada calidad. Es como si pones a 1.5x a Juan Ramón Rayo, te enteras igual, pero ahorras tiempo y energía. Esto hace que los modelos sean más eficientes y accesibles para dispositivos con menos recursos.
4️⃣ MOE: El comité de expertos de la IA (este si existe)
MOE (Mixture of Experts) es como dividir el trabajo en especialistas o cracks, uno de matemáticas, otro en programación, etc). El MOE permite que en lugar de tener un modelo de 200B tengas 10 minimodelos de 20B que sean cracks en una tareas, y según qué tarea pues el cerebro lo redirige al crack correspondiente y sin agile... Con esto se obtiene que entrenar a un modelo sea más barato y sea más rápido.
5️⃣ El buen open source (gratis y libre) = Menos gasto para todos y más opción de conocimiento para todos.
¿Estáis teniendo problemas al usar la API?
#api #opensource #DeepLearning #bigdata #dataengineer