A ππ²π²π½π¦π²π²πΈ ππ no le gusta hablar de historia... β
Solo mira el vΓdeo...
.
.
.
.
β οΈParte mΓ‘s tΓ©cnica:
Pero cΓ³mo se ha entrenado R1 (en 3 pasos)
- Se parte de un modelo base preentrenado
- Se usan datos SFT (Supervised Fine Tuning) con cadenas largas de razonamiento.
- Se crea el modelo de razonamiento con aprendizaje por refuerzo (RL) a gran escala
3.1. Aprendizaje por refuerzo a gran escala orientado al razonamiento (R1-Zero)
3.2. Se crean datos SFT de razonamiento con el modelo de razonamiento propio.
3.3. El modelo entra en la fase general de entrenamiento de RL (Reinforcement Learning), aprende a gran escala en base a unas recompensas.
Technical report de DeepSeek V3: https://lnkd.in/dhfGhWvr
βΒΏTe ha pasado algo parecido?
#deepseek #ai #bigdata