A 𝗗𝗲𝗲𝗽𝗦𝗲𝗲𝗸 π—”π—œ no le gusta hablar de historia... β›”

A 𝗗𝗲𝗲𝗽𝗦𝗲𝗲𝗸 π—”π—œ no le gusta hablar de historia... β›”

A 𝗗𝗲𝗲𝗽𝗦𝗲𝗲𝗸 π—”π—œ no le gusta hablar de historia... β›” Solo mira el vΓ­deo... . . . . ⚠️Parte mΓ‘s tΓ©cnica: Pero cΓ³mo se ha entrenado R1 (en 3 pasos) 1. S…

✍️

A 𝗗𝗲𝗲𝗽𝗦𝗲𝗲𝗸 π—”π—œ no le gusta hablar de historia... β›”

Solo mira el vΓ­deo...

.

.

.

.

⚠️Parte mÑs técnica:

Pero cΓ³mo se ha entrenado R1 (en 3 pasos)

  • Se parte de un modelo base preentrenado
  • Se usan datos SFT (Supervised Fine Tuning) con cadenas largas de razonamiento.
  • Se crea el modelo de razonamiento con aprendizaje por refuerzo (RL) a gran escala

3.1. Aprendizaje por refuerzo a gran escala orientado al razonamiento (R1-Zero)

3.2. Se crean datos SFT de razonamiento con el modelo de razonamiento propio.

3.3. El modelo entra en la fase general de entrenamiento de RL (Reinforcement Learning), aprende a gran escala en base a unas recompensas.

Technical report de DeepSeek V3: https://lnkd.in/dhfGhWvr

❎¿Te ha pasado algo parecido?

#deepseek #ai #bigdata

Ver post original en LinkedIn
ΒΏTe ha resultado ΓΊtil?

Cada semana publico sobre IA, cloud y arquitectura tecnolΓ³gica en LinkedIn.
MΓ‘s de 4.000 profesionales ya lo siguen.

Seguir en LinkedIn