¿Qué paso ayer en el mundo y cómo poder evitarlo?
Como sabes ayer medio internet no funcionaba...y no, no era culpa de LaLiga esta vez bloqueando Cloudflare 😅
Te lo explico fácil 👇
↳ Fallo en el DNS interno
El DNS es como la agenda de contactos de Internet. Traduce nombres como google.com en direcciones reales es decir números 8.8.8.8
Si la agenda falla… los servicios no se encuentran entre sí.
↳ Cae DynamoDB
Es una base de datos enorme donde miles de apps guardan información.
Cuando se cae, arrastra a servicios como EC2 (máquinas virtuales), Lambda (funciones sin servidor) o API Gateway (conexión entre apps).
↳ Fallo en los balanceadores de red
Son los que reparten el tráfico para que ningún servidor se sature.
Si fallan, el tráfico se atasca o se pierde.
↳ AWS empieza a solucionar el brownie causdo
Los ingenieros van cerrando los fallos, redirigiendo tráfico y reiniciando servicios para que todo vuelva a funcionar sin romper nada más.
💡 ¿Qué aprendemos de esto?
La verdadera resiliencia no está en tener varias zonas, sino en tener varias regiones o incluso varios proveedores.
Y en algunos casos, mantener parte de los servicios críticos on-prem puede ser lo suyo, recordemos que DORA es una regulación europea sobre resiliencia que aplica sobre todo a bancos