La plataforma de aplicaciones basada en cloud de Google sufrió el pasado viernes una caída que originó que aproximadamente la mitad de las instancias de las aplicaciones fallaran durante más de cuatro horas.
Cuando Google App Engine, la oferta de plataforma como servicio (PaaS) de la compañía, se vino abajo, la caída afectó a una multitud de usuarios. De hecho, en un principio afectó a casi todos los servicios y usuarios de App Engine, según el equipo de ingeniería de App Engine.
El servicio de almacenamiento online Dropbox y la plataforma blog Tumblr también experimentaron interrupciones de servicio. No obstante, no hay indicaciones de que las caídas de las tres compañías estuvieran conectadas.
“El funcionamiento defectuoso parece estar limitado a un único componente que enruta las peticiones de los usuarios a la instancia de la aplicación que están utilizando y no afecta a las propias instancias”, explicó posteriormente Google.
En una entrada del blog publicada por la compañía, quedó explicado con más detalle lo que había ocurrido esa mañana. A las 4 de la mañana, las cargas comenzaron a incrementarse en los routers de uno de los data centers de App Engine. Dos horas más tarde, la carga de los routers en el data center afectado sobrepasó el umbral de intensidad de señal.
A las 6.30, Google comenzó a reiniciar globalmente los routers para dirigir la carga en el data center. A la hora, este reinicio, junto con carga adicional, redujo inesperadamente los routers disponibles por debajo del mínimo requerido para una operación fiable. Esto causó sobrecarga en los routers restantes, que se extendió a todos los data centers de App Engine. Por ello, las aplicaciones empezaron a experimentar tasas de error y latencias elevadas.
A las 11 de la mañana, Google indicó que los routers de App Engine estaban atrapados en un error en cascada y que no le quedaba otra opción que llevar a cabo un reinicio completo. A las 11.45, Google confirmó que App Engine había vuelto a la normalidad.
La compañía dijo que había incrementado su capacidad de routing en respuesta al incidente para hacer que esos errores en cascada fueran menos probables en un futuro. Ningún dato de los clientes se perdió, y las aplicaciones volvieron a su operación normal sin la intervención de los desarrolladores, indicó Peter Magnusson, director de ingeniería de App Engine.
Para compensar el incumplimiento de los SLAs, Google reducirá un 10% de las facturas de octubre a las aplicaciones pagadas.
Durante la pasada semana se produjo también una caída en los servicios cloud de Amazon Web Services, ampliamente utilizados por algunas de las web más populares, debido a problemas en su data center de Virginia, ocasionando la caída de páginas web como Reddit y Netflix, entre otras.
Google App Engine cae, junto con Dropbox y Tumblr
Los servicios quedan interrumpidos por más de cuatro horas, aunque no parece haber relación entre las diferentes caídas