Contenido Archivado

El siguiente contenido es de una versión anterior de este sitio web y es posible que no se muestre correctamente.

Poco más de una semana ha pasado desde la interrupción de los servicios de Windows Azure en Europa del oeste, y la compañía aún sigue dando razones para explicar dicha caída. Según apuntan desde Microsoft, el incidente se produjo porque los ingenieros de la compañía expandieron la capacidad de uno de los clústeres, pero olvidaron realizar todos los ajustes de configuración necesarios en la infraestructura de red.

“La infraestructura de red de Windows Azure utiliza un mecanismo de válvula de seguridad para proteger la plataforma frente a posibles fallos de red en cascada, limitando para ello el alcance de las conexiones que pueden ser aceptadas por los dispositivos de red del data center”, escribió en un blog Mike Neil, director general para Windows Azure.

En respuesta a un incremento en la demanda de su infraestructura cloud para la región del oeste de Europa, los técnicos añadieron nueva capacidad a un clúster que proporciona servicios en esta zona. Lo que no hicieron fue configurar el mecanismo de válvula de seguridad para aceptar más conexiones y adecuarlas a la nueva capacidad.

Tan pronto como la capacidad fue incorporada, el consumo en el clúster se incrementó rápidamente, superando el límite de la antigua conexión, lo que generó multitud de mensajes de gestión de red. Todo este tráfico de gestión provocó fallas en parte del hardware en el clúster.

Estos errores llevaron a los dispositivos a alcanzar el tope de utilización de la CPU, impactando en el tráfico de datos. Ahora, Microsoft ha incrementando la configuración límite en el clúster afectado, así como en todos los data centers para Azure. La compañía también está arreglando errores en el software del dispositivo.

Finalmente, el proveedor cloud ha mejorado sus sistemas de monitoreo de red para visualizar problemas similares de conectividad antes de que afecten a los servicios actuales.

Según indicó Neil, solo los servicios Azure alojados en el clúster de Europa se vieron afectados. Ninguna otra región o servicio estuvieron afectados por la interrupción de 2,5 horas producida el pasado 26 de julio.