Contenido Archivado

El siguiente contenido es de una versión anterior de este sitio web y es posible que no se muestre correctamente.

El corte de electricidad que sufrió el centro de datos de Amazon que alberga sus Web Services en Virginia, Estados Unidos, y que provocó un efecto en cadena que hizo caer numerosos negocios web, como los populares Netflix y Pinterest, fue causado en un última instancia por un generador de respaldo que falló, según comenta Amazon en un post subido a la web de los servicios cloud corporativos de la compañía.

Una vez se produjo el corte eléctrico, provocado por una tormenta eléctrica a gran escala que castigó el norte de Virginia el pasado 29 de junio, la carga eléctrica de uno de los más de 10 centros de datos de Amazon en la región no se pudo transferir con éxito al generador de respaldo. Llegó un momento en que el sistema de alimentación ininterrumpida que apoyaba ese circuito en concreto se quedó sin batería y los servidores comenzaron a perder energía en torno a las 8:00 de la tarde.

Aunque prometió que tomaría las medidas necesarias para reparar el equipamiento afectado, prolongando el tiempo de caída y ampliando el tiempo de trabajo del equipo de ingenieros, Amazon aseguró que no reemplazaría el generador culpable.

“Antes de ser incorporados a estas instalaciones, los generadores fueron rigurosamente probados por el fabricante”, indicó la compañía. “En el momento del comisionamiento del centro de datos, volvieron a pasar todas las pruebas de carga (aproximadamente 78 horas de prueba) sin problemas.”

La tormenta afectó la región US-East-1 de la infraestructura cloud de Amazon, donde sus centros de datos soportan numerosas “zonas de disponibilidad”. Situadas en distintas ubicaciones, las zonas están preparadas para aislar los fallos unas de otras, según Amazon.

Las instancias de servidores cloud, los volúmenes de almacenamiento y bases de datos y las instancias de balanceo de carga que alberga el centro de datos afectad representa un “porcentaje de un solo dígito” de la capacidad total que hay en la región. Sin embargo, el impacto del corte fue amplio y doble: falta de disponibilidad de las instancias y volúmenes y rendimiento degradado de los planos de control, que los clientes utilizan para realizar cambios en su infraestructura basada en la nube.

Aunque el rendimiento del plano de control no tiene impacto sobre el tiempo de funcionamiento de la infraestructura existente, es importante durante los cortes, cuando los clientes quieren cambiar los recursos de una zona de disponibilidad problemática a otra.

El mes pasado, la región US-East-1 sufrió otro gran corte eléctrico que echó por tierra numerosas páginas web, Heroku, Quora, Foursquare o Pinterest. En esa ocasión, Amazon señaló un fallo en un cable de su sistema de distribución de energía como causante del corte, señalando en todo cado que un generador de respaldo del centro de datos se había apagado por culpa de un ventilador defectuoso.