A Amazon Web Services divulgou detalhes sobre a principal causa da queda de uma suas zonas de disponibilidade de nuvem pública, que teve início na noite de 14 de junho e durou até a manhã seguinte, horário do Pacífico.
Em uma nota postada no painel de status da nuvem, a empresa disse que a queda foi causada por uma falha em um cabo no sistema de distribuição de energia na instalação elétrica que servia o data center que hospedava a região US-East-1 da nuvem no norte da Virgínia.
Toda a instalação foi comutada para energia do gerador alternativo, mas um dos geradores superaqueceu e desligou devido a uma ventoinha defeituosa. As instâncias da máquina virtual e os volumes de armazenamento virtual alimentados por esse gerador foram transferidos para um sistema de energia alternativa secundário, provido por um circuito de distribuição de energia separado que possui sua própria capacidade de gerador alternativo.
Mas, um dos disjuntores deste circuito foi configurado incorretamente e desarmou assim que a carga foi transferida para o circuito. O disjuntos foi configurado para desarmar a um limite de energia muito baixo.
“Após o disjuntor do circuito ter desarmado... as instâncias e os volumes afetados ficaram sem energia alternativa primária, alternativa ou secundária," dizia a nota da Amazon.
Os clientes nessa zona de disponibilidade que estavam executando configurações em mais de uma zona de disponibilidade “evitaram interrupções significativas em suas aplicações; no entanto, os clientes afetados, que estavam executando aplicativos somente nessa Zona de Disponibilidade, tiveram de aguardar até que a energia fosse restaurada para voltar à funcionalidade total.
Entre os clientes afetados com tempo de inatividade estiveram diversos serviços da Web muito populares, incluindo Pinterest, Quero, Foursquare, e outros, de acordo com novos relatórios. A Heroku, por exemplo, relatou quedas generalizadas de sua produção e infraestruturas de desenvolvimento, que duraram por oito horas.
O disjuntor do circuito defeituoso desarmou por volta das 21 h, relatou a Amazon, e o gerador que parou de funcionar foi reiniciado por volta das 22h20. A maioria das instâncias de VM afetadas se recuperaram por volta das 22h50, e a maioria dos volumes de armazenamento na nuvem foram "devolvidos aos clientes" cerca de 1 da manhã.
A Amazon disse que havia concluído uma auditoria em todos os seus circuitos de distribuição de energia alternativa e descobriu outro disjuntor que "precisava de uma ação corretiva".
“Nós, agora, validamos que todos os disjuntores, em todo o mundo, estão adequadamente configurados, e estamos incorporando essas verificações de configuração em nossos processos regulares de teste e auditoria," disse a Amazon.