Conteúdo Arquivado

O conteúdo a seguir é de uma versão mais antiga deste site e pode não ser exibido corretamente.

A queda de energia no data center de Serviços da Web da Amazon na Virgínia, que provocou interrupção dos serviços de muitos negócios on-line semana passada, incluindo serviços populares, como o Netflix e o Pinterest, foi causada por uma falha no gerador alternativo, disse a empresa em um relatório do incidente, postado no site da área de serviços para a nuvem da Amazon.

Assim que ocorreu a queda de energia, provocada por uma tempestade elétrica de grande escala que passou pelo norte da Virgínia no dia 29 de junho, a carga elétrica de um dos mais de dez data centers da Amazon na região não obteve sucesso ao ser transferida para o gerador alternativo. A Fonte de Alimentação Ininterrupta (UPS) que servia aquele circuito em particular eventualmente ficou sem bateria, e os servidores começaram a perder potência por volta das 20 h (Horário Diurno do Pacífico).

Embora tenha prometido tomar medidas para reparar os equipamentos afetados, prolongar o período de failover e expandir o período de disponibilidade da equipe de engenharia para 24 horas, a Amazon disse que não iria substituir o gerador que apresentou problemas.

“Os geradores foram rigorosamente testados pelo fabricante antes da instalação neste local," informou a empresa. “Eles foram aprovados, novamente, quanto ao tempo de comissionamento de data center (aproximadamente oito horas de teste) sem apresentar problemas."

A tempestade afetou a Região Leste-1 dos EUA da infraestrutura de nuvem da Amazon, em que os data centers suportam uma série de "zonas de disponibilidade". Alocadas em locais distintos, as zonas são projetadas para isolar as falhas uma da outra, segundo a Amazon.

Instâncias de servidor de nuvem, volumes e bancos de dados de armazenamento e instâncias de balanceador de carga hospedadas pelo data center afetado representam uma “porcentagem de um só dígito” da capacidade total hospedada na região. Ainda assim, o impacto da queda foi generalizado e com duas vertentes: indisponibilidade de instâncias e volumes e um pobre desempenho dos planos de controle, os quais os clientes utilizam para realizar mudanças em sua infraestrutura baseada em nuvem.

Ao passo que o desempenho do plano de controle não tem nenhum impacto sobre o tempo de atividade da infraestrutura existente, ele é importante durante as quedas, quando os clientes querem mover recursos de uma zona de disponibilidade problemática para outra.

Nos mês passado, a Região Leste-1 apresentou outra queda importante, que derrubou uma série de serviços de Webs populares, incluindo Pinterest, Heroku, Quora e Foursquare. A empresa, finalmente, rastreou a causa-raiz dessa queda até falha em um cabo do sistema de distribuição de energia da instalação, mas disse que um gerador alternativo no data center havia desligado devido a uma ventoinha defeituosa.