A Netflix ficou para trás da Amazon Web Services após o que foi uma das maiores interrupções para a empresa de transmissão e aluguel de filmes em mais de um ano.
Ao passo que o tempo de inatividade de três horas da Netflix no dia 29 de junho foi provocado por uma queda de energia que ocorreu durante uma forte tempestade na costa leste dos EUA e derrubou um data center da Amazon, a análise da causa principal da queda pela Netflix descobriu problemas com o próprio sistema da empresa cinematográfica, escreveram em um blog Greg Orzell e Ariel Tseitlin, tecnólogos que supervisionam a configuração da nuvem da Netflix.
Orzell e Tseitlin mantiveram sua decisão de migrar do data center para a nuvem vários anos atrás. “Ao passo que é fácil e comum culpar a nuvem por quedas, porque ela está fora de seu controle, notamos que nossa disponibilidade geral nos últimos anos tem melhorado," escreveram Orzell e Tseitlin.
Quando investigaram as causas principais de suas maiores quedas, eles, geralmente, adicionam padrões de resiliência que mitigam interrupções semelhantes no futuro.
Após a última queda, “nossa análise da causa principal levou a algumas descobertas interessantes, incluindo um caso extremo em nosso serviço de balanceamento de carga interno de nível intermediário", eles escreveram.
Um recurso da infraestrutura da nuvem da Netflix implementado para mitigar o tempo de inatividade provocado pelas quedas da Amazon agiram de modo inesperado, causando uma falha em cascata. O recurso,que é parte das configurações de balanceamento de carga da nuvem, pararam de remover instâncias insalubres quando muitas delas falharam de uma vez.
Ele foi implementado como um travamento de curto prazo que poderia ser suspenso após um problema em larga escala ser investigado. Os engenheiros da Netflix acharam mais difícil suspender o travamento após a queda da Amazon.
"Sair desse estado provou ser tanto complexo quanto moroso, fazendo com que os serviços continuem a tentar usar os servidores que não estavam mais ativos devido à falta de energia", Orzell e Tseitlin escreveram.
Isso levou a um problema de segunda ordem, em que clientes tentando se conectar a servidores que já não estavam mais disponíveis assumiam todos os encadeamentos dos clientes, causando um gargalo na maioria dos serviços.
“O estado da nuvem continuará amadurecendo e melhorando com o tempo”, escreveram os engenheiros da Netflix. “Estamos trabalhando em estreita colaboração com a Amazon em maneiras para aprimorar seus sistemas, focando nossos esforços em eliminar pontos isolados de falhas que podem provocar quedas em toda uma região e isolar as falhas de zonas individuais."