Amazon ha compartido más detalles acerca de lo que causó la caída de AWS la pasada semana.
El martes por la mañana, sobre las 9 am hora del Pacífico, un miembro del equipo de AWS tecleó mal una línea de código mientras depuraba de errores el proceso de facturación de S3, y accidentalmente eliminó subsistemas internos, causando un caos interno –y externo-.
Cómo acabar con Internet
"A las 9:37 AM PST, un miembro autorizado del equipo S3, usando un libro oficial ejecutó un comando que tenía la intención de eliminar un pequeño número de servidores para uno de los subsistemas S3 que es utilizado por el proceso de facturación de S3", dijo Amazon en un post Mortem.
"Desafortunadamente, una de las entradas al comando fue introducida incorrectamente y un conjunto más grande de servidores se eliminó de improviso. Los servidores que fueron eliminados inadvertidamente dban servicio a otros dos subsistemas S3. "
Uno de los subsistemas fue el subsistema de índice, que gestiona los metadatos y la información de localización de todos los objetos S3 en la región US-EAST-1. "Este subsistema es necesario para atender todas las solicitudes GET, LIST, PUT y DELETE", dijo la compañía.
El otro subsistema era el subsistema de colocación, que gestiona la asignación del nuevo almacenamiento y requiere que el subsistema del índice esté funcionando.
Amazon señaló: Eliminar una porción significativa de capacidad causada por cada uno de estos sistemas requiere un reinicio completo. Mientras estos sistemas eran reiniciados, S3 no podía atender el servicio de solicitudes. Otros servicios en la región de EEUU- Este- 1 que dependían del almacenamiento de S3, incluyendo la consola S3, EC2, el lanzamiento de nuevas instancias, volúmenes Amazon Elastic Block Store (EBS), y AWS Lambda también resultaron afectados mientras las APIs de S3· no estuvieron disponibles.
AWS planea hacer varios cambios en sus procesos, incluyendo la limitación que la cantidad de capacidad se puede retirar de forma rápida, así como prevenir la posibilidad de ser eliminación cuando esto suponga que cualquier subsistema se quede por debajo de su nivel de capacidad mínima requerida.
“También añadiremos cambios para mejorar el tiempo de recuperación de los subsitemas clave de S3”.
La consola de AWS que indica los servicios que sufren problemas y no pudo actualizarse durante la caída por depender de S3 se ha actualizado también para funcionar en múltiples regiones AWS.
Comments