Hace algo más de tres años PQC presentaba, en el evento DCD de Madrid, una ponencia en la que se explicaban los detalles de 30 casos de downtime en data centers, pertenecientes todos ellos a lo que podemos considerar como niveles más altos de exigencia en cuanto a la continuidad del servicio.
Poco más de un año más tarde, para la fecha del evento de México, el número de casos había crecido hasta los 35 y sólo tuvieron que pasar unos pocos meses más para que, coincidiendo con el DCD de Buenos Aires, la cifra llegase a 38.
A partir de entonces no volvimos a publicar estos datos, pero no por ello dejamos de mantener al día una estadística que, a día de hoy, alcanza la cifra redonda de 50 casos.
En este estudio, las causas de caídas de CPDs se clasifican en cuatro grupos. Las que tienen su origen en errores de diseño, las correspondientes a la construcción, las relativas a las tareas de mantenimiento y operación y, por último, las ocasionadas directamente por fallos de producto.
Una buena parte de estas causas son predecibles y, generalmente, son advertidas durante la realización de estudios especializados sobre los riesgos existentes en un CPD. Desde los que se llevan a cabo en la etapa de diseño y construcción (revisión asociada a una etapa previa de commissioning), hasta los que se realizan una vez la instalación se encuentra en marcha, con mención especial para los data centers que llevan ya una serie de años de funcionamiento.
La no correspondencia de los diseños con la topología requerida es uno de los errores más típicos en la fase de diseño y ejecución del proyecto, mientras que el desconocimiento sobre la existencia de puntos singulares de fallo y la operación incorrecta sobre los mismos es algo muy frecuente en la operación de un centro y sus trabajos de mantenimiento asociados.
Desde una visión global de los sucesos que tienen como consecuencia un cero en el data center, lo que sí se puede afirmar, además, es que las proporciones se mantienen desde la primera versión hasta la actual. Esta valoración nos muestra cómo más de la mitad de los casos tienen su origen en errores humanos directos (sin contar entre estos los errores de diseño y construcción, también humanos, por cierto).
Independientemente del grupo al que pertenezca el caso concreto que se analiza, existe un dato bastante elocuente que se va reforzando a medida que se incrementa una muestra de estudio que trasciende de lo que representa el inicial mercado español en el que se basaba, incorporando datos de recientes sucesos en el mercado internacional, principalmente Latam. Se trata de la elevada proporción de sucesos con consecuencia de caída del data center en los que, de una u otra forma, se encuentra implicado el grupo electrógeno o sus elementos y sistemas complementarios. En concreto, de los últimos 10 casos que componen el conjunto analizado, 7 han tenido relación con este asunto.
Entre ellos, los hay de todos los tipos, pero un denominador bastante común es la ausencia de pruebas específicas en condiciones reales de funcionamiento, así como la consecuente falta de entrenamiento del personal adscrito al departamento de operación y/o mantenimiento del CPD.
Ensayos sin carga, o de tan corta duración que no se llega a una condición estable de funcionamiento, o sin llevar a la instalación a las condiciones más extremas de operación, o ausencia de aquellos relacionados con la sincronización de unidades en paralelo, etc., no pueden garantizar la correcta respuesta del colchón de seguridad más básico del que disponemos para la seguridad del sistema.
Insistimos, el pecado no es exclusivo de nuestro sector geográfico más inmediato, sino que se extiende hasta todos los lugares donde el sistema de respaldo se realiza mediante esta tecnología, es decir, en casi todas partes.