Cuando se oye el término "superordenador", los no iniciados probablemente evocan imágenes de una máquina similar al ordenador Colossus utilizado por los descifradores de códigos británicos en Bletchley Park durante la Segunda Guerra Mundial.

Y, aunque no cabe duda de que algunos sistemas actuales impresionan por su tamaño -los esfuerzos de Elon Musk por desarrollar su propio clúster Colossus le han llevado a desplegar más de 200.000 GPU en Tennessee-, la realidad de la mayoría de los sistemas, al menos visualmente, es mucho más decepcionante.

A pesar de los esfuerzos de British Airways por mantenernos en tierra, DCD viajó al Centro de computación de alto rendimiento (HLRS) de Stuttgart (Alemania) para visitar Hunter, el primero de los dos superordenadores HPE encargados por la Universidad de Stuttgart para llevar al HLRS al nivel de exaescala.

Este sistema basado en HPE Cray EX4000, con un coste de 15 millones de euros (17,5 millones de dólares) y puesto en marcha en enero de 2025, consta de 512 procesadores AMD Eypc 'Genoa', agrupados en 256 nodos, cada uno de ellos equipado con 768 GB de memoria DDR5-4800. Sin embargo, a diferencia de otros sistemas HPC alojados en el HLRS, Hunter también cuenta con GPU: 752 unidades de procesamiento acelerado (APU) AMD Instinct MI300A repartidas en 188 nodos refrigerados por líquido.

Lanzada oficialmente en diciembre de 2023, la Instinct MI300A de AMD combina 24 núcleos de CPU basados en Zen4 con un acelerador de GPU y 128 GB de memoria de gran ancho de banda (HBM3) en el mismo silicio. Esta arquitectura permite que tanto la CPU como la GPU accedan a la misma memoria, lo que, según AMD, evita que billones de cálculos pasen por la memoria unificada y acelera el rendimiento de las cargas de trabajo HPC.

Cada APU tiene 24 núcleos de CPU Zen 4 y ofrece 128 GB de HBM3. AMD también ha utilizado un diseño de apilamiento 3D para el chip, lo que le permite integrar varios troqueles de silicio más pequeños para formar un procesador más grande.

Hunter supercomputer HLRS inside
– Charlotte Trueman

Hunter tiene un rendimiento máximo teórico de 48,1 petaflops (más información al respecto más adelante), y cada uno de sus nodos está equipado con cuatro interconexiones de alto rendimiento HPE Slingshot. Ocupa el puesto 54 en la edición más reciente de la lista Top500 y el 12 en la Green500, y proporciona el doble de velocidad consumiendo un 80% menos de energía que su predecesor, Hawk.

En lo que respecta a la arquitectura de Hunter, Utz-Uwe Haus, responsable del laboratorio de investigación HPC/AI EMEA de HPE, describe el diseño de Cray EX como "la arquitectura que HPE, con su gran herencia, construye para los mejores sistemas"

Un único armario de un sistema EX4000 puede albergar hasta 64 compute blades -servidores modulares de alta densidad que comparten recursos de alimentación, refrigeración y red- dentro de ocho chasis de computación, todos ellos refrigerados por placas frías de refrigeración líquida conectadas directamente y soportadas por una unidad de distribución de refrigeración (CDU).

"Está muy integrado", afirma. "La parte trasera, que es toda la infraestructura de red (HPE Slingshot), coincide con la parte delantera, que contiene los blades"

Para Hunter, HLRS ha seleccionado hardware AMD, pero Haus explica que, con los sistemas Cray EX, los clientes pueden, más o menos, seleccionar la unidad de procesamiento que deseen del proveedor que quieran, y la infraestructura informática puede encajarse en el sistema sin necesidad de una reconfiguración total.

"Si HLRS decidiera en algún momento cambiar las placas AMD [de Hunter] por la siguiente generación, o utilizar las de otro competidor, el resto del sistema permanece igual. También podrían haber decidido no utilizar nuestra red: quedarse con las placas y poner una red diferente, si tenemos eso en el factor de forma. la arquitectura [HPE Cray EX] está muy ajustada, pero al mismo tiempo es flexible", afirma.

Hunter pretende ser un sistema de transición hacia el superordenador a exaescala Herder, que entrará en funcionamiento en 2027. Actualmente se está construyendo un nuevo centro de datos en el HLRS antes del despliegue previsto de Herder, ya que no es posible reforzar el suelo de la sala de datos donde se aloja Hunter para que los dos sistemas estén uno al lado del otro.

A pesar de todo, el colorido y potente sistema parece un poco perdido en un rincón de la sala de datos, rodeado de todo el espacio vacío que ocupaba Hawk y del clúster Vulcan NEC del centro, un "clúster de PC estándar" a disposición de la Universidad de Stuttgart para cargas de trabajo de investigación, visualización, IA y big data.

Simplemente el mejor

El HLRS se creó en 1996 como el primer centro nacional de computación de alto rendimiento (HPC) de Alemania, ofreciendo a usuarios de los sectores científico, industrial y público acceso a recursos de supercomputación para "proyectos de simulación de cálculo intensivo"

Es uno de los tres centros nacionales de cálculo de Alemania, siendo los otros el Centro de Supercomputación Leibniz (LRZ) de Garching, cerca de Múnich, y el Centro de Supercomputación Jülich (JSC) de Jülich, Renania del Norte-Westfalia. También hay varios centros de supercomputación más pequeños en el país, supervisados por la Gauss Alliance, una asociación sin ánimo de lucro para la promoción de la ciencia y la investigación, de cuya junta es miembro el Prof. Dr. Michael M. Resch, director del HLRS.

Llevar un superordenador como Hunter del concepto a la realidad es un proceso que requiere planificación y paciencia, además de experiencia, un modelo de negocio a largo plazo y una estructura de inversión que incluya todo un ecosistema de hardware, software e infraestructura que lo acompañe.

Resch afirma que el HLRS lleva instalando sistemas con hardware de AMD desde 2002 y que, sin embargo, cada vez que el centro empieza a discutir la construcción de su próximo sistema, adopta un enfoque agnóstico con respecto al proveedor. Cuando se le pregunta si Herder también estará compuesto por hardware de AMD, Resch afirma que aún no se ha tomado ninguna decisión y que las negociaciones continuarán hasta finales de 2025.

"Somos un centro nacional de supercomputación y necesitamos comprar un nuevo sistema de vez en cuando", dice, y añade que cuando esto ocurre, el centro pasa por un riguroso proceso de adquisición, que implica muchas y largas discusiones con los proveedores.

"Buscamos la mejor solución. Me preguntaron... si Europa era importante, y la respuesta es no. Queremos tener el mejor sistema, y no nos importa [de dónde venga]: somos muy agnósticos en lo que se refiere a nombres de empresas o nacionalidad. Tenemos unos 800 usuarios y necesitan las mejores soluciones"

Resch afirma que, en el mundo de la HPC, la mejor solución es la que ofrece un rendimiento sostenido.

"De vez en cuando me preguntan: '¿Por qué su rendimiento máximo... no es tan alto como el de este o aquel [sistema]?' Y yo respondo: 'Me da igual'

"El rendimiento máximo, señoras y señores, es como coger un coche, ponerlo en un avión, y luego despegar y tirar el coche por la ventana, y luego medir la velocidad del coche. Es una cifra ridícula, como ridículo es el rendimiento máximo, y los colegas aquí presentes lo saben, pero no todo el mundo en el mercado lo sabe. El rendimiento máximo no es relevante; la pregunta es '¿cuánto obtienes de este rendimiento?"

En consecuencia, el HLRS ha evitado los puntos de referencia tradicionales y, en su lugar, establece para los proveedores una prueba que consiste en ejecutar tres de los códigos de producción del centro.

"Esto es mucho más emocionante", bromea Resch.

Hunter HLRS logo
– Charlotte Trueman

Además del rendimiento sostenido, el coste es un factor importante. Como dice Resch, está muy bien que el Presidente de la Comisión Europea diga que se invertirán cientos de miles de millones de euros en un área determinada cuando, en última instancia, ellos no ponen el dinero ni pagan la factura final.

Explica que siempre hay un tira y afloja entre "fabricar o comprar" a la hora de sopesar estos costes.

"Cuando tienes tu propio superordenador, la inversión es enorme. Te gastas decenas de millones sólo para asegurarte de que el sistema funciona, y luego, al cabo de cinco años, te gastas otros 10 millones en comprar uno nuevo".

"Pero, por otro lado, la ventaja es que tienes un mayor nivel de flexibilidad, en el sentido de que tú decides qué pasa con él. [En HLRS compramos un sistema cada cinco años más o menos, pero si los usuarios quieren otro dentro de dos años, les decimos: 'Lo siento, no tenemos otro sistema. Tendrán que esperar otros tres años' Así que ese nivel de flexibilidad está ahí"

Sin embargo, cuando se trata de una cuestión de costes y beneficios, como HLRS es un centro nacional, sólo puede cobrar a sus usuarios lo que le cuesta al centro hacer funcionar el sistema - "ni más ni menos"-, ya que hacer algo distinto sería ilegal. HLRS tampoco puede subvencionar la computación a ningún usuario o institución en particular.

En consecuencia, HLRS es más barato que los proveedores de nube, sobre todo cuando se trata de ofrecer computación a cargas de trabajo no nativas de la nube que están muy acopladas o requieren duraciones más largas, ya que no tiene que tener en cuenta la recuperación de gastos o los márgenes de beneficio a la hora de fijar su estrategia de precios.

Además, mientras que los hiperescaladores comerciales deben ofrecer garantías de disponibilidad del 99,99% como parte de sus acuerdos de nivel de servicio, HLRS no tiene esa obligación, lo que significa que el centro sí tiene que gastar dinero en unidades UPS (sistema de alimentación ininterrumpida) o generadores.

"Puede que haya hospitales que utilicen [un proveedor de nube no especificado], por lo que no puede tener un corte de energía. por lo tanto, [el proveedor] debe tener un sistema de alimentación ininterrumpida, tener motores diésel y todo tipo de cosas para asegurarse de que es absolutamente seguro".

"Nosotros no hacemos eso, y no podemos permitírnoslo porque es dinero público que ningún gobierno acepta. Si dijera: 'Estamos al 99,8 por ciento, pero para el 0,2 por ciento extra, necesito 50 millones de euros (58 millones de dólares) adicionales para el suministro eléctrico, para el gasóleo', el centro diría 'no, no necesitamos eso' Eso es algo que nuestros clientes aceptan"

Por este motivo, Resch afirma que HLRS no aceptará solicitudes de instituciones como hospitales, bancos o compañías de seguros, ya que no pueden garantizar el nivel de tiempo de actividad que necesitan estos clientes.

El futuro de la HPC

Aunque Resch afirma que aún no se han tomado decisiones definitivas sobre el hardware de Herder, si el centro vuelve a elegir a AMD, el superordenador estará en una compañía muy apreciada.

En la edición más reciente de la lista Top500, alrededor del 34% de los superordenadores estaban equipados con AMD, que también es responsable de los dos primeros sistemas a exaescala de la lista, El Capitán y Frontier, que ocuparon el primer y segundo puesto, respectivamente.

La edición de junio de 2025 de Top500 también representa la séptima lista consecutiva en la que el superordenador más potente del mundo es de AMD.

Sin embargo, a pesar de su evasiva sobre Herder, durante la visita, Resch dejó caer la existencia de un chip AMD MI600 AI no anunciado previamente, lo que demuestra lo avanzada que está la planificación de las ofertas de hardware de AMD, y que la compañía ya está proporcionando a los clientes detalles técnicos de chips que están a varios años de la producción.

"En 2023, firmamos un contrato para el año 2027, y eso fue un riesgo por parte del proveedor y por nuestra parte"

Resch dice que, como parte de ese acuerdo, AMD y HLRS acordaron que se sentarían en el último trimestre de 2025 para discutir el camino a seguir, y que el fabricante de chips revelaría las especificaciones del chip que planea sacar al mercado en 2027.

"Cuatro años antes de la entrega, no recibimos especificaciones detalladas, así que ahora, tenemos que examinar estas especificaciones detalladas, hablar con HPE al respecto y averiguar si esto cambia algo con respecto al sistema global. Creo que estas negociaciones serán muy breves y agradables, pero ahora mismo no puedo decir por adelantado cuál es la mejor solución."

Peter Rutten, responsable de investigación global sobre soluciones informáticas de alto rendimiento en IDC, afirma que este es un ámbito en el que AMD ha estado "increíblemente bien": la ejecución de su hoja de ruta.

Y añade: "Con cada nueva etapa de entregas, AMD ha superado básicamente las expectativas de su procesador de nueva generación, por lo que el mercado ha llegado a esperar que lo que haga AMD sea siempre espectacular, y hasta ahora no han fallado en eso"

Rutten afirma que, aunque no es sorprendente que AMD haya seguido cosechando éxitos en el ámbito de la computación de alto rendimiento (HPC), se trata de un fenómeno relativamente nuevo para la empresa, ya que su penetración en el mercado no empezó hasta hace unos cinco o siete años.

Hay una serie de factores que han contribuido -y siguen contribuyendo- al dominio de AMD, uno de los cuales es el coste, atribuido a la capacidad de la compañía para ofrecer un alto rendimiento y eficiencia, lo cual es crucial para los centros de HPC con presupuestos limitados.

"En HPC, la regla es el mejor rendimiento de la forma más eficiente", afirma Rutten. "Piensa en un centro de HPC. Piensa en sus presupuestos. Piense en lo que intentan hacer. Intentan resolver problemas científicos muy complejos, pero a menudo cuentan con presupuestos limitados, normalmente gubernamentales o académicos. Entonces, ¿cómo conseguir el máximo rendimiento con el mínimo gasto? Esa es siempre la pregunta crítica para cualquier centro HPC, y AMD respondió a esa pregunta convincentemente mejor que su competencia"

Una de las formas en que AMD pudo lograrlo fue siendo la primera empresa en fabricar la tecnología de 7nm, que combinaron con un rediseño de sus procesadores de forma que tuvieran más rendimiento. Rutten afirma que, como resultado, la empresa fue capaz de convertirse en líder del mercado en el espacio HPC, en particular en lo que respecta a las cargas de trabajo de ingeniería intensiva y técnica, al tiempo que le permitió establecerse como actor cuando se trataba de IA.

Hunter supercomputer HLRS
– Charlotte Trueman

Esto no quiere decir que otras empresas no estén cosechando éxitos en el ámbito de la computación de alto rendimiento. El gigante de las GPU Nvidia, que se ha convertido en sinónimo de inteligencia artificial, cuenta actualmente con cuatro superordenadores entre los diez primeros de la lista Top500 y 70 sistemas que utilizan las GPU H100 de la compañía.

Rutten también señala que Intel, que ha atravesado un par de años turbulentos tanto desde el punto de vista financiero como del hardware, sigue siendo en gran medida la empresa dominante del mercado, ya que suministra el tercer sistema de exaescala Aurora y las CPU de la mayor parte, 294 sistemas o alrededor del 59%, del Top500, aunque esta cifra está disminuyendo.

En el caso de AMD, la cifra se sitúa en 173 sistemas, alrededor del 34%, lo que supone un modesto aumento con respecto al 32% de hace seis meses.

Además, un total de 237 sistemas de la lista utilizan tecnología de acelerador o coprocesador, frente a los 210 de hace seis meses, una arquitectura que, según Rutten, ha desempeñado un papel importante en el éxito de Nvidia, sobre todo a medida que se despliega un número creciente de superordenadores de IA.

El procesamiento de la IA se debe a la capacidad de la GPU para procesar cosas en paralelo, a diferencia de lo que ocurre con las cargas de trabajo de HPC, que a menudo sólo requieren un procesamiento en serie muy rápido, pero no necesariamente paralelo. Esto significaba que, tradicionalmente, los nodos de servidor no venían con un coprocesador de serie, algo que, según Rutten, ha cambiado ahora porque se ha demostrado que las cargas de trabajo de HPC realmente se benefician de esa paralelización que proporcionan las GPU.

"Un servidor con GPU también necesita un procesador, no se puede ejecutar una GPU sin un procesador", explica. "Intel estaba teniendo un mercado decente con servidores que funcionaban con CPU Intel y coprocesadores Nvidia, pero eso ha ido cambiando porque Nvidia ha visto que AMD también está desarrollando procesadores muy performantes, por eso en los últimos años, hemos visto más y más servidores con procesadores AMD también".

"Nvidia se ha centrado mucho en la IA, pero, por el camino, se dio cuenta de que la HPC también era una carga de trabajo muy atractiva para ellos", afirma Rutten. "Inicialmente, era una especie de idea de último momento, pero luego se convirtió en realidad en una adyacencia en la que centrarse, y lo han hecho, hasta el punto de que muchos superordenadores ahora están acelerados por GPU Nvidia"

Aunque Rutten argumenta que Nvidia no está haciendo nada totalmente revolucionario, sino más bien adoptando lo que es "esencialmente un nuevo enfoque de la HPC", afirma que la antigua forma, con sólo CPU y nodos de servidor estrechamente conectados, contaba con muchos profesionales muy capacitados para optimizar los entornos de HPC, uno de los trabajos más difíciles pero críticos en cualquier laboratorio de supercomputación.

"Hay gente que tiene un doctorado, pero ahora que las GPU forman parte de los superordenadores, esas habilidades han cambiado y la forma tradicional de pensar se está poniendo en entredicho. Ahora hay que tener en cuenta otras consideraciones para optimizar un superordenador y no sólo las que se tenían en cuenta con un superordenador no acelerado".

"No creo que hayamos llegado aún al punto en el que los conocimientos para optimizar un superordenador acelerado sean tan avanzados como los conocimientos para optimizar un superordenador clásico, aunque nos estamos acercando. Sin embargo, ha sido un pequeño reto para los centros de HPC entender qué podían hacer con las GPU y cómo hacerlo"

Este artículo apareció por primera vez en DCD>Magazine nº 58. Regístrese aquí para leer la revista completa de forma gratuita.