Amazon Web Services (AWS) ha desarrollado su propia solución de refrigeración para la última generación de GPU Nvidia.
Ahora que el gigante de la nube ha implementado las GPU Blackwell de Nvidia y, a principios de este mes, ha puesto a disposición instancias UltraServer basadas en el sistema Nvidia GB200 NVL72, se ha hecho necesario pasar a la refrigeración líquida.
David Brown habla sobre las mejoras de refrigeración en AWS para los GB200
En un video publicado en YouTube, el vicepresidente de computación y aprendizaje automático de AWS, David Brown, ha dicho que "para soportar la increíble densidad de computación con los racks GB200 NVL72, hemos avanzado hacia una nueva primicia en AWS: refrigeración líquida.
"Blackwell representa la primera plataforma de hardware de refrigeración líquida que hemos implementado a gran escala en AWS".
Brown ha dicho también que si bien se han analizado soluciones de refrigeración líquida actualmente disponibles de proveedores externos, habrían requerido que AWS construyera centros de datos refrigerados por líquido desde cero, lo que tendría largos plazos de entrega "del orden de años".
La segunda opción habría sido adoptar soluciones estándar, ocuparían demasiado espacio en el centro de datos, requerirían modificaciones importantes en los centros de datos o aumentarían considerablemente el consumo de agua.
En cambio, AWS desarrolló su propio "Intercambiador de calor en fila" (IRHX) que se puede instalar sin ajustar el diseño mecánico refrigerado por aire y con "cambios mínimos" en la infraestructura existente.
Según Brown, esto significa que se puede integrar en sus centros de datos existentes.
El IRHX cuenta con un armario de distribución de agua, una unidad de bombeo y fan coils. El líquido refrigerante se impulsa desde la unidad de bombeo hasta los servidores y se distribuye a través de los chips mediante una placa fría diseñada por AWS y Nvidia. El líquido caliente regresa al IRHX a través de los coils y es enfriado por ventiladores, mientras que el calor se expulsa por la parte trasera.
El IRHX es escalable y se le pueden agregar o quitar unidades de bobina según sea necesario.
Una entrada de blog compartida por AWS indica que el equipo de refrigeración del centro de datos de la empresa tardó cuatro meses en pasar del diseño de una pizarra a un prototipo y, posteriormente, 11 meses en entregar la primera unidad. "Eso incluyó tiempo para desarrollar diseños, construir una cadena de suministro, desarrollar software de control, probar todo y fabricar los sistemas".
Tras la revelación de que AWS estaba usando su propia solución de refrigeración, las acciones de Vertiv (un proveedor de soluciones de energía y refrigeración para la industria de centros de datos) cayeron un 11 por ciento el jueves 10 de julio.
Mustafa Okur, analista de Bloomberg Intelligence, ha señalado el posible impacto en Vertiv: «La implementación por parte de Amazon Web Services de su propio sistema de refrigeración líquida para servidores podría afectar negativamente las perspectivas de crecimiento futuro de Vertiv. Calculamos que alrededor del 10 % de las ventas totales provienen de la refrigeración líquida, y AWS podría ser uno de los clientes más importantes».
AWS tiene una amplia experiencia en el desarrollo de su propio hardware y equipos. La empresa cuenta con sus propios chips: Graviton, Trainium e Inferentia, y el año pasado lanzó una serie de componentes para centros de datos que les permiten gestionar la próxima generación de cargas de trabajo de IA.
Comments