O supercomputador Aurora do Argonne National Laboratory está agora totalmente equipado com todos os 10.624 blades de computação, com 63.744 processadores Intel Data Center GPU Max Series e 21.248 processadores Intel Xeon CPU Max Series.
"Aurora é a primeira implantação da Intel GPU Max Series, o maior sistema baseado em CPU Xeon Max e o maior cluster de GPU do mundo. Estamos orgulhosos de fazer parte desse sistema histórico e empolgados com a IA, a ciência e a engenharia revolucionárias que o Aurora possibilitará", disse Jeff McVeigh, vice-presidente corporativo da Intel e gerente geral do Super Compute Group.
O que é o Aurora: O supercomputador Aurora, uma colaboração entre a Intel, a Hewlett Packard Enterprise (HPE) e o Departamento de Energia (DOE), foi projetado para liberar o poder dos três pilares da computação de alto desempenho (HPC): simulação, análise de dados e inteligência artificial em uma escala extremamente grande. O sistema incorpora mais de 1.024 nós de armazenamento (usando DAOS, o armazenamento de objetos assíncrono distribuído da Intel), fornecendo 220 terabytes de capacidade com 31 TBs de largura de banda total e aproveitando a malha de alto desempenho HPE Slingshot. Até o final deste ano, espera-se que o Aurora seja o primeiro supercomputador do mundo a atingir um desempenho de pico teórico de mais de 2 exaflops (um exaflop é 1018 ou um bilhão de operações por segundo) quando entrar na lista TOP500.
O Aurora aproveitará todo o poder da família de GPUs e CPUs da série Intel Max. Projetada para atender às demandas de cargas de trabalho dinâmicas e emergentes de HPC e IA, os primeiros resultados com as GPUs da série Max demonstram desempenho líder em cargas de trabalho de ciência e engenharia do mundo real, mostrando até 2x o desempenho das GPUs AMD MI250X no OpenMC e escalonamento quase linear até centenas de nós. Enquanto isso, a CPU Intel Xeon da série Max gera uma vantagem de 40% no desempenho em relação à concorrência em muitas cargas de trabalho de HPC do mundo real, como modelagem de sistemas terrestres, energia e fabricação.
Por que é importante? Os pesquisadores enfrentam desafios monumentais que exigem tecnologias de computação avançadas em escala, desde o combate às mudanças climáticas até a descoberta de curas para doenças mortais. O Aurora está preparado para atender às necessidades das comunidades de HPC e IA, fornecendo as ferramentas necessárias para ampliar os limites da exploração científica.
"Enquanto trabalhamos nos testes de aceitação, usaremos o Aurora para treinar alguns modelos de IA generativa de código aberto em grande escala para a ciência. O Aurora, com mais de 60.000 GPUs Intel Max, um sistema de E/S muito rápido e um sistema de armazenamento em massa totalmente em estado sólido, apresenta o ambiente perfeito para treinar esses modelos", disse Rick Stevens, diretor associado do laboratório do Argonne National Laboratory.
Como funciona: No centro desse sistema de última geração estão os elegantes blades retangulares do Aurora, que abrigam processadores, memória, rede e tecnologias de resfriamento. Cada blade consiste em duas CPUs Intel Xeon Max Series e seis GPUs Intel Max Series. A família de produtos Xeon Max Series já está demonstrando um bom desempenho no Sunspot, o sistema de teste e desenvolvimento com a mesma arquitetura do Aurora.
Os desenvolvedores estão usando as ferramentas oneAPI e AI para acelerar as cargas de trabalho de HPC e AI e melhorar a portabilidade do código em várias arquiteturas.
A instalação dessas lâminas tem sido uma operação delicada, pois cada lâmina de 70 libras exigiu maquinário especializado para ser integrada verticalmente aos racks do tamanho de uma geladeira do Aurora. Os 166 racks do sistema abrigam 64 lâminas cada e se estendem por oito fileiras, ocupando um espaço equivalente ao de duas quadras de basquete profissional no data center da ALCF.
Os pesquisadores do Aurora Early Science Program (ESP) do ALCF e do projeto Exascale Computing do DOE migrarão seu trabalho do banco de testes Sunspot para o Aurora totalmente instalado. Essa transição permitirá que eles dimensionem os seus aplicativos no sistema completo. Os primeiros usuários testarão o supercomputador e identificarão possíveis bugs que precisam ser resolvidos antes da implementação. Isso inclui esforços para desenvolver modelos de IA generativa para a ciência, anunciados recentemente na conferência ISC'23.
Comments