Quando você ouve o termo 'supercomputador', para quem não conhece, provavelmente evoca imagens de uma máquina semelhante ao computador Colossus usado pelos decifradores britânicos em Bletchley Park durante a Segunda Guerra Mundial.
E, embora alguns sistemas modernos sejam, sem dúvida, impressionantes em tamanho – os esforços de Elon Musk para desenvolver seu próprio cluster Colossus até agora o levaram a implantar mais de 200.000 GPUs no Tennessee – para a maioria dos sistemas, pelo menos visualmente, a realidade é muito mais decepcionante.
Apesar dos esforços da British Airways para nos manter imobilizados, a DCD viajou até o Centro de Computação de Alto Desempenho (HLRS) em Stuttgart, Alemanha, para visitar o Hunter, o primeiro de dois supercomputadores HPE encomendados pela Universidade de Stuttgart para levar o HLRS ao nível exascale.
Lançado em janeiro de 2025, o sistema baseado em HPE Cray EX4000, avaliado em €15 milhões (93,3 milhões de reais), compreende 512 processadores AMD Eypc 'Genoa', com as CPUs agrupadas em 256 nodos, cada um equipado com 768GB de memória DDR5-4800. No entanto, ao contrário de outros sistemas HPC alojados no HLRS, o Hunter também é alimentado por GPUs: 752 unidades de processamento aceleradas AMD Instinct MI300A (APUs) distribuídas por 188 nodos resfriados a líquido.
Lançado oficialmente em dezembro de 2023, o Instinct MI300A da AMD combina 24 núcleos de CPU baseados em Zen4 com acelerador de GPU e 128 GB de memória de alta largura de banda (HBM3) no mesmo silício. Essa arquitetura permite que tanto a CPU quanto a GPU acessem a mesma memória, o que, segundo a AMD, economiza trilhões de cálculos ao passarem pela memória unificada e acelera o desempenho das cargas de trabalho HPC.
Cada APU possui 24 núcleos Zen 4 e oferece 128 GB de HBM3. A AMD também utilizou um design de empilhamento 3D no chip, permitindo integrar vários chips menores de silício para formar um processador maior.
O Hunter tem um desempenho teórico máximo de 48,1 petaflops (mais sobre isso depois), e cada um de seus nós está equipado com quatro interconexões de alto desempenho HPE Slingshot. Ele ficou em 54º lugar na edição mais recente da lista Top500 e em 12º lugar no Green500, oferecendo o dobro da velocidade enquanto consome 80% menos energia do que seu antecessor, o Hawk.
Quando se trata da arquitetura de Hunter, Utz-Uwe Haus, chefe do laboratório de pesquisa HPC/AI EMEA, na HPE, descreve o design do Cray EX como "a arquitetura que a HPE, com sua grande herança, constrói para os sistemas de ponta."
Um único gabinete em um sistema EX4000 pode armazenar até 64 blades de computação – servidores modulares de alta densidade que compartilham energia, resfriamento e recursos de rede – em oito chassis de computação, todos resfriados por placas frias líquidas diretamente conectadas e suportadas por uma unidade de distribuição de resfriamento (CDU).
"É super integrado", ele diz. "A parte traseira, que é toda a infraestrutura de rede (HPE Slingshot), corresponde à parte frontal, que contém as lâminas."
Para o Hunter, o HLRS selecionou hardware AMD, mas Haus explica que, com sistemas Cray EX, os clientes podem, mais ou menos, selecionar a unidade de processamento de seu desejo do fornecedor que quiserem, e a infraestrutura de computação pode ser integrada ao sistema sem a necessidade de reconfiguração total.
"Se a HLRS decidir, em algum momento, trocar as placas AMD [do Hunter] pela próxima geração ou usar as de outro concorrente, o restante do sistema permanecerá o mesmo. Eles também poderiam ter decidido não usar nossa rede – manter as placas e colocar uma rede diferente, se tivermos isso no formato. [Arquitetura HPE Cray EX] é muito bem alinhada, mas ao mesmo tempo, é flexível", diz ele.
O próprio Hunter foi concebido como um sistema de transição para o supercomputador exascale Herder, que deve entrar em operação em 2027. Um novo data center está em construção no HLRS, antes da implantação planejada pela Herder, pois não é possível reforçar o piso do data hall onde o Hunter está hospedado para que os dois sistemas fiquem lado a lado.
Apesar de tudo isso, o sistema colorido e bastante poderoso parece um pouco perdido sentado no canto de um data hall, cercado por todo o espaço vazio que Hawk costumava ocupar, e pelo cluster Vulcan NEC do centro – um "cluster padrão de PC" disponível para a Universidade de Stuttgart para cargas de trabalho de pesquisa, visualização, IA e big data.
Simplesmente o melhor
O HLRS foi estabelecido em 1996 como o primeiro centro nacional de computação de alto desempenho (HPC) da Alemanha, oferecendo a usuários de toda a ciência, indústria e setor público acesso a recursos de supercomputação para "projetos de simulação computacionalmente intensivos."
É um dos três centros nacionais de computação na Alemanha, sendo os outros o Centro de Supercomputação Leibniz (LRZ) em Garching, próximo a Munique, e o Centro de Supercomputação Jülich (JSC) em Jülich, Renânia do Norte-Vestfália. Existem também vários centros menores de supercomputação no país, supervisionados pela Gauss Alliance, uma associação sem fins lucrativos para a promoção da ciência e pesquisa, e da qual o Prof. Dr. Michael M. Resch, diretor do HLRS, é membro do conselho.
Levar um supercomputador como o Hunter do conceito à realidade é um processo que exige tanto planejamento quanto paciência, além de expertise, um modelo de negócios de longo prazo e uma estrutura de investimentos que inclui todo um ecossistema de hardware, software e infraestrutura para acompanhá-lo.
Resch diz que o HLRS vem implantando sistemas com hardware AMD desde 2002, mas, toda vez que o centro começa a discutir a construção de seu próximo sistema, adota-se uma abordagem agnóstica ao fornecedor – quando perguntado se o Herder também será composto por hardware AMD, Resch diz que nenhuma decisão foi tomada e que as negociações continuarão até o final de 2025.
"Somos um centro nacional de supercomputação e precisamos comprar um novo sistema de vez em quando", diz ele, acrescentando que, quando isso acontece, o centro passa por um rigoroso processo de compras que envolve muitas discussões longas com fornecedores.
"Fomos atrás da melhor solução. Me perguntaram… se ser europeu era importante, e a resposta é não. Queremos ter o melhor sistema possível, e não nos importamos [de onde ele vem] – somos muito agnósticos quando se trata de nomes de empresas ou nacionalidade. Temos cerca de 800 usuários por aí, e eles precisam das melhores soluções."
Resch afirma que, no mundo do HPC, a melhor solução é aquela que oferece desempenho sustentado.
"De vez em quando, me perguntam 'Por que seu desempenho no auge... não tão alto quanto este ou aquele [sistema]?' E eu digo: 'Não me importo.'
"O desempenho máximo, senhoras e senhores, é como pegar um carro, colocá-lo em um avião, decolar e jogá-lo pela janela, e então medir a velocidade do carro. Esse é um número ridículo, assim como o desempenho máximo é ridículo, e os colegas aqui sabem disso, mas nem todo mundo no mercado sabe. O desempenho máximo não é relevante; a questão é: 'Quanto você aproveita dessa apresentação?'
Consequentemente, o HLRS deixou de lado os benchmarks tradicionais e, em vez disso, estabeleceu aos fornecedores um teste que consiste em executar três dos códigos de produção do centro.
"Isso é muito mais empolgante", brinca Resch.
Além do desempenho sustentado, o custo também é um fator importante. Como diz Resch, é muito bom para o Presidente da Comissão Europeia dizer que haverá centenas de bilhões de euros em investimentos em determinada área, quando, no fim das contas, eles não estão investindo o dinheiro ou pagando a conta final.
Ele explica que sempre há um vai-e-vem entre "faça ou compre" quando se trata de pesar esses custos.
"Quando você tem seu próprio supercomputador, há um grande investimento. Você gasta dezenas de milhões só para garantir que o sistema funcione, e depois de cinco anos, gasta mais 10 milhões para comprar um novo.
"Mas, por outro lado, a vantagem é que você tem um nível maior de flexibilidade, no sentido de que é sua própria decisão o que acontece com isso. [No HLRS], compramos um sistema a cada cinco anos, mais ou menos, [mas, se os usuários] quiserem ter outro sistema em dois anos, dizemos: 'Desculpe, não temos outro sistema. Você vai ter que esperar mais três anos.' Então, esse nível de flexibilidade está lá."
No entanto, quando se trata de custo e lucro, como o HLRS é um centro nacional, ele só pode cobrar aos seus usuários o que custa para o centro operar o sistema – "nem mais, nem menos" – pois fazer algo diferente seria ilegal. O HLRS também não pode fornecer computação subsidiada a qualquer usuário ou instituição específica.
Consequentemente, o HLRS é mais barato do que os fornecedores de nuvem, especialmente quando se trata de oferecer computação para cargas de trabalho nativas ou não nativas da nuvem, fortemente acopladas ou que exigem durações mais longas, pois não precisa levar em conta a recuperação de despesas ou as margens de lucro ao definir sua estratégia de precificação.
Além disso, enquanto os hiperescalas comerciais devem fornecer garantias de disponibilidade de 99,99% como parte de seus acordos de nível de serviço, o HLRS não tem essa obrigação, o que significa que o centro precisa gastar dinheiro em unidades UPS (fornecedores de energia ininterrupta) ou em geradores.
"Talvez existam hospitais usando [um fornecedor de nuvem não especificado], então não pode haver queda de energia. [O fornecedor] deve, portanto, ter uma fonte de alimentação ininterrupta, motores a diesel e todo tipo de equipamento para garantir que seja absolutamente seguro.
"Nós não fazemos isso, e não podemos nos dar ao luxo de fazer porque é dinheiro público que nenhum governo aceita. Se eu dissesse: 'Estamos em 99,8%, mas para os 0,2% restantes, preciso de mais 50 milhões de euros (311 milhões de euros) para o fornecimento de energia e de diesel', o centro diria: 'não, não precisamos disso.' Isso é algo que nossos clientes aceitam."
Por esse motivo, Resch afirma que o HLRS não aceitará solicitações de instituições como hospitais, bancos ou seguradoras, pois não podem garantir o nível de disponibilidade necessário a esses clientes.
O futuro do HPC
Embora Resch tenha dito que ainda não havia decisões finais sobre o provável hardware de Herder, se o centro selecionasse novamente a AMD, o supercomputador estaria em companhia de altamente estimada.
Na edição mais recente da lista Top500, cerca de 34% dos supercomputadores eram operados por AMD, com a empresa de chips também responsável por alimentar os dois principais sistemas exascale da lista, El Capitan e Frontier, que ocuparam o primeiro e o segundo lugares, respectivamente.
A edição de junho de 2025 do Top500 também representa a sétima lista consecutiva em que o supercomputador mais poderoso do mundo foi alimentado pela AMD.
No entanto, apesar de sua evasividade em relação a Herder, durante a visita, Resch deixou escapar a existência de um chip de IA AMD MI600 ainda não anunciado, demonstrando o quão avançado é o planejamento para as ofertas de hardware da AMD, e que a empresa já está fornecendo aos clientes detalhes técnicos de chips que ainda estão a vários anos de produção futura.
"Em 2023, assinamos um contrato para 2027, e isso representou um risco tanto do lado do fornecedor quanto do nosso."
Resch afirma que, como parte desse acordo, AMD e HLRS concordaram em se reunir no último trimestre de 2025 para discutir o caminho daqui para frente, e que o fabricante do chip divulgue as especificações do chip que planeja lançar no mercado em 2027.
"Quatro anos antes da entrega, não recebemos especificações detalhadas; agora precisamos analisá-las, conversar com a HPE sobre isso e verificar se isso muda algo em relação ao sistema como um todo. Acredito que essas negociações serão muito curtas e muito boas, mas, por enquanto, não posso antecipar qual é a melhor solução."
Peter Rutten, líder global de pesquisa em soluções de computação intensivas em desempenho no IDC, diz que essa é uma área em que a AMD tem sido "incrivelmente boa" – na execução de seu roteiro.
Ele acrescenta: "A cada nova etapa de entregável, a AMD basicamente superou as expectativas de seu processador de nova geração, e o mercado passou a esperar que o que a AMD faça sempre será espetacular, e até agora eles não falharam nisso."
Rutten diz que, embora não seja surpresa que a AMD continue tendo sucesso no segmento HPC, ainda é um fenômeno relativamente novo para a empresa, com sua tração no mercado iniciada há cerca de cinco a sete anos.
Há vários fatores que contribuíram – e continuam – para a dominância da AMD, um deles é o custo, atribuído à capacidade da empresa de oferecer alto desempenho e eficiência, o que é crucial para centros de HPC com orçamentos limitados.
"Com HPC, a regra é o melhor desempenho da forma mais eficiente", diz Rutten. "Pense em um centro HPC. Pense nos orçamentos deles. Pense no que eles estão tentando fazer. Eles tentam resolver problemas científicos muito difíceis, mas, muitas vezes, têm orçamentos limitados, geralmente governamentais ou acadêmicos. Então, como obter o máximo desempenho com o menor custo possível? Essa é sempre a questão crítica para qualquer site HPC, e a AMD respondeu a essa pergunta de forma mais convincente do que a concorrência."
Uma das formas como a AMD conseguiu isso foi ser a primeira empresa a fabricar tecnologia de 7 nm, que se combinou com um redesenho de seus processadores, tornando-os mais performantes. Rutten afirma que, como resultado, a empresa conseguiu se tornar líder de mercado no segmento de HPC, especialmente no que diz respeito a cargas de trabalho intensivas e técnicas de engenharia, além de permitir que se consolidasse como um ator no setor de IA.
Isso não quer dizer que outras empresas não estejam tendo sucesso no setor de HPC. A gigante de GPUs Nvidia, uma empresa que se tornou sinônimo de IA, atualmente alimenta quatro supercomputadores no top dez do Top 500, com 70 sistemas listados implantando as GPUs H100 da empresa.
Rutten também observa que a Intel, que teve alguns anos turbulentos tanto do ponto de vista financeiro quanto de hardware, ainda é muito o incumbente do mercado, alimentando o terceiro colocado sistema exascale Aurora e fornecendo CPUs para a maior fatia, 294 sistemas ou cerca de 59%, do Top500, embora esse número esteja caindo.
Para a AMD, esse número é de 173 sistemas, o que corresponde a cerca de 34%, um aumento modesto em relação aos 32% de seis meses atrás.
Além disso, um total de 237 sistemas da lista utilizam tecnologia de aceleradores ou coprocessadores, um aumento em relação aos 210 de seis meses atrás, uma arquitetura que Rutten afirma ter desempenhado um papel significativo no sucesso da Nvidia, especialmente à medida que um número crescente de supercomputadores de IA é implantado.
O processamento de IA vem da capacidade da GPU de executar tarefas em paralelo, ao contrário das cargas de trabalho HPC, que geralmente exigem processamento serial muito rápido, mas não necessariamente paralelo. Isso significava que, tradicionalmente, os nós de servidor não vinham com coprocessador como padrão, algo que Rutten diz ter mudado, pois foi demonstrado que as cargas de trabalho HPC realmente se beneficiam da paralelização que as GPUs proporcionam.
"Um servidor com GPU também precisa de um processador, você não pode rodar uma GPU sem um processador presente", ele explica. "A Intel estava tendo um mercado razoável com servidores que rodavam em CPUs Intel e coprocessadores Nvidia, mas isso tem mudado porque a Nvidia percebeu que a AMD também está desenvolvendo processadores de alto desempenho; por isso, nos últimos anos, temos visto cada vez mais servidores com processadores AMD.
"A Nvidia tem sido muito focada em IA, mas, ao longo do caminho, percebeu que o HPC também era uma carga de trabalho muito atraente para eles", diz Rutten. "Inicialmente, isso era meio que um pensamento tardio, mas depois virou uma adjacência para eles focarem, e eles – a ponto de muitos supercomputadores agora serem acelerados por GPUs da Nvidia."
Embora Rutten argumente que a Nvidia não está fazendo nada totalmente revolucionário, apenas adotando o que é "essencialmente uma abordagem mais nova para HPC", ele diz que o método antigo, com apenas CPUs e nós de servidor conectados de forma muito próxima, tinha muitos profissionais muito habilidosos em otimizar ambientes HPC, um dos trabalhos mais difíceis, porém críticos, em qualquer laboratório de supercomputação.
"Existem pessoas que têm doutorado, mas, com essas GPUs agora integradas a supercomputadores, esse conjunto de habilidades mudou, e essa forma tradicional de pensar está sendo desafiada. Agora há diferentes considerações sobre como otimizar um supercomputador, em vez de apenas o que envolvia um supercomputador não acelerado.
"Acho que ainda não chegamos totalmente ao ponto em que as habilidades para otimizar um supercomputador acelerado sejam tão avançadas quanto as para otimizar um supercomputador clássico, embora estejamos chegando lá. Mas tem sido um pouco desafiador para os sites HPC entenderem o que poderiam fazer com GPUs e como fazer isso."
Esse artigo foi publicado originalmente na DCD>Magazine #58. Cadastre-se aqui para ler a revista completa gratuitamente.
Comments