A aceleração da IA ultrapassou a Lei de Moore, superando os ganhos incrementais para oferecer aumentos exponenciais de potência, calor e densidade, tudo em uma área menor.
As densidades de rack agora excedem 140 quilowatts (kW) e processadores modernos de IA superam por muito 1000 watts (W) de potência de projeto térmico (TDP). Essas demandas estão forçando uma mudança no design da computação de alto desempenho (HPC) em que refrigeração líquida e a energia de média tensão deve compartilhar o mesmo rack.
Integrar líquido e energia no rack não é o desafio. Dimensionar a integração com segurança em muitos racks e sites é. À medida que a densidade da IA aumenta, os riscos aumentam. O mesmo acontece com as consequências do fracasso. A confiabilidade em escala depende de como as equipes gerenciam quatro áreas críticas: segurança de energia, qualidade de fluidos, prevenção de vazamentos e prontidão operacional.
Os racks HPC geralmente operam em níveis de média tensão, aumentando os riscos do arco elétrico durante a manutenção. Quanto mais racks você implantar, maiores serão as chances de erro. A operação segura depende de procedimentos rigorosos, equipe treinada e estreita coordenação entre TI e instalações.
Mais calor requer uma melhor gestão de fluidos
A qualidade do fluido em sistemas de resfriamento de alta densidade é uma responsabilidade contínua, não uma verificação única. Mesmo vestígios de contaminantes, como partículas ou crescimento microbiano, podem reduzir a transferência ou capacidade térmica de calor e danificar as placas frias ao longo do tempo. Bolhas de ar no circuito de resfriamento criam um efeito de espuma, interrompendo a circulação do líquido de resfriamento, reduzindo a eficiência e sobrecarregando as bombas.
Esses são problemas reais e caros que podem crescer silenciosamente e atingir com força sem um gerenciamento proativo. A confiabilidade dependerá da instalação e da precisão diária em todo o circuito de resfriamento.
Não estamos mais apenas adicionando refrigeração líquida perto dos racks. Nós estamos resfriando em de chips ativos. Um vazamento de orifício, um encaixe solto ou o menor erro de cálculo de expansão térmica podem levar a desligamentos completos do rack, perda de processamento e tempo de inatividade caro. Nessas densidades, pequenas falhas acarretam consequências descomunais.
Mais complexidade exige novas habilidades
As equipes de data center convencionais são altamente qualificadas, mas o surgimento da refrigeração líquida em data centers de HPC introduziu tarefas de manutenção que exigem experiência rara em implantações tradicionais de TI. Tarefas como gerenciamento de pressão, amostragem de fluido, detecção de vazamento e substituição de refrigerante exigem treinamento e processos especializados.
A curva de aprendizado é significativa: as equipes devem se adaptar a novos aplicativos em grande escala, mantendo a confiabilidade e o tempo de atividade. Preencher essa lacuna de prontidão é essencial para dimensionar com segurança o resfriamento líquido em ambientes ativos.
Comissionamento: A primeira linha de segurança
Cada implantação segura começa antes da energia ser ligada. Durante a construção, a equipe de manutenção de refrigeração líquida segue uma regra rígida: os sistemas mecânicos devem passar por uma avaliação completa antes de serem energizados.
O comissionamento leva os modelos de resfriamento de alta densidade ao limite sob condições controladas, revelando falhas antes que as cargas de trabalho reais as toquem. Os sistemas são executados em modos de falha, testados em conjunto e espera-se que exponham falhas porque esses são os momentos que nos dizem se o projeto pode ser reforçado e testado novamente.
Cada tubo é testado sob pressão, cada junta inspecionada e os circuitos de resfriamento lavados até que o fluido atenda às especificações exatas de pureza. Não é registrado e deixado quando algo falha. Está consertado e assinado. As equipes fazem ajustes em tempo real, reparam pontos fracos e testam novamente até que o sistema funcione conforme o esperado sob todo o estresse operacional.
As equipes de manutenção iniciam os testes elétricos somente após avaliar a integridade completa dos sistemas líquidos. Esse sequenciamento rigoroso, em que o comissionamento mecânico ocorre antes do elétrico, evita sobreposições catastróficas, como testar um sistema de 700 V enquanto um vazamento oculto escapa da detecção. Se os parceiros comissionarem energia e resfriamento em paralelo, a margem de erro tende a ser relativamente estreita.
Maturidade operacional: Do projeto à gestão do ciclo de vida
Assim que a energia e os sistemas de refrigeração líquida estiverem operacionais, a confiabilidade depende de mais do que a instalação; depende de quão bem os engenheiros internos do cliente (CE) projetaram sistemas de resfriamento de alta densidade para responder sob pressão.
Isso começa com salvaguardas integradas. Cada interface entre líquido e energia é projetada com proteção em camadas: zonas de separação, bandejas de vazamento monitoradas e protocolos de desligamento automatizados. Não são reflexões tardias. Eles definem como o sistema mitiga e elimina os riscos inerentes.
Os engenheiros se sentam com os clientes desde o início, mapeando planos de comissionamento, protocolos de falha e manutenção de longo prazo. Essa parceria não termina no go-live. Ele continua por meio de suporte diário: amostragem de fluidos, treinamento de operadores, revisões do sistema e ajuste de desempenho à medida que as demandas de computação evoluem.
A manutenção preventiva avançada permite uma manutenção direcionada, na qual as equipes se concentram em itens de alto impacto, além da lista de verificação de manutenção usual. Além disso, o monitoramento em tempo real detecta possíveis anomalias. Isso permite que equipes e engenheiros consultores intervenham imediatamente, evitando falhas e aumentando a confiabilidade.
Projete para segurança, opere com confiança
Existem riscos, desde a contaminação de fluidos e vazamentos até arcos elétricos. Mas essas não são razões para evitar a refrigeração líquida, em vez de abordá-la com rigor. Com o design correto, protocolos de comissionamento e disciplina operacional, a refrigeração líquida é segura e ideal para manter o desempenho e o tempo de atividade em escala.
Explore os serviços de refrigeração líquida da Vertiv hoje mesmo.
Mais sobre a Vertiv
-
Patrocinado Transforming data centers from cost centers to AI factory investments
AI is changing data centers, transforming them from cost centers to AI factories that deliver ROI, with new approaches to how they are designed, built, cooled, and operated
-
Patrocinado A seismic shift: Deploying AI-ready infrastructure in emerging markets
Vertiv’s Paul Churchill explores the key challenges of supporting high-density workloads while preparing for future growth in new data center hubs across Asia
-
Patrocinado The future is fluid
Evaluating liquid cooling approaches for AI data centers at Vertiv’s Cooling Innovation Day
Comments