A NetApp anunciou o NetApp Novus, nova arquitetura de armazenamento destinada a provedores de infraestrutura de inteligência artificial (IA) que operam grandes ambientes de GPUs. Segundo a empresa, a solução foi desenvolvida para suportar sistemas de arquivos em escala de zettabytes e manter milhões de GPUs continuamente abastecidas com dados.

A proposta mira neoclouds e provedores de GPU como serviço (GPUaaS), que vêm construindo fábricas de IA em uma escala para a qual as arquiteturas tradicionais de armazenamento não foram concebidas. De acordo com a NetApp, nesses ambientes a utilização das GPUs pode cair para menos de 30% quando o sistema não consegue entregar dados no ritmo necessário, o que compromete o retorno sobre o investimento.

Para Syam Nair, Chief Product Officer da NetApp, a economia das GPUs se deteriora quando os dados não acompanham o processamento. O executivo avalia que o armazenamento herdado da computação de alto desempenho (HPC) não atende, por si só, às exigências de uma fábrica de IA e que o setor precisa de uma arquitetura projetada para esse fim desde a origem. Segundo ele, o Novus entrega 100 TB/s de desempenho com escalabilidade horizontal ilimitada.

A principal característica técnica do Novus é a separação entre os metadados e o caminho de dados. Com isso, desempenho, capacidade e concorrência passam a escalar de forma independente em um único namespace, acessado por NFS padrão de mercado.

As primeiras versões combinam o NetApp Novus Data Director, software de gerenciamento de metadados executado em servidores Supermicro qualificados, com os serviços de dados do NetApp ONTAP, entregues por meio dos sistemas AFF A90. A arquitetura desagregada foi projetada para superar 100 TB/s de vazão e sustentar centenas de milhares de GPUs, preservando os serviços de dados corporativos do ONTAP.

Segundo a fabricante, a solução atende a ambientes multilocatários em escala de nuvem e permite que operadores dimensionem apenas os recursos exigidos por cada carga de trabalho, com potencial de reduzir o consumo de energia, o espaço físico e os custos. O Novus já está disponível para pedidos, e a empresa prevê, ao longo do tempo, implantações de software definidas com o mesmo namespace e o mesmo modelo operacional.

Mike Leone, vice-presidente e analista principal da Moor Insights & Strategy, observou que a economia dos provedores de infraestrutura de IA depende cada vez mais de manter a computação plenamente utilizada, e que arquiteturas incapazes de entregar dados em escala de nuvem podem limitar o desempenho de treinamento, o isolamento entre locatários e o retorno do investimento.

Tony Palmer, analista-chefe da Omdia, informou que, em testes auditados pela consultoria, o Novus apresentou escalabilidade de desempenho quase linear à medida que clusters ONTAP eram adicionados a um namespace global. Com base nesses testes, a modelagem da Omdia projeta que a arquitetura pode atingir 100 TB/s de vazão de leitura sequencial e oferecer dezenas de exabytes de capacidade efetiva.

Jeremy Foster, vice-presidente sênior e gerente-geral da Cisco Compute, destacou a parceria de longa data entre as empresas e avaliou que, com a IA elevando a escala da infraestrutura, o diferencial passa a estar menos nas GPUs e mais nos dados e na forma como os clientes os utilizam.