A NVIDIA anunciou que o processador de dados NVIDIA BlueField‑4, integrante da plataforma NVIDIA BlueField, passa a operar a NVIDIA Inference Context Memory Storage, uma nova categoria de infraestrutura de armazenamento nativa para aplicações de inteligência artificial.

Com a expansão dos modelos de IA para trilhões de parâmetros e processos de raciocínio em múltiplas etapas, cresce também o volume de dados contextuais gerados — organizados em caches de chave-valor (KV) — fundamentais para manter precisão, qualidade da experiência e continuidade operacional. Esses caches não podem permanecer armazenados em GPUs por longos períodos, sob risco de causar gargalos na inferência em tempo real em sistemas multiagentes, o que demanda uma infraestrutura específica, escalável, para esse tipo de dados.

Segundo a empresa, a plataforma NVIDIA Inference Context Memory Storage amplia a capacidade de memória disponível para GPUs, possibilita compartilhamento de dados em alta velocidade entre diferentes nós, aumenta a taxa de tokens processados por segundo em até cinco vezes e oferece eficiência energética até cinco vezes superior à de soluções tradicionais de armazenamento.

Jensen Huang, fundador e CEO da NVIDIA, afirma que a inteligência artificial está transformando toda a pilha de computação, incluindo o armazenamento de dados. Segundo ele, a IA deixou de ser limitada a chatbots de respostas pontuais e passou a atuar como um sistema capaz de compreender o mundo físico, raciocinar em horizontes mais longos, manter consistência factual, utilizar ferramentas para executar tarefas e reter memórias de curto e longo prazo. Huang acrescenta que, com o BlueField‑4, a NVIDIA e seus parceiros de software e hardware estão redesenhando a infraestrutura de armazenamento para atender às novas demandas da próxima geração de IA.

A plataforma NVIDIA Inference Context Memory Storage amplia a capacidade de cache de chave-valor (KV) e acelera o compartilhamento de contexto entre clusters de sistemas de IA em escala de rack. O recurso de contexto persistente para agentes com múltiplas interações também melhora a capacidade de resposta, aumenta a produtividade dos pipelines de IA e favorece o escalonamento da inferência multiagente de longo contexto.

Entre as principais características da plataforma baseada no NVIDIA BlueField‑4 estão:

  • Capacidade de cache KV em nível de cluster do NVIDIA Rubin, oferecendo escalabilidade e eficiência para inferência de múltiplas etapas e de longo contexto.
  • Eficiência energética até cinco vezes superior à de soluções tradicionais de armazenamento.
  • Compartilhamento acelerado de cache KV entre nós de IA, habilitado pela estrutura NVIDIA DOCA e integrado às bibliotecas NVIDIA NIXL e ao software NVIDIA Dynamo, com o objetivo de aumentar a taxa de tokens por segundo e reduzir o tempo até o primeiro token.
  • Posicionamento de cache KV acelerado por hardware, gerenciado pelo BlueField-4, reduzindo a sobrecarga de metadados e de movimentação de dados e garantindo acesso seguro e isolado aos nós de GPU.
  • Compartilhamento e recuperação de dados otimizados pela rede NVIDIA Spectrum-X Ethernet, que fornece infraestrutura de alto desempenho para acesso ao cache KV nativo de IA baseado em RDMA.

À medida que os modelos de inteligência artificial avançam para contextos mais extensos e processos de inferência contínua, o armazenamento passa a desempenhar um papel estratégico, deixando de ser um ponto de limitação para se tornar um elemento que impulsiona a inovação. Segundo Marcio Aguiar, diretor da divisão Enterprise da NVIDIA para a América Latina, o NVIDIA BlueField-4 foi desenvolvido especificamente para atender a esse novo cenário, oferecendo a capacidade de lidar com volumes crescentes de dados contextuais e de suportar aplicações de IA cada vez mais complexas.