A Red Hat anunciou o lançamento do llm-d, uma nova iniciativa de código aberto para inferência de IA generativa em larga escala. A plataforma nasceu com o objetivo de fazer com que a IA generativa em produção atinja a mesma ubiquidade que o Linux alcançou no campo da infraestrutura tecnológica.

Criado em colaboração com a CoreWeave, Google Cloud, IBM Research e NVIDIA, o projeto também é apoiado pelos principais players do setor, como a AMD, Cisco, Hugging Face, Intel, Lambda e Mistral AI, bem como suporte acadêmico da Universidade da Califórnia, Berkeley e da Universidade de Chicago.

Assim, a empresa pretende responder à inferência eficiente e escalável: o processo de aplicação de um modelo treinado para gerar resultados úteis. De acordo com o Gartner, até 2028 mais de 80% dos aceleradores de data center serão dedicados a tarefas de inferência, não treinamento, destacando a urgência de soluções como o llm-d.

O código aproveita o poder de orquestração do Kubernetes, juntamente com tecnologias avançadas, como o vLLM - já considerado o servidor de inferência padrão no escopo de código aberto - e o LMCache para gerenciar caches de memória com mais eficiência e economia.

A Red Hat destaca que entre os principais recursos do código estão a separação das fases de pré-preenchimento e decodificação para melhor restrição de tarefas. Outro recurso é o descarregamento do cache KV para o armazenamento padrão para liberar memória da GPU. Os clusters inteligentes do llm-d ajustam os recursos de acordo com a carga de trabalho. Além disso, roteamento de rede com reconhecimento de IA, que otimiza solicitações para servidores com caches pré-aquecidos, e APIs de alto desempenho para acelerar a transferência de dados, incluindo suporte para a biblioteca NIXL da NVIDIA.

A Red Hat disse que, com o llm-d, eles esperam tornar o vLLM e sua arquitetura distribuída o novo padrão aberto para inferência de IA na nuvem híbrida, assim como o Linux foi para sistemas operacionais corporativos.

Para Brian Stevens, vice-presidente sênior e CTO da Red Hat, "o llm-d representa um marco importante para viabilizar a adoção corporativa da IA generativa".