Segundo o Gartner, os custos de inferência de Inteligência Artificial em fluxos de trabalho agênticos devem aumentar em mais de 5 vezes até 2028. A empresa de insights de negócios e tecnologia aponta que, à medida que os produtos de IA evoluem de simples assistentes para sistemas capazes de executar tarefas em várias etapas, os líderes de produto passam a enfrentar um novo desafio de margem: a queda nos preços dos modelos acaba subsidiando fluxos de trabalho mais complexos, o que eleva os custos totais e torna o gerenciamento da inferência uma prioridade estratégica.

Will Sommer, diretor analista sênior do Gartner, afirmou que os líderes de produto não podem mais contar com uma economia de tokens mais eficiente para justificar os gastos com IA, já que cada nova geração de recursos tende a exigir mais tokens e, com frequência, tokens mais caros. Segundo ele, não há previsão de um modelo único que seja simultaneamente confiável e econômico para todos os casos de uso, o que obrigaria as empresas a desenvolver e manter ecossistemas complexos com múltiplos modelos.

A consultoria identificou três tendências que explicam essa dinâmica: a melhora rápida na economia de custos dos modelos de base; o ganho de eficiência da IA, que vem permitindo o uso de modelos mais potentes e caros em aplicações mais sofisticadas; e a maior utilização de tokens em fluxos de trabalho complexos, muito superior à de interações simples com chatbots. Segundo o Gartner, isso mostra que os tokens estão ficando mais eficientes em termos de custo, mas em ritmo inferior ao crescimento dos recursos de IA e das despesas associadas a eles.

Esse cenário foi definido pela consultoria como o "Paradoxo da Inferência": uma situação em que a melhora na economia por unidade eleva o custo geral da IA sem garantir um caminho claro para geração de valor proporcional. Sommer exemplificou o paradoxo pela diferença entre um chatbot simples, que apenas interpreta uma consulta e responde rapidamente, e um agente de IA, que precisa raciocinar, negociar e se autoquestionar constantemente — o que, segundo ele, eleva os custos de inferência em pelo menos cinco vezes em relação a uma interação básica, podendo ser ainda maior à medida que a complexidade da tarefa aumenta.

De acordo com o Gartner, garantir o retorno sobre o investimento em IA avançada exigiria retornos exponencialmente maiores em relação aos modelos de base, ou então camadas de inferência, roteamento e orquestração altamente otimizadas para direcionar tarefas complexas a opções mais econômicas. Sommer ressaltou que adotar como padrão uma inteligência autônoma genérica resultaria em custos ilimitados, muito superiores aos de ecossistemas de produtos otimizados.