As empresas estão investindo em IA mais do que nunca. No entanto, um padrão preocupante surgiu: até 60% dos resultados das consultas estão incorretos. Em setores onde a precisão é de extrema importância, como finanças e saúde, isso cria riscos significativos tanto na confiança do consumidor quanto no retorno sobre o investimento.

As empresas não podem se dar ao luxo de depender mais vezes da tecnologia errada do que da certa. Para resolver isso, porém, eles não deveriam focar apenas em seu poder de processamento ou em um modelo de dados maciços. Em vez disso, eles devem priorizar a escolha do modelo de IA adequado que atenda às suas necessidades.

Embora grandes modelos de linguagem (LLMs) se destaquem em aplicações amplas e de uso geral, frequentemente têm dificuldades em contextos específicos de domínio, o que é crucial para trabalhos especializados. Modelos de linguagem pequenos podem oferecer soluções mais precisas, sem custos adicionais ou risco de conformidade com os grandes modelos públicos de IA.

Small Language Model
– Getty Images

Dimensionamento correto da IA para uma implementação no mundo real

Até 2027, o Gartner prevê que as empresas terão três vezes mais probabilidade de usar modelos de IA pequenos e específicos para tarefas do que modelos de uso geral. Além disso, espera-se que o mercado de adoção de pequenos modelos de linguagem (SLM) cresça exponencialmente, de 900 milhões de dólares (4,9 bilhões de reais) em 2025 para 5,4 bilhões de dólares (29,3 bilhões de reais) até 2032 — um aumento de quase seis vezes.

A mudança nas preferências de modelos é reveladora: precisão vence escala, o que traz muitos benefícios. Os SLMs exigem menos dados e poder computacional, tornando-os mais acessíveis para empresas sem acesso a instalações massivas de processamento e armazenamento de dados. Isso pode proporcionar ciclos de treinamento mais rápidos, reduzindo custos e otimizando recursos.

Os ganhos de eficiência são substanciais. Enquanto LLMs podem exigir semanas de treinamento em grandes conjuntos de dados, SLMs podem ser ajustados para domínios específicos em dias ou horas. Essa agilidade permite iterações e implantações rápidas, permitindo que as empresas adaptem sistemas de IA às necessidades operacionais em evolução, sem ciclos de desenvolvimento longos ou custos proibitivos.

Além disso, SLMs significam tempos de inferência mais rápidos e menor sobrecarga operacional — todos fatores críticos para data centers que gerenciam cargas de trabalho em tempo real em infraestrutura distribuída. Quando as respostas da IA precisam informar decisões operacionais imediatas, milissegundos importam.

Arquitetura de IA que privilegia a privacidade

A conformidade é fundamental em setores altamente regulados, e pequenos modelos de linguagem oferecem vantagens embutidas para implantações conscientes da privacidade. Alucinações ou imprecisões em sistemas de IA generativa levaram a grandes riscos financeiros e reputacionais. Nos piores cenários, isso pode levar a processos judiciais caros ou até mesmo proibições de mercado.

É por isso que a robustez técnica e a segurança se tornaram prioridades regulatórias máximas. As empresas devem construir estruturas de governança que garantam precisão, transparência e resiliência. SLMs suportam implantação on-premises e Edge, essenciais para indústrias com requisitos rigorosos de governança de dados.

Manter os dados locais ajuda a atender a GDPR, HIPAA e outros padrões regulatórios, ao mesmo tempo em que reduz a exposição a riscos de terceiros. Para operadores de data centers que gerenciam informações sensíveis de clientes ou fornecedores de telecomunicações que lidam com inteligência de rede, essa capacidade de implantação local é essencial para a conformidade.

A vantagem da IA híbrida

As implantações de IA mais eficazes combinam SLMs com LLMs de nível base. Enquanto os primeiros conseguem lidar com tarefas específicas do assunto com precisão e eficiência, os segundos oferecem uma consciência mais ampla do contexto, compreensão da fala e do diálogo, e geração sofisticada de respostas.

Essa abordagem permite padrões de implantação diversos. SLMs funcionam como fontes de conhecimento embutidas, entregando raciocínio direcionado e resumo enquanto mantêm relações de domínio. Por exemplo, dentro do Microsoft Edge, SLMs podem fornecer inferência energeticamente eficiente para aplicações específicas de domínio, como resposta em tempo real de telemetria para análise web, correlação inteligente de eventos entre sessões de navegador, processamento automatizado de lógica de negócios para fluxos de trabalho de comércio eletrônico e filtragem contextual de conteúdo – tudo isso mantendo a privacidade do usuário e reduzindo dependências de servidores.

Essas arquiteturas híbridas equilibram agilidade com governança, otimizando custos e controle de dados, garantindo que cada sistema de IA cumpra seu papel pretendido no ecossistema operacional.

Da experimentação à execução

A diferença de precisão da IA é uma preocupação crescente, mas também solucionável. SLMs oferecem um caminho prático e escalável para soluções mais confiáveis, especialmente em setores onde confiança, conformidade e rapidez são inegociáveis.

SLMs oferecem precisão específica de domínio, ciclos de implantação mais rápidos e conformidade embutida sem a sobrecarga de uma infraestrutura massiva. À medida que as empresas avançam da experimentação para a execução, esses modelos desempenharão um papel central na formação da próxima fase da maturidade da IA.