Intel mira inferência de IA sem GPU em parte das cargas corporativas
A Intel aposta no uso de CPUs para executar parte das cargas corporativas de inferência de IA sem a necessidade de GPUs ou outros aceleradores dedicados. Ela utiliza recursos incorporados aos processadores Xeon, entre eles o Advanced Matrix Extensions (AMX), voltado às operações matriciais empregadas em aplicações de IA.
Em entrevista ao Tele.Síntese durante a Febraban Tech, Roberto Corrêa, especialista em tecnologias de data center e IA da Intel, afirmou que a companhia registra casos de inferência de modelos com cerca de 12 bilhões de parâmetros diretamente no processador. O resultado varia conforme as características da aplicação, como número de usuários simultâneos e tamanho das requisições.
O AMX foi incorporado à quarta geração dos processadores Xeon Scalable, lançada em 2023, e está presente nas gerações seguintes. No Xeon 6, lançado em 2025, o recurso é integrado aos P-cores, voltados a cargas que priorizam desempenho por núcleo.
“Existem, por exemplo, muitos casos de inferência com LLM em que o seu usuário é o seu funcionário interno, não é o seu cliente externo”, afirmou Corrêa.
O executivo citou como exemplo uma operadora que utilize um modelo ajustado com uma base de conhecimento interna para produzir scripts de implantação de equipamentos ou auxiliar no diagnóstico de situações da rede. Nesse tipo de aplicação, com dezenas ou centenas de usuários simultâneos, a inferência pode ser executada em CPU. Para serviços destinados a milhões de clientes, Corrêa afirma que aceleradores dedicados podem ser utilizados para escalar a capacidade computacional sem ampliar na mesma proporção o parque de servidores.
Teste com AWS reduz custo por operação
Um dos casos apresentados pela Intel envolve o AWS Lambda, serviço de computação serverless da Amazon Web Services. A AWS passou a oferecer uma variante do serviço que permite selecionar instâncias baseadas em processadores Intel Xeon 6.
Em um teste de inferência para reconhecimento de objetos em imagens estáticas, a configuração reduziu em mais de sete vezes o tempo de execução, de acordo com os resultados fornecidos pela Intel. O custo por transação caiu mais de 70%.
A redução decorre do uso do AMX para acelerar os cálculos matriciais da carga de IA. Como o AWS Lambda cobra de acordo com os recursos computacionais utilizados durante a execução, a redução do tempo de processamento repercutiu no custo da operação testada.
Para Corrêa, a utilização da CPU é uma alternativa principalmente para aplicações em que o porte do modelo, o volume de requisições e a quantidade de usuários simultâneos não exigem um acelerador dedicado. Na entrevista, ele mencionou modelos menores, com 5 bilhões ou 7 bilhões de parâmetros, entre os exemplos de cargas que podem se enquadrar nesse cenário.
QAT acelera criptografia e compressão
Além do AMX, o Xeon incorpora aceleradores destinados a outras cargas de data center. Entre eles está o Intel QuickAssist Technology (QAT), desenvolvido para operações de criptografia, descriptografia e compressão de dados.
Em testes disponibilizados pela Intel com instâncias do Google Cloud baseadas em Xeon 6, o uso do QAT proporcionou ganho de desempenho de até 85% em cargas com NGINX.
O acelerador executa parte das operações de criptografia e compressão que, de outra forma, utilizariam recursos dos núcleos da CPU. Corrêa relaciona a tecnologia a aplicações web baseadas em HTTPS e TLS, inclusive em situações de aumento concentrado de acessos.
O executivo também citou como exemplo a abertura de vendas de ingressos pela internet, quando um serviço pode receber simultaneamente um volume de acessos várias vezes superior ao registrado em períodos regulares. Nesse cenário, o QAT pode assumir operações criptográficas enquanto os núcleos permanecem disponíveis para outras cargas do servidor.
Xeon 6 separa desempenho e eficiência energética
Com o Xeon 6, a Intel passou a dividir a família de processadores para data centers entre configurações com P-cores e E-cores. Os primeiros são direcionados a aplicações que priorizam desempenho por núcleo e incluem o AMX. Os E-cores aumentam a densidade de núcleos por processador e são direcionados também à eficiência energética.
Segundo Corrêa, versões com E-cores chegam a 288 núcleos por processador, o que permite alcançar 576 núcleos em um servidor equipado com dois processadores.
O executivo apontou a infraestrutura de telecomunicações entre as aplicações dessa arquitetura. Segundo ele, Nokia e Ericsson adotaram processadores da linha como referência para processamento de redes virtualizadas.
A segmentação ocorre em um momento em que o consumo de energia passou a ter maior peso no dimensionamento de infraestrutura computacional. Corrêa afirmou que provedores de nuvem vêm considerando desempenho, eficiência energética e custo na adoção das novas gerações de processadores.
Computação confidencial protege dados durante processamento
A plataforma Xeon também reúne recursos de computação confidencial para proteger dados enquanto estão sendo processados. O Intel Trust Domain Extensions (TDX) permite criar máquinas virtuais isoladas, denominadas trust domains, com proteção baseada em hardware contra acessos de outros componentes do ambiente. Já o Intel Software Guard Extensions (SGX) permite criar enclaves protegidos dentro do espaço de memória de aplicações.
Corrêa destacou o uso dessas tecnologias para isolar e criptografar áreas de memória e restringir o acesso aos dados durante o processamento. Os recursos complementam mecanismos voltados à proteção dos dados armazenados e em trânsito. O QAT também participa dessa camada ao acelerar operações de criptografia sem concentrar toda a carga nos núcleos de processamento.
A Intel já trabalha na geração seguinte de seus processadores para data centers. Corrêa afirmou que o produto estava em estágio avançado de desenvolvimento no momento da entrevista. O executivo disse que a companhia ainda não havia divulgado o nome comercial nem a data de lançamento da próxima geração.
