AMD e Cerebras Annunciam Recente Solução Pioneira de Inferência de Inteligência Artificial
AMD e Cerebras desenvolvem solução inovadora de inferência de IA com ultra baixa latência
SAN FRANCISCO e SUNNYVALE, Calif., 23 de julho de 2026 (GLOBE NEWSWIRE) -- A AMD (NASDAQ: AMD) e a Cerebras Systems (NASDAQ: CBRS) anunciaram uma parceria técnica para desenvolver uma nova solução de inferência de IA desacoplada que combina os soluções de rackscale da AMD e o processador de engenharia a escala única da Cerebras. Destacada na convenção Advancing AI 2026, a solução está projetada para entregue ultra-baixa latência exigida para as aplicações de IA mais avançadas, aumentando dramaticamente a capacidade de processamento e eficiência.
A solução conjunta da AMD e da Cerebras irá desdobrar os soluções da AMD Helios ao lado da tecnologia do motor da Cerebras em um único fluxo de inferência de máxima performance e eficiência. A Helios da AMD irá fornecer um motor de processamento de alta performance e eficiência. A tecnologia do motor da Cerebras oferecerá a ultra-rápida e ultra-baixa latência de decodificação e de geração de token. Juntos, os dois motores de processamento prevêem a entrega de até 5x mais tokens por segundo por watt (T/s/W). i
Os carregamentos de inferência de IA cada vez mais vêm com diferentes demandas em tempo de latência, capacidade de processamento e tamanho de token. As cargas de processamento alto volume priorizam a maximização da geração de token. Já as cargas de tempo real de copilotos, agentes de vida e fluxos agente demandam por tempos de resposta mais rápidos. Essas diferenças estão impulsionando a demanda por Infraestrutura híbrida que corresponda às necessidades específicas dos requerimentos do carregamento, adaptando a diferentes necessidades de processamento.
A solução AMD e Cerebras endereça esse desafio através da inferência de processamento desacoplada, otimizantes as duas etapas primárias do fluxo de processamento independentemente. A Helios da AMD oferece processamento de ultra-alta capacidade, tratando prompsos e janelas de contexto grandes. O motor da Cerebras acelera a intensiva geração de token de memoria, ultra-rápida e ultra-baixa latência. Ao se conectar aos motores de processamento de melhor desempenho através de um único fluxo de trabalho integrado, as empresas criaram uma plataforma diferenciada para inference de ultra-baixa latência sem sacrificar a capacidade ou escala.
“A inference de IA está se tornando uma das grandes oportunidades de infraestrutura de IA, e a sua crescente diversidade requer uma abordagem mais flexível”, disse Dr. Lisa Su, presidente e CEO da AMD. “A Helios da AMD entrega desempenho de liderança e escala para um vasto espectro de carregamentos de inferência. Juntos com o Cerebras, estamos levando essa liderança para as aplicações mais sensíveis em tempo de latência e criando uma plataforma poderosa para o IA em tempo real agente.”
Impacto da Inovação na Inteligência Artificial
Desde que o tempo de geração de tokens se tornou cada vez mais crítico e a eficiência se tornou cada vez mais importante, as aplicações de IA foram impulsionadas a buscar soluções cada vez mais eficientes e flexíveis. Com a tecnologia do motor do Cerebras sendo usada em conjunto com as soluções do rachescalo da AMD, podemos esperar maior escalabilidade, flexibilidade e desempenho de IA, trazendo beneficios a diversas áreas como a inteligência artificial de tempo real, agente, automação, entre outras.