Empresa americana de infraestrutura de IA Tensormesh faz parceria com AMD para expandir memória GPU; latência do primeiro token cai para 0,5 segundos
2026-07-24 15:26
Favoritos

De acordo com pt.wedoany.com-A empresa americana de infraestrutura de IA Tensormesh e a AMD (Advanced Micro Devices) anunciaram uma parceria para tratar a memória externa de aceleradores como uma extensão da capacidade da GPU, ajudando empresas a atender mais modelos de inteligência artificial com menos GPUs.

Anunciada em 23 de julho de 2026, a parceria combina a solução de cache KV da Tensormesh, o gerenciamento LMCache, a tecnologia de GPU da AMD e o componente de virtualização AMD Live Context. A nova arquitetura não limita mais os dados de inferência ativos à memória de alta largura de banda (HBM), permitindo que o cache KV transborde para uma estrutura hierárquica que abrange DRAM, SSD e armazenamento remoto.

A capacidade de memória tornou-se o gargalo prático para a inferência de grandes modelos de linguagem. Adicionar mais GPUs fornece mais HBM, mas também aumenta os custos do acelerador, o consumo de energia e as necessidades de infraestrutura. Criar processadores com pools de memória maiores do lado do hardware pode resolver o mesmo gargalo, mas agrava a demanda por componentes de memória já limitados. A Tensormesh e a AMD propuseram uma abordagem alternativa: e se as empresas pudessem utilizar melhor a memória já existente em cada nó?

Os dados de cache KV tornaram-se o alvo. Durante a inferência, modelos Transformer armazenam dados de atenção intermediários para evitar recalcular o contexto completo do diálogo ou documento para cada token gerado. Quando os prompts são longos, a concorrência aumenta ou vários modelos compartilham um cluster de inferência, o cache pode se tornar muito grande. O artigo de pesquisa vLLM, através do PagedAttention, impulsionou a indústria a focar em uma alocação mais eficiente do cache KV, revelando o impacto do gerenciamento de memória na taxa de transferência de inferência.

O LMCache expande esse conceito para múltiplos níveis de memória. De acordo com a Tensormesh, blocos de cache removidos da HBM para virtualização de curto prazo podem ser reutilizados posteriormente para correspondência de cache KV de prefixo ou não prefixo. Mover dados para armazenamento mais lento aumenta a capacidade, mas evitar cálculos repetidos é a chave para que a arquitetura possa recuperar o desempenho.

Os testes usaram servidores Dell equipados com 8 GPUs aceleradoras AMD/ATI (MI355) e armazenamento Dell. Em um conjunto de documentos de 300 GB executando Kimi-K2.6, a Tensormesh e a AMD relataram que a latência do primeiro token caiu de 3,4 segundos para menos de 0,5 segundos, uma melhoria de quase 7 vezes. Este resultado decorre da recuperação de dados KV em cache da DRAM e NFS, em vez de recálculo. À medida que a carga de trabalho aumenta, a taxa de transferência de saída permanece em cerca de 48 tokens por segundo; em contraste, a taxa de transferência de inferência não otimizada caiu quase 40% sob a mesma carga. De acordo com os resultados relatados, a densidade de modelos no mesmo hardware também dobrou.

Os resultados foram divulgados pelos fornecedores, não por meio de benchmarks independentes abrangentes. As equipes empresariais precisam replicar os testes usando seus próprios modelos, comprimentos de prompt e perfis de concorrência. O MLCommons fornece o contexto necessário para testes de inferência padronizados: o desempenho pode variar significativamente dependendo do modelo, metas de latência, configuração do servidor e abordagem da carga de trabalho.

Dobrar a densidade de modelos não significa apenas acomodar mais modelos em um rack, mas também pode impactar a economia de assistentes internos, sistemas de geração aumentada por recuperação e análise de documentos, ao distribuir os custos do acelerador por mais cargas de trabalho. Para empresas que lidam com grandes coleções de documentos, essa vantagem potencial é particularmente importante, pois contextos repetidos criam oportunidades para reutilização de cache.

Esta abordagem envolve trade-offs. DRAM é mais lenta que HBM, enquanto SSD e armazenamento remoto introduzem latência adicional e risco de contenção de rede. Uma hierarquia eficaz depende de identificar quais dados de cache devem permanecer próximos à GPU e quais podem ser movidos sem afetar os objetivos de nível de serviço; a taxa de acerto do cache, a largura de banda de armazenamento e o comportamento de orquestração podem ser tão importantes quanto a capacidade nominal.

É improvável que a pressão mais ampla diminua rapidamente. O Instituto de IA Centrada no Humano de Stanford (Stanford HAI) documentou as crescentes demandas computacionais associadas a sistemas avançados de IA, corroborando ainda mais a importância de melhorar a utilização enquanto se implanta hardware adicional.

Antes desta parceria, a AMD Ventures participou da rodada de financiamento de US$ 20 milhões da Tensormesh concluída em maio de 2026. A Tensormesh e a AMD estão apresentando resultados de desempenho esta semana no AMD Advancing AI 2026, e espera-se que o código-fonte aberto do LMCache seja lançado publicamente em cerca de um mês. Esse lançamento pode expandir o escopo de experimentação com gerenciamento de cache KV em múltiplos níveis e fornecer às equipes de infraestrutura uma compreensão mais clara de como a abordagem se comporta fora do ambiente de teste inicial da Dell.

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com