Nvidia dos EUA lança modelo TwoTower de código aberto para acelerar geração de tokens

2026-07-06 17:51
Favoritos

De acordo com pt.wedoany.com-A Nvidia dos EUA lançou recentemente o modelo Nemotron-Labs-TwoTower como código aberto, melhorando a eficiência de geração de texto de grandes modelos através de uma arquitetura de duas torres. Nos testes, o modelo manteve 98,7% da qualidade da linha de base autorregressiva, ao mesmo tempo que alcançou um aumento de 2,42 vezes na taxa de transferência real de geração. Os pesos relevantes já estão disponíveis na plataforma Hugging Face dos EUA.

O foco técnico do TwoTower é separar as duas tarefas de "compreensão de contexto" e "geração de novos tokens" nos modelos de linguagem tradicionais. A maioria dos modelos autorregressivos precisa gerar tokens sequencialmente, um após o outro, e o próximo token não pode entrar no fluxo de saída estável até que o anterior seja concluído. Embora esse método ofereça alta qualidade, ele tende a criar gargalos de velocidade em textos longos, geração de código, tarefas de agente e serviços de alta concorrência. A arquitetura TwoTower proposta pela Nvidia dos EUA divide o modelo em uma torre de contexto e uma torre de desruído: a torre de contexto é responsável por ler prompts e texto existente, mantendo a capacidade do modelo autorregressivo de compreender semântica, lógica e contexto; a torre de desruído é responsável por corrigir iterativamente blocos ruidosos, permitindo que a geração de texto progrida de forma mais paralela.

Do ponto de vista estrutural, o Nemotron-Labs-TwoTower é construído com base no Nemotron-3-Nano-30B-A3B, composto por duas torres de modelo de aproximadamente 30B, adotando uma arquitetura híbrida Mamba-Transformer MoE. A torre de contexto permanece congelada, assumindo principalmente a tarefa de representação de contexto "somente leitura"; a torre de desruído é treinada separadamente, utilizando atenção bidirecional em blocos e atenção cruzada camada por camada para ler informações semânticas da torre de contexto e, em seguida, realizar geração e desruído em nível de bloco. Esse design evita que uma única rede execute simultaneamente as funções de representação de contexto e desruído iterativo, permitindo também a reutilização das capacidades do modelo autorregressivo pré-treinado original, sem a necessidade de treinar um modelo de linguagem de difusão do zero.

Em termos de treinamento e eficiência, o valor do TwoTower vai além do aumento da velocidade de inferência. De acordo com informações do artigo, o modelo foi treinado com aproximadamente 2,1 trilhões de tokens e adaptado com base em um modelo de arquitetura mista de 30B com pesos abertos. Em comparação com o problema comum de degradação da compreensão semântica em modelos de linguagem de difusão tradicionais, o TwoTower mantém o conhecimento linguístico e de contexto longo do modelo existente no sistema, retendo a torre de contexto autorregressiva congelada, enquanto a torre de desruído se concentra em resolver o problema da geração paralela. Em outras palavras, não se trata simplesmente de sacrificar qualidade por velocidade, mas sim de redesenhar o processo de geração com base na divisão de tarefas do modelo.

O aumento de 2,42 vezes na velocidade de geração de tokens tem implicações diretas para desenvolvedores e implantações empresariais. À medida que aplicações de grandes modelos entram em áreas como agentes, programação de IA, atendimento ao cliente, geração de bases de conhecimento e processamento de documentos longos, a velocidade de saída afeta o tempo de espera do usuário, a capacidade de concorrência do serviço e o custo de inferência. Uma tarefa de agente pode envolver múltiplas rodadas de planejamento, chamadas de ferramentas, geração de código, verificação de resultados e saída explicativa; quanto mais lenta a geração de tokens, maior o tempo total da tarefa. Se o modelo puder aumentar a taxa de transferência mantendo uma qualidade próxima à original, o mesmo hardware poderá suportar mais solicitações ou reduzir o tempo de resposta para o mesmo número de solicitações.

Este lançamento de código aberto também torna o TwoTower mais do que apenas uma arquitetura de laboratório. A página do Hugging Face dos EUA mostra que o Nemotron-Labs-TwoTower-30B-A3B-Base-BF16 pode ser carregado via Transformers, bem como implantado usando vLLM, SGLang e Docker Model Runner. Para pesquisadores, os pesos abertos facilitam a reprodução de experimentos, a comparação de modos de decodificação e a exploração do desempenho de modelos de linguagem de difusão na geração de textos longos; para equipes de engenharia, o modelo de código aberto pode ser usado em ambientes de teste locais para avaliar custos de inferência, uso de memória, taxa de transferência do serviço e estabilidade de qualidade.

No entanto, o TwoTower não significa que todas as tarefas de texto obterão incondicionalmente um aumento de 2,42 vezes na experiência. A velocidade real será afetada pela configuração de hardware, tamanho do lote, comprimento do contexto, estratégia de decodificação, estrutura de implantação e tipo de tarefa. Para perguntas e respostas curtas, baixa concorrência ou cenários com forte dependência da ordem de geração, os ganhos podem não ser tão significativos quanto na geração de textos longos, conclusão de código e saída de múltiplas etapas de agentes. O fato de o modelo manter 98,7% da qualidade também significa que ainda há alguma perda de capacidade, especialmente em tarefas que exigem raciocínio rigoroso, como matemática ou código; os desenvolvedores precisam validar com seus próprios dados de negócios.

O lançamento do TwoTower como código aberto pela Nvidia dos EUA reflete que a competição de grandes modelos está passando da expansão da escala de parâmetros para áreas mais profundas de eficiência de geração, custo de inferência e capacidade de implantação de engenharia. Uma velocidade de geração de tokens mais rápida pode aproximar as aplicações de IA da interação em tempo real; o suporte a pesos abertos e estruturas de implantação mainstream permite que as empresas testem novas arquiteturas em seu próprio hardware e processos de negócios. O objetivo do TwoTower não é substituir todos os modelos autorregressivos, mas fornecer um novo caminho de geração para cenários de textos longos, alta concorrência, agentes e inferência local: manter a capacidade de compreensão de contexto dos modelos existentes, enquanto usa um mecanismo de desruído difusivo para resolver o gargalo de velocidade da geração token por token.

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com