A Alibaba Qwen da China atualiza o modelo de reconhecimento de fala Fun-ASR-Realtime, suportando 30 idiomas e 16 dialetos em um único modelo

2026-07-06 17:31
Favoritos

De acordo com pt.wedoany.com-A Alibaba Qwen da China anunciou em 6 de julho a atualização do modelo de reconhecimento de fala em tempo real Fun-ASR-Realtime. Após a atualização, um único modelo pode suportar 16 dialetos e 30 idiomas. A API já está disponível na plataforma Alibaba Cloud Bailian da China, sendo aberta para chamadas em cenários como legendas em tempo real, transcrição de reuniões, assistentes de voz, atendimento ao cliente internacional e comunicação multilíngue.

O foco desta atualização está em duas direções: "tempo real" e "cobertura de fala complexa". Como um modelo de reconhecimento de fala em fluxo contínuo, o Fun-ASR-Realtime enfatiza a saída síncrona de texto enquanto o usuário fala, com o atraso da primeira palavra controlado em nível de milissegundos e baixa latência na saída da última palavra de frases longas. Em comparação com o reconhecimento offline, que transcreve após a gravação, o reconhecimento em tempo real exige mais da capacidade do modelo de julgar continuamente fragmentos de fala, contexto, pausas, ruídos e variações de sotaque. Em cenários como reuniões, transmissões ao vivo, atendimento ao cliente e hardware inteligente, os usuários não esperam o fim de uma frase para obter resultados; o sistema deve reconhecer enquanto ouve e minimizar erros de julgamento causados por mudanças no contexto.

Em termos de capacidade de dialetos, o Fun-ASR-Realtime cobre 16 dialetos de oito grandes regiões dialetais. Em testes relevantes, a precisão média de caracteres do modelo foi de 88,62%, superando produtos relacionados da Volcano Engine da China e da Tencent da China em 12 tipos de reconhecimento de dialetos. O reconhecimento de dialetos é há muito um desafio na tecnologia de fala, devido às grandes diferenças entre regiões em consoantes iniciais, finais, tons, velocidade de fala, ligações e expressões vocabulares. Uma mesma frase em mandarim padrão pode ser alterada por diferentes sotaques na fala real. Se o modelo for adaptado apenas ao mandarim padrão, ao entrar em cenários como atendimento ao cliente, transmissões ao vivo, vídeos curtos, linhas diretas governamentais, sistemas de voz veiculares e terminais inteligentes, erros de transcrição são fáceis de ocorrer. Desta vez, a Alibaba Qwen incorporou 16 dialetos no mesmo modelo em tempo real, significando que as empresas não precisam implantar múltiplas capacidades de reconhecimento separadamente para diferentes regiões ao integrar.

A capacidade multilíngue aponta para cenários de uso comercial mais amplos. O Fun-ASR-Realtime suporta 30 idiomas e foi otimizado especificamente para cenários multilíngues do Leste Asiático e Sudeste Asiático, como o tailandês, com um aumento de 20% na precisão do reconhecimento. Essa capacidade é mais adequada para atendimento ao cliente transfronteiriço, conferências internacionais, transmissões ao vivo no exterior, treinamento de empresas multinacionais, serviços turísticos, comércio eletrônico internacional e operações localizadas. Para empresas que expandem para o exterior, o reconhecimento de fala não se trata apenas de converter som em texto, mas também está relacionado à inspeção de qualidade do atendimento ao cliente, geração de tickets, atas de reuniões, tradução de legendas, organização de leads de vendas e conformidade documental. Se um modelo em tempo real puder lidar simultaneamente com problemas multilíngues e de sotaque, as empresas podem reduzir custos de transcrição manual e reorganização repetitiva em operações no exterior.

Esta atualização também colocou a capacidade de contexto em uma posição mais importante. O reconhecimento de fala em tempo real é facilmente afetado por ruído ambiente, múltiplas pessoas falando, vocabulário técnico e termos temporários, especialmente em transmissões ao vivo, locais industriais, consultas médicas, atendimento ao cliente financeiro e conferências técnicas, onde nomes de pessoas, marcas, modelos de produtos e nomes de dispositivos frequentemente não são palavras comuns. O Fun-ASR-Realtime foi fortalecido para capacidade de contexto amplo, podendo combinar o contexto do histórico de diálogo e termos temporários em tempo real para melhorar os resultados do reconhecimento. Por exemplo, em cenários de transmissão ao vivo, o modelo pode recalibrar palavras facilmente mal interpretadas com base no contexto semântico anterior e posterior, tornando as legendas mais próximas da expressão real. Essa capacidade está mais próxima das necessidades reais de negócios do que simplesmente melhorar a pontuação de ditado em mandarim.

Após o lançamento da API na plataforma Alibaba Cloud Bailian da China, desenvolvedores e empresas podem integrar o Fun-ASR-Realtime em seus próprios sistemas de negócios. A forma de integração afetará a velocidade de implantação do modelo: se a capacidade de reconhecimento de fala só puder ser usada em um único produto, será mais uma ferramenta; se entrar em sistemas de atendimento ao cliente, sistemas de reunião, hardware inteligente, plataformas de transmissão ao vivo, sistemas veiculares e plataformas de escritório empresarial através da API, tornar-se-á uma infraestrutura de fala subjacente. O Fun-ASR-Realtime forma uma combinação com o modelo offline Fun-ASR-Flash, lançado recentemente, sendo o primeiro adequado para legendas em tempo real e interação por voz, e o segundo mais adequado para arquivos de áudio, áudios longos, entrevistas e tarefas de transcrição em lote. A entrada simultânea de modelos em tempo real e offline na plataforma Bailian também permite que as empresas escolham diferentes caminhos de reconhecimento de acordo com o cenário.

A competição entre modelos de reconhecimento de fala está mudando de "conseguir entender o mandarim" para "conseguir entender sons complexos do mundo real". Os usuários podem ter sotaque, fazer pausas, repetir, inserir palavras em inglês, alternar idiomas, ou estar em ambientes como salas de reunião, estúdios de transmissão ao vivo, fábricas, carros ou ao ar livre. Desta vez, o Fun-ASR-Realtime coloca dialetos, multilinguismo, baixa latência, termos temporários contextuais e serviço de API na mesma atualização, mirando, na prática, uma entrada de fala empresarial mais complexa. Até que ponto ele pode cobrir vocabulário de setores, manter baixa latência em chamadas de alta concorrência e se adaptar a mais cenários de ruído determinará diretamente a profundidade de uso deste tipo de modelo de fala em tempo real em sistemas comerciais.

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com