De acordo com pt.wedoany.com-A iFlytek lançou oficialmente o Spark Token Factory em 19 de julho, com o objetivo de ajudar as empresas a melhorar a eficiência e o nível de gestão na aplicação de grandes modelos, construindo uma base de infraestrutura para grandes modelos voltada para o futuro.
Durante a implementação em larga escala de IA empresarial, as empresas enfrentam uma série de desafios de gestão operacional. O número de modelos continua aumentando, os custos de chamada crescem constantemente, e os requisitos de estabilidade do sistema se tornam mais rigorosos, enquanto o desenvolvimento de capacidades como gestão entre modelos, controle de custos, governança de segurança e monitoramento operacional fica relativamente atrasado. As empresas frequentemente precisam integrar vários serviços de modelos simultaneamente para suportar diferentes cenários de negócios, como assistentes de código, atendimento inteligente ao cliente, perguntas e respostas baseadas em conhecimento, geração de conteúdo e processamento de documentos. A complexidade das tarefas varia significativamente, mas na prática, muitas vezes é usado um modelo uniforme para processá-las, resultando em baixa eficiência no uso de recursos e aumento contínuo dos custos de Token. A execução paralela de múltiplos modelos também impõe maiores exigências à estabilidade do sistema, governança de segurança e gestão operacional. A construção de IA empresarial está gradualmente passando da "construção de capacidades de modelo" para a "construção de infraestrutura de IA", onde o foco não está mais apenas na capacidade do modelo em si, mas em como integrar efetivamente as capacidades do modelo nos processos de negócios, garantindo operação estável, governança unificada e otimização contínua.
O Spark Token Factory é posicionado como uma plataforma de roteamento inteligente de modelos de IA de nível empresarial, oferecendo capacidades principais como integração unificada de modelos, agendamento de roteamento inteligente, otimização de custos de Token e governança de conformidade de segurança, formando um ciclo completo que abrange "integração—governança—observação—operação", construindo uma entrada unificada para serviços de grandes modelos empresariais, permitindo que os recursos de grandes modelos sejam gerenciáveis, controláveis e rastreáveis.

A função de roteamento inteligente determina a complexidade das tarefas com base em múltiplas dimensões, como comprimento do Prompt, regras predefinidas, regras personalizadas, rodadas de diálogo e afinidade de sessão, realizando gerenciamento de classificação inteligente de L1 a L3 para as solicitações. A plataforma considera de forma abrangente cinco fatores—qualidade, custo, latência, disponibilidade e nível de segurança—para combinar recursos de modelo adequados, permitindo que tarefas simples chamem modelos mais econômicos e tarefas complexas priorizem modelos de alta capacidade. A latência média de toda a decisão pode ser controlada em menos de 100 milissegundos. Por meio da capacidade de roteamento inteligente, a plataforma pode reduzir efetivamente a pressão de chamada em modelos de grande porte, liberando mais espaço para otimização de custos para as empresas.

Em cenários de implantação privada nacionalizada, o Spark Token Factory realiza otimizações de engenharia ponta a ponta para modelos de código aberto mainstream, com base nas características do hardware Ascend. No lado da memória, várias técnicas de compressão de modelo e otimização de precisão são usadas para reduzir a ocupação de memória, mantendo a precisão controlável. No lado da computação e comunicação, operadores de computação principais são fundidos, e a comunicação entre múltiplas placas é reordenada para alcançar paralelismo entre computação e comunicação. No lado do cache e agendamento, o gerenciamento de Cache KV distribuído entre nós e o agendamento de armazenamento em múltiplos níveis são implementados, introduzindo roteamento de cache sensível ao contexto e estratégias de recombinação de reutilização de contexto. No lado da decodificação, um mecanismo de aceleração de decodificação paralela voltado para hardware Ascend é introduzido. Dados de testes reais mostram que, sob as mesmas condições de hardware, em comparação com o framework de código aberto vLLM-Ascend, a eficiência de inferência é melhorada em cerca de 5 vezes, e a latência do primeiro Token é reduzida em 30%–40%.

Em termos de sistema de segurança, o Spark Token Factory adota uma arquitetura de separação de três poderes: a gestão não toca nos dados, as operações não tocam nas permissões, e a auditoria não toca nos negócios, sendo os três independentes e mutuamente restritivos. A plataforma gera automaticamente registros de auditoria de cadeia completa e imutáveis para todas as operações críticas, cobrindo seis categorias de operações: acesso a dados, alterações de permissão, chamadas de modelo e exportação de dados, atendendo aos requisitos de proteção de segurança. A proteção de informações sensíveis abrange privacidade pessoal e dados operacionais, realizando roteamento por nível para garantir que dados sensíveis não saiam do domínio.

O Spark Token Factory oferece capacidade de auditoria de logs de cadeia completa ponta a ponta, registrando todo o processo desde a entrada da solicitação na plataforma até o retorno final do resultado. Por meio de rastreamento de logs, registros de decisões de roteamento, estatísticas de consumo de Token e análise de atribuição de custos, as empresas podem entender o status operacional e o consumo de recursos de cada chamada de modelo. Combinado com gerenciamento de orçamento, análise de ROI e relatórios visuais, fornece suporte de dados para otimização operacional e planejamento de recursos futuros. O lançamento do Spark Token Factory aprimora ainda mais o posicionamento de capacidade da iFlytek no campo da infraestrutura de IA empresarial, marcando também uma nova fase em que a aplicação de grandes modelos empresariais está passando da exploração pontual para a operação em escala.










