PPIO da China lança gateway de modelos, com média diária de chamadas de tokens superior a 1,2 trilhão em junho
2026-07-20 11:34
Favoritos

De acordo com pt.wedoany.com-Na conferência WAIC 2026, a PPIO da China lançou oficialmente o posicionamento Agentic Cloud e o novo produto de gateway inteligente de modelos, propondo a criação de uma "Fábrica Inteligente de Tokens" voltada para a era dos Agentes. Com a previsão de que o mercado global de agentes de IA cresça de US$ 5,1 bilhões em 2024 para US$ 47,1 bilhões em 2030, a demanda por tokens em tarefas de agentes aumentou drasticamente.

Yao Xin, cofundador e CEO da PPIO, destacou que os clientes de tokens estão migrando de humanos para agentes, e os provedores de serviços em nuvem precisam oferecer "Fábricas de Tokens" com menor latência e maior throughput. De acordo com dados da CIC (China Insights Consultancy), embora o custo de inferência caia mais de 10 vezes ao ano, a quantidade de tokens consumidos por uma única tarefa de agente já aumentou de centenas nos estágios iniciais para dezenas de milhares ou até centenas de milhares, fazendo com que a pressão geral de custos não diminua, mas aumente. Além disso, um único modelo não consegue atender às diversas necessidades dos agentes, e as exigências de latência e estabilidade dos agentes são muito maiores do que as de aplicações tradicionais de IA.

O principal produto lançado pela PPIO, o gateway inteligente de modelos, adota o mecanismo "Mixture of Models" (MoM). Nas etapas críticas dos agentes, o gateway distribui o problema para vários modelos especialistas, gerando respostas por meio de validação cruzada, evitando falhas na tarefa devido à especialização limitada de um único modelo. O gateway também possui capacidade de agendamento inteligente e otimização de custos, roteando as tarefas de acordo com o tipo e controlando os custos por meio de mecanismos como compressão de contexto redundante e barreiras orçamentárias. De acordo com o benchmark de pesquisa aprofundada DRACO, ao integrar Mimo-V2.5-Pro, Kimi-K2.7 e GLM-5.2 para inferência híbrida, a PPIO pode elevar o desempenho a um nível próximo ao do Claude Fable 5, com um aumento de 20% no nível de inteligência e uma redução de 50% a 60% nos custos. O mecanismo de aceleração de inferência desenvolvido internamente pela PPIO é profundamente otimizado para cenários de agentes, proporcionando um aumento de até 10 vezes no desempenho de inferência. Combinado com a tecnologia Prompt Cache, o custo dos tokens pode ser reduzido em até 80%. A PPIO foi selecionada como um dos primeiros participantes da "Linha de Base de Escalada de Desempenho de Serviços de Token de Nível Empresarial" do Instituto de Pesquisa de Padronização de Tecnologia da Informação e Comunicação da China (CAICT), alcançando, em cenários gerais, TPS ≥ 55/segundo, TTFT ≤ 0,9 segundos e taxa de sucesso de chamadas ≥ 99,9%.

No ambiente de execução de agentes, a PPIO lançou o Agent Sandbox, que, baseado na tecnologia microVM, alcança inicialização a frio em milissegundos (<200ms). Cada tarefa é executada em um ambiente de máquina virtual independente, suportando a criação simultânea de dezenas de milhares de sandboxes. O mecanismo Auto Pause/Resume reduz os custos em até mais de 90% em comparação com produtos similares. Desde o lançamento na WAIC do ano passado, este primeiro sandbox de agente da China compatível com a interface E2B teve um crescimento de mais de 123 vezes no volume de negócios. O PPIO Agent Harness incorpora recursos como Browser Use, Computer Use, Code Interpreter e MCP Server, cobrindo todo o ciclo do agente, desde a obtenção de informações até a execução de ações. A plataforma pré-instala vários modelos de agente, como PPClaw e PPHermes, permitindo que os desenvolvedores concluam a implantação na nuvem em apenas 10 minutos, além de suportar hospedagem contínua 7×24 horas e agendamento de tarefas programadas.

Em termos de dados, em junho de 2026, o volume médio diário de chamadas de tokens da PPIO ultrapassou 1,2 trilhão, ocupando o primeiro lugar entre os provedores independentes de serviços de computação em nuvem de IA na China, um aumento de mais de 8 vezes em relação ao mesmo período de 2025. A receita da empresa cresceu de 358,4 milhões de yuans em 2023 para 770,3 milhões de yuans em 2025, com mais de 670 mil desenvolvedores registrados globalmente. A taxa média de utilização de GPU da PPIO manteve-se consistentemente acima de 75% em 2025, superando em muito a média da indústria de 40% a 50%. Yao Xin explicou que a PPIO, por meio da capacidade de "nivelamento de picos e vales" de sua rede global de agendamento, utilizando a diferença de fuso horário entre os hemisférios leste e oeste, eleva a taxa de utilização de GPU para 70% a 80%. Atualmente, a PPIO implantou clusters distribuídos em regiões como Europa, América do Norte, América do Sul e Sudeste Asiático, cobrindo seis continentes do mundo.

Yao Xin afirmou que o limite superior da inteligência não reside apenas dentro dos modelos; a engenharia de agentes e a fusão de modelos fora dos modelos também podem melhorar significativamente o nível de inteligência. A PPIO está comprometida em tornar os tokens mais baratos e a operação dos agentes mais estável, preparando a infraestrutura subjacente para o boom da economia de agentes.

Com base na camada Harness, a plataforma pré-instala modelos de agente prontos para uso, como PPClaw e PPHermes. Os desenvolvedores podem implantá-los na nuvem com um único clique no console, ficando operacionais em apenas 10 minutos. Após a implantação, suporta hospedagem contínua 7×24 horas e agendamento de tarefas programadas. Quando não estiver em uso, a cobrança pode ser pausada com um clique, e a retomada é instantânea. A plataforma também oferece interfaces nativas de IA voltadas para agentes, suportando o protocolo padrão MCP, permitindo que os agentes utilizem linguagem natural para chamar infraestruturas como poder computacional de GPU e ambientes sandbox. A plataforma é compatível com os principais frameworks de agentes, como LangChain, CrewAI e AutoGen.

A rede de computação distribuída e os nós de computação de alta densidade da PPIO fornecem o suporte subjacente para a Fábrica Inteligente de Tokens. Através das diferenças de fuso horário entre regiões e das demandas intercaladas de uma base diversificada de clientes, ela aloca dinamicamente a capacidade computacional ociosa global para os picos de demanda, garantindo a utilização eficaz dos recursos de GPU. Essa capacidade de agendamento reduz diretamente o custo real por token, tornando-se a garantia subjacente do modelo "loja na frente, fábrica atrás" da PPIO.

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com