De acordo com pt.wedoany.com-O modelo de condução autônoma ponta a ponta multimodal de estágio único iDriveVLA, desenvolvido de forma independente pela equipe do Acadêmico Li Keqiang da Faculdade de Veículos da Universidade Tsinghua (liderada pelo Professor Li Shengbo e pelo Pesquisador Assistente Guan Yang), alcançou o primeiro lugar global no benchmark de avaliação de condução autônoma internacional NAVSIM. O modelo obteve 94,85 pontos no índice abrangente principal PDMS, representando um avanço significativo na direção de modelos de base ponta a ponta, após a equipe ter desenvolvido o primeiro sistema de condução autônoma ponta a ponta full-stack do país.

O iDriveVLA é um modelo multimodal ponta a ponta de estágio único, que realiza duas inovações-chave para enfrentar o desafio de equilibrar a completude das trajetórias e a precisão da seleção em modelos de condução autônoma. Primeiro, foi construída uma arquitetura de modelo de rede neural de atenção mútua com desacoplamento hierárquico, incluindo componentes atômicos de unidades comuns, como codificador de imagem, decodificador de trajetória multimodal e decodificador de avaliação e seleção. Esses componentes são otimizados combinados com base em semânticas macro de direção e pontuações micro de desempenho, juntamente com um mecanismo de filtragem probabilística de portão para trajetórias de baixo desempenho, melhorando a capacidade de compreensão cognitiva do modelo em relação a requisitos como segurança e conformidade na direção. Segundo, a plataforma de treinamento adota o método de treinamento em duas etapas proposto pela equipe, ou seja, pré-treinamento supervisionado seguido de ajuste fino por aprendizado por reforço: primeiro, a capacidade básica de direção do modelo é estabelecida por meio de aprendizado por imitação de trajetórias de direção de especialistas; em seguida, são utilizadas três tecnologias-chave de aprendizado por reforço — BPO de gradiente harmônico resistente a conflitos de dados de múltiplas fontes, função de perda mista ponderada por distribuição exponencial Hybrid-Loss e algoritmo de ajuste fino STAPO para eliminação de tokens falsos — para alcançar alta completude de geração e alta precisão de avaliação de trajetórias multimodais em cenários de tráfego urbano. Este resultado reflete a capacidade contínua de inovação da equipe na direção de modelos de base de condução autônoma integrados veículo-estrada-nuvem, fornecendo suporte técnico para o desenvolvimento de sistemas de condução autônoma de alta segurança, alta confiabilidade e alta generalização.
Esta pesquisa recebeu financiamento do Projeto Chave da Fundação Nacional de Ciências Naturais da China, do Projeto Conjunto Regional da Fundação de Ciências Naturais de Pequim e da Dongfeng Motor Group Co., Ltd.
O desafio NAVSIM foi co-organizado por instituições como NVIDIA, Universidade Stanford, Universidade de Tübingen e o Laboratório de Inteligência Artificial de Xangai, e foi oficialmente anunciado na conferência de topo em inteligência artificial CVPR em 2024, sendo um importante benchmark público no campo da condução autônoma ponta a ponta. De acordo com estatísticas não exaustivas, nos últimos anos atraiu mais de 143 equipes e 463 modelos, reunindo empresas nacionais e internacionais renomadas como NVIDIA, Bosch, Valeo.ai, Horizon Robotics, Xiaomi Auto, Changan Auto, Huawei Yinwang, Qianli Technology, bem como universidades de prestígio como UCLA, Universidade de Toronto, EPFL, Universidade de Hong Kong e Universidade de Fudan. O desafio utiliza o Predictive Driver Model Score (PDMS) como indicador técnico principal, avaliando a capacidade de condução autônoma dos modelos submetidos por meio do cálculo abrangente de múltiplas dimensões, como risco de colisão, progresso da condução, conformidade e conforto em um horizonte de tempo fixo.










