Universidade de Nova York e equipe de LeCun lançam AdaJEPA, taxa de sucesso de planejamento quase dobra
De acordo com pt.wedoany.com-A Universidade de Nova York, em parceria com a startup AMI de Yann LeCun, lançou o mais recente resultado da série JEPA, o AdaJEPA, propondo um esquema de modelo de mundo capaz de aprendizado contínuo durante a fase de implantação.
Ao contrário dos modelos de mundo anteriores, que congelam os parâmetros após o pré-treinamento, o AdaJEPA adota um mecanismo de adaptação em tempo de teste, ajustando em tempo real os parâmetros do codificador e do preditor do modelo de mundo durante a interação com o ambiente, permitindo assim o aprendizado contínuo.
O processo central do AdaJEPA é um ciclo fechado composto por planejamento, execução, observação, atualização e replanejamento. O sistema executa apenas a primeira ação planejada pelo controle preditivo do modelo e, em seguida, usa o estado do próximo quadro real fornecido pelo ambiente como um sinal de autossupervisão para atualizar o modelo de mundo online. Dessa forma, o modelo chamado no próximo ciclo de planejamento não é mais a versão congelada no momento da implantação, mas um modelo calibrado pelo ambiente atual.
Essa abordagem é semelhante à arquitetura Dyna do aprendizado por reforço clássico, onde o modelo não é treinado de uma só vez, mas é constantemente corrigido em sua compreensão do ambiente durante a interação real.

Tradicionalmente, os modelos de mundo no espaço latente baseados na rota JEPA congelam os parâmetros após o treinamento. O processo completo é: o modelo primeiro aprende a comprimir imagens de alta dimensão em um espaço latente a partir de trajetórias offline e, em seguida, prevê estados futuros nesse espaço latente. Durante a fase de teste, o controle preditivo do modelo utiliza esse modelo congelado para "imaginar" o futuro no espaço latente, otimizar a sequência de ações e executar apenas a primeira ação no ambiente real.
O desafio desse método é que, quando o ambiente muda, o modelo de mundo congelado tende a se tornar impreciso. Diante de mudanças na distribuição em tempo de teste, ações que parecem atingir o objetivo no espaço latente podem gerar desvios no ambiente real. Como o controle preditivo do modelo depende de planejamento em horizonte curto, erros de uma única etapa podem ser amplificados nas rolagens subsequentes.
Para resolver o problema acima, o artigo propõe a estrutura AdaJEPA, cujo julgamento central é que o modelo de mundo não deve permanecer fixo após o treinamento, mas, como um agente em implantação real, deve agir e calibrar-se com novas experiências simultaneamente.
O ciclo do AdaJEPA é dividido especificamente em quatro etapas. A primeira é o planejamento: o modelo codifica a observação atual em um estado latente, utiliza o modelo de mundo atual para controle preditivo, rola previsões no espaço latente e encontra uma sequência de ações mais próxima do estado alvo. A segunda é a execução: o modelo executa apenas a primeira ação e, em seguida, o ambiente real retorna a observação do próximo quadro. A terceira é a atualização: o sistema armazena essa transição de estado real em um buffer online, o modelo prevê o próximo estado latente com base na observação e na ação, alinha-o com o estado latente codificado a partir do estado real e atualiza os parâmetros por meio do cálculo do gradiente. A quarta é o replanejamento: o modelo de mundo atualizado entra imediatamente no próximo ciclo de controle preditivo.

Em detalhes de implementação, a base do AdaJEPA ainda é a arquitetura de previsão com incorporação conjunta. Ao contrário dos modelos de mundo tradicionais de previsão em nível de pixel, a arquitetura de previsão com incorporação conjunta não prevê diretamente a imagem futura, mas comprime a imagem em um espaço latente mais compacto e prevê apenas o estado futuro nesse espaço latente. O modelo inteiro é composto por três componentes principais: codificador de estado, codificador de ação e preditor.
A atualização online é realizada no espaço latente. Após cada execução de ação, o sistema armazena a transição de estado real em um buffer online, cuja capacidade padrão são as últimas N transições. Durante a atualização, o modelo prevê o estado latente do próximo momento com base na observação e ação atuais e o alinha com o estado latente codificado a partir da observação real do próximo quadro. Para evitar que a atualização online danifique a representação original, o artigo estabelece duas restrições: usar stop-gradient para a representação alvo e atualizar apenas um pequeno número de parâmetros. Nos experimentos, por padrão, apenas as últimas camadas do codificador visual e do preditor são atualizadas, e cada replanejamento do controle preditivo do modelo realiza apenas uma etapa de descida de gradiente.

Para verificar o efeito da adaptação em tempo de teste, o artigo realizou experimentos em dois benchmarks: PushT/PushObj e PointMaze. No teste de formas não vistas do PushObj, o AdaJEPA quase dobrou a taxa de sucesso de planejamento. No teste de layouts não vistos do PointMaze, a taxa de sucesso de planejamento do GD aumentou de 53,3% para 78,7%, e a do CEM aumentou de 49,3% para 70,7%.

Vale notar que a latência adicional trazida por essa atualização online é baixa. Como apenas as últimas camadas do codificador visual e do preditor são atualizadas, e cada replanejamento realiza apenas uma etapa de descida de gradiente, a latência adicional é de apenas 0,01 a 0,03 segundos. Isso indica que o AdaJEPA não troca um treinamento online pesado por um aumento na taxa de sucesso, mas adiciona um mecanismo leve de "autocalibração durante a implantação" ao modelo de mundo original.

A autora do artigo, Ying Wang, é atualmente doutoranda no CILVR Lab do Centro de Ciência de Dados da Universidade de Nova York, com foco em modelos de mundo, sob orientação de Mengye Ren e Yann LeCun. A autora Oumayma Bounou é pesquisadora de pós-doutorado na Universidade de Nova York, com interesses de pesquisa incluindo modelos de mundo, controle e otimização, atualmente colaborando com LeCun em pesquisas sobre modelos de mundo. O professor assistente de Ciência da Computação e Ciência de Dados da Universidade de Nova York, Mengye Ren, e o vencedor do Prêmio Turing, Yann LeCun, atuam como autores orientadores.
Link de referência: https://arxiv.org/pdf/2606.32026
Produtos Relacionados


Série DYJWGB-50 Dispositivo Terminal Remoto (RTU) com GPRS
Ningbo Donghai Group Co., Ltd.


Switch Industrial Nacional 100%
Shenzhen Yuhang Communication Technology Co., Ltd.

Sistema de informação inteligente
LUOYANG SHANHAI MACHINERY MANUFACTURING CO., LTD.
Terminal satelital portátil de placa Terminal portátil manual com abertura de 0,35 metros
China Starwin Science & Technology co., Ltd.



QPS- 20A Comutador Rápido de Fonte de Alimentação Redundante
CHN ENERGY ZHISHEN CONTROL TECHNOLOGY CO., LTD.








