Universidade de Nova York e equipe de LeCun lançam AdaJEPA, taxa de sucesso de planejamento quase dobra

2026-07-06 09:40
Favoritos

De acordo com pt.wedoany.com-A Universidade de Nova York, em parceria com a startup AMI de Yann LeCun, lançou o mais recente resultado da série JEPA, o AdaJEPA, propondo um esquema de modelo de mundo capaz de aprendizado contínuo durante a fase de implantação.

Ao contrário dos modelos de mundo anteriores, que congelam os parâmetros após o pré-treinamento, o AdaJEPA adota um mecanismo de adaptação em tempo de teste, ajustando em tempo real os parâmetros do codificador e do preditor do modelo de mundo durante a interação com o ambiente, permitindo assim o aprendizado contínuo.

O processo central do AdaJEPA é um ciclo fechado composto por planejamento, execução, observação, atualização e replanejamento. O sistema executa apenas a primeira ação planejada pelo controle preditivo do modelo e, em seguida, usa o estado do próximo quadro real fornecido pelo ambiente como um sinal de autossupervisão para atualizar o modelo de mundo online. Dessa forma, o modelo chamado no próximo ciclo de planejamento não é mais a versão congelada no momento da implantação, mas um modelo calibrado pelo ambiente atual.

Essa abordagem é semelhante à arquitetura Dyna do aprendizado por reforço clássico, onde o modelo não é treinado de uma só vez, mas é constantemente corrigido em sua compreensão do ambiente durante a interação real.

Tradicionalmente, os modelos de mundo no espaço latente baseados na rota JEPA congelam os parâmetros após o treinamento. O processo completo é: o modelo primeiro aprende a comprimir imagens de alta dimensão em um espaço latente a partir de trajetórias offline e, em seguida, prevê estados futuros nesse espaço latente. Durante a fase de teste, o controle preditivo do modelo utiliza esse modelo congelado para "imaginar" o futuro no espaço latente, otimizar a sequência de ações e executar apenas a primeira ação no ambiente real.

O desafio desse método é que, quando o ambiente muda, o modelo de mundo congelado tende a se tornar impreciso. Diante de mudanças na distribuição em tempo de teste, ações que parecem atingir o objetivo no espaço latente podem gerar desvios no ambiente real. Como o controle preditivo do modelo depende de planejamento em horizonte curto, erros de uma única etapa podem ser amplificados nas rolagens subsequentes.

Para resolver o problema acima, o artigo propõe a estrutura AdaJEPA, cujo julgamento central é que o modelo de mundo não deve permanecer fixo após o treinamento, mas, como um agente em implantação real, deve agir e calibrar-se com novas experiências simultaneamente.

O ciclo do AdaJEPA é dividido especificamente em quatro etapas. A primeira é o planejamento: o modelo codifica a observação atual em um estado latente, utiliza o modelo de mundo atual para controle preditivo, rola previsões no espaço latente e encontra uma sequência de ações mais próxima do estado alvo. A segunda é a execução: o modelo executa apenas a primeira ação e, em seguida, o ambiente real retorna a observação do próximo quadro. A terceira é a atualização: o sistema armazena essa transição de estado real em um buffer online, o modelo prevê o próximo estado latente com base na observação e na ação, alinha-o com o estado latente codificado a partir do estado real e atualiza os parâmetros por meio do cálculo do gradiente. A quarta é o replanejamento: o modelo de mundo atualizado entra imediatamente no próximo ciclo de controle preditivo.

Em detalhes de implementação, a base do AdaJEPA ainda é a arquitetura de previsão com incorporação conjunta. Ao contrário dos modelos de mundo tradicionais de previsão em nível de pixel, a arquitetura de previsão com incorporação conjunta não prevê diretamente a imagem futura, mas comprime a imagem em um espaço latente mais compacto e prevê apenas o estado futuro nesse espaço latente. O modelo inteiro é composto por três componentes principais: codificador de estado, codificador de ação e preditor.

A atualização online é realizada no espaço latente. Após cada execução de ação, o sistema armazena a transição de estado real em um buffer online, cuja capacidade padrão são as últimas N transições. Durante a atualização, o modelo prevê o estado latente do próximo momento com base na observação e ação atuais e o alinha com o estado latente codificado a partir da observação real do próximo quadro. Para evitar que a atualização online danifique a representação original, o artigo estabelece duas restrições: usar stop-gradient para a representação alvo e atualizar apenas um pequeno número de parâmetros. Nos experimentos, por padrão, apenas as últimas camadas do codificador visual e do preditor são atualizadas, e cada replanejamento do controle preditivo do modelo realiza apenas uma etapa de descida de gradiente.

Para verificar o efeito da adaptação em tempo de teste, o artigo realizou experimentos em dois benchmarks: PushT/PushObj e PointMaze. No teste de formas não vistas do PushObj, o AdaJEPA quase dobrou a taxa de sucesso de planejamento. No teste de layouts não vistos do PointMaze, a taxa de sucesso de planejamento do GD aumentou de 53,3% para 78,7%, e a do CEM aumentou de 49,3% para 70,7%.

Vale notar que a latência adicional trazida por essa atualização online é baixa. Como apenas as últimas camadas do codificador visual e do preditor são atualizadas, e cada replanejamento realiza apenas uma etapa de descida de gradiente, a latência adicional é de apenas 0,01 a 0,03 segundos. Isso indica que o AdaJEPA não troca um treinamento online pesado por um aumento na taxa de sucesso, mas adiciona um mecanismo leve de "autocalibração durante a implantação" ao modelo de mundo original.

A autora do artigo, Ying Wang, é atualmente doutoranda no CILVR Lab do Centro de Ciência de Dados da Universidade de Nova York, com foco em modelos de mundo, sob orientação de Mengye Ren e Yann LeCun. A autora Oumayma Bounou é pesquisadora de pós-doutorado na Universidade de Nova York, com interesses de pesquisa incluindo modelos de mundo, controle e otimização, atualmente colaborando com LeCun em pesquisas sobre modelos de mundo. O professor assistente de Ciência da Computação e Ciência de Dados da Universidade de Nova York, Mengye Ren, e o vencedor do Prêmio Turing, Yann LeCun, atuam como autores orientadores.

Link de referência: https://arxiv.org/pdf/2606.32026

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com