Google dos EUA lança modelo Gemini Robotics 2 para robôs humanoides
2026-07-31 14:24
Favoritos

De acordo com pt.wedoany.com-O laboratório de pesquisa em inteligência artificial DeepMind (Google DeepMind), da Alphabet Inc., lançou hoje a série de modelos Gemini Robotics 2. Projetada para robôs humanoides, a série permite que múltiplos robôs autônomos colaborem na execução de uma única tarefa e pode executar automaticamente tarefas domésticas que envolvem centenas de etapas.

Atualmente, os robôs humanoides convencionais adotam uma arquitetura de IA de dois sistemas: o modelo de raciocínio incorporado é responsável por elaborar o plano de alto nível para a execução da tarefa, enquanto o modelo VLA converte o plano em instruções de baixo nível para os motores do robô. O núcleo da série Gemini Robotics 2 é um modelo de raciocínio incorporado chamado Gemini Robotics ER 2, que permite aos usuários descrever em linguagem natural as tarefas que o robô deve executar. Segundo o Google, o ER 2 pode suportar tarefas que envolvem centenas de etapas e duram vários minutos.

O ER 2 pode dividir tarefas longas entre vários robôs diferentes para acelerar a conclusão, e seu recurso de chamada de ferramentas permite que o modelo acesse serviços externos em nuvem, como usar a pesquisa do Google para esclarecer partes incompreensíveis do prompt.

Para atender à necessidade de robôs humanoides repetirem tarefas que falharam, os engenheiros equiparam o ER 2 com dois recursos. Primeiro, o modelo pode usar imagens capturadas pelas próprias câmeras do robô para acompanhar o progresso da tarefa; quando ocorre um erro, ele identifica a última etapa concluída corretamente e continua de onde parou, evitando refazer tudo do zero. Segundo, o ER 2 é superior aos modelos anteriores na avaliação do momento de conclusão da tarefa — quanto mais cedo o robô confirma que uma tarefa terminou, mais rápido ele pode passar para a próxima; esse recurso também ajuda a simplificar etapas como a identificação e correção de erros.

Os engenheiros do Google, Steven Hansen e Peng Xu, explicaram no blog da empresa que, ao assistir a fluxos contínuos de vídeo, o robô pode acompanhar seu próprio progresso, ajustar-se quando surgem problemas e determinar claramente quando avançar para a próxima etapa.

Após elaborar o plano de ação, o ER 2 pode enviar instruções a um dos outros dois modelos VLA da série Gemini Robotics 2. O primeiro modelo, chamado Gemini Robotics 2, pode controlar todas as partes do corpo do robô humanoide, não apenas as mãos, otimizando o centro de gravidade do robô hospedeiro para reduzir o risco de quedas, além de suportar uma variedade maior de manipuladores do que o software anterior do DeepMind.

O segundo modelo VLA, chamado Gemini Robotics On-Device 2, é projetado para ser executado diretamente no computador de bordo do robô humanoide, podendo ser adaptado a novos robôs com apenas algumas horas de treinamento. Os desenvolvedores podem acessar o ER 2 por meio do Google Cloud, da API Gemini e do Google AI Studio.

Junto com o lançamento dos modelos, o Google também apresentou um novo benchmark de segurança para IA incorporada, o ASIMOV-Agentic Benchmark, para avaliar a capacidade de robôs humanoides de evitar riscos como colisões.

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com