Como obter e tokenizar informações visuais de forma eficiente e com baixo consumo de energia é um desafio crítico que precisa ser urgentemente resolvido no campo do hardware de inteligência artificial (IA) física. Recentemente, a equipe dos professores Miao Feng e Liang Shijun da Universidade de Nanjing, em colaboração com a equipe da Universidade Nacional de Singapura, desenvolveu internacionalmente o primeiro chip de sensor de visão inteligente de ultrabaixo consumo que converte diretamente luz em tokens, denominado "GuangYuXin". Os tokens gerados por este chip podem ser diretamente inseridos em um codificador para realizar o reconhecimento de imagens. Os resultados da pesquisa relacionada foram publicados online no periódico acadêmico internacional Nature Sensing no dia 19.

A capacidade de percepção autônoma, raciocínio e tomada de decisão da IA física em ambientes complexos depende fortemente da capacidade dos dispositivos de borda de executar eficientemente grandes modelos de visão. No entanto, devido às limitações de consumo de energia e poder computacional, os dispositivos de borda têm dificuldade em realizar o reconhecimento visual em tempo real localmente.
"No pipeline tradicional de percepção visual, o sinal de luz precisa passar por múltiplos processos, como captura pelo sensor de imagem, conversão analógico-digital, transferência de buffer, particionamento digital e incorporação, antes de gerar tokens processáveis pelo modelo. A transferência frequente de grandes volumes de dados redundantes resulta em alto consumo de energia na borda", explicou Miao Feng. "Esperamos realizar a tokenização diretamente no sensor, contornando esse caminho no nível físico."
Neste estudo, a equipe propôs pioneiramente, em âmbito internacional, antecipar o processo de geração de tokens para o sensor, realizando diretamente no sensor funções como captura de imagem, particionamento de imagem e incorporação de blocos de imagem.
Liang Shijun afirmou que o chip "GuangYuXin" desenvolvido pela equipe é composto por uma matriz de armazenamento fotossensível e circuitos de endereçamento periféricos. A equipe primeiro construiu uma matriz de armazenamento fotossensível baseada em fototransistores de porta flutuante de dissulfeto de molibdênio de camada única. Cada pixel na matriz possui funções triplas de fotossensibilidade, armazenamento e computação analógica. Após a escrita do sinal de luz, ele é armazenado in situ na forma de carga de porta flutuante. Os circuitos de endereçamento periféricos podem ativar seletivamente regiões de pixels para realizar o particionamento da imagem. Para os blocos de imagem selecionados, o chip aplica ainda uma sequência específica de tensões, permitindo que as informações de luz armazenadas no bloco de imagem e a matriz de incorporação realizem operações de multiplicação e acumulação no domínio analógico, sendo a corrente de saída o token.
"Implementamos no chip o cálculo físico de 'entra luz, sai token diretamente', eliminando fundamentalmente a transferência de dados, que é a maior fonte de consumo de energia", explicou Liang Shijun. Esse método de "tokenização física" transforma o chip de um registrador passivo de imagens em um gerador ativo de semântica visual. A taxa de reconhecimento do sistema de arquitetura de conversão visual baseado no "GuangYuXin" atingiu 87,3%, próxima da linha de base de reconhecimento de software tradicional, e a eficiência energética na fase de tokenização foi melhorada em mais de 10 vezes em comparação com soluções tradicionais.
Miao Feng afirmou que esse resultado subverte fundamentalmente o paradigma serial de "primeiro fotossensibilizar, depois armazenar em buffer e, por fim, calcular", abrindo uma nova dimensão para superar o teto de poder computacional e consumo de energia da IA de borda na era pós-Moore. Essa tecnologia tem potencial para fornecer uma base de cognição visual de alta eficiência energética e latência quase zero para áreas como inteligência incorporada, drones de baixa altitude e segurança inteligente, acelerando a aplicação em larga escala da IA física.