De acordo com pt.wedoany.com-O Google lançou, em versão de pré-visualização, o recurso HNSW acelerado pelo mecanismo colunar no AlloyDB, afirmando que pode aumentar a taxa de transferência de pesquisa vetorial em até quatro vezes.

O AlloyDB é um serviço de banco de dados gerenciado pelo Google, compatível com PostgreSQL. Esta nova opção é voltada para usuários do pgvector — uma extensão do PostgreSQL para armazenar, indexar e consultar vetores de incorporação de aplicações de inteligência artificial, especialmente adequada para equipes que utilizam HNSW (Hierarchical Navigable Small World, grafo de pequeno mundo navegável hierárquico) para executar buscas aproximadas do vizinho mais próximo em conjuntos de dados muito grandes.
A nova opção utiliza o mecanismo colunar do AlloyDB — um cache em memória que armazena dados consultados com frequência em formato colunar — para manter o índice HNSW na memória, evitando assim algumas das sobrecargas do gerenciamento padrão de buffers do PostgreSQL. O Google afirma que isso melhora a taxa de transferência e a taxa de recuperação (uma métrica que mede o número de correspondências relevantes nos resultados da pesquisa). Em testes de benchmark realizados no conjunto de dados GloVe 100 Angular, com mais de 1 milhão de registros, quando a pesquisa foi limitada a 100 e a taxa de recuperação alvo era de 0,95, o número de consultas por segundo aumentou aproximadamente de 4,2 a 4,9 vezes. No mesmo nível de taxa de transferência, a taxa de recuperação também melhorou: a aproximadamente 350 consultas por segundo, com o mecanismo colunar ativado, a taxa de recuperação subiu de cerca de 0,78 para mais de 0,94, um aumento de 0,163.
Em termos de funcionamento, o PostgreSQL padrão depende do cache de buffer compartilhado para operações de índice, mesmo quando os dados já estão na memória. Esse processo ainda envolve fixação e liberação de páginas, tratamento de bloqueios, buscas na tabela de buffers e gerenciamento de uso menos recente, o que pode aumentar a latência e reduzir a eficiência durante a travessia do grafo. O AlloyDB altera esse caminho, fixando o índice HNSW do pgvector diretamente no espaço de memória do mecanismo colunar e adotando um layout de memória projetado especificamente para o padrão de travessia intensiva de ponteiros exigido pelo HNSW, contornando os gargalos comuns do gerenciador de buffers. O Google afirma que essa melhoria não se deve apenas à movimentação de dados do disco para a RAM; a comparação de base já assumia que o índice padrão do PostgreSQL estava totalmente armazenado em cache no buffer compartilhado, o que significa que o ganho de desempenho relatado vem de uma arquitetura de memória diferente, e não do cache básico.
Este lançamento reflete a crescente pressão sobre os fornecedores de bancos de dados para suportar a geração aumentada por recuperação e outras cargas de trabalho de inteligência artificial que dependem de pesquisa vetorial. Nesses sistemas, os operadores geralmente precisam equilibrar velocidade e precisão ao pesquisar milhões ou bilhões de vetores, especialmente sob tráfego de produção. Para usuários do PostgreSQL, o pgvector tornou-se uma das ferramentas mais amplamente utilizadas nesse campo, pois permite que funções vetoriais operem dentro da pilha existente de banco de dados relacional. O HNSW é um método de indexação popular no pgvector, pois oferece pesquisa aproximada com latência menor do que o método exato do k-vizinho mais próximo, embora os operadores geralmente façam algumas concessões na taxa de recuperação.
O Google posiciona o AlloyDB como um banco de dados capaz de lidar com transações relacionais, análises e pesquisa vetorial no mesmo sistema. Além do HNSW, o serviço também suporta ScaNN (outra opção de índice vetorial), enquanto a pesquisa padrão do k-vizinho mais próximo permanece disponível para usuários que necessitam de taxa de recuperação total.
Em termos de compensações operacionais, o mecanismo colunar utiliza memória, o que continua sendo uma consideração prática para operadores de banco de dados que gerenciam custos e tamanhos de instâncias. O Google afirma que, como o mecanismo armazena dados vetoriais em formato colunar compactado, o consumo de memória é limitado. O Google acredita que essa compensação pode reduzir a necessidade de infraestrutura, ao usar menos recursos computacionais para atingir um determinado nível de desempenho de pesquisa vetorial. O recurso não requer alterações no código do aplicativo, pois os usuários podem continuar usando a sintaxe SQL padrão do pgvector. Para usar o recurso, os usuários do AlloyDB devem ativar o mecanismo colunar e o sinalizador de cache de índice em suas instâncias; após criar um índice HNSW por meio do pgvector, devem adicionar esse índice ao cache do mecanismo colunar por meio de um comando SQL.
Este lançamento oferece ao Google outra forma de diferenciar o AlloyDB, em um mercado de bancos de dados cada vez mais adaptado a cargas de trabalho de inteligência artificial, onde provedores de nuvem e equipes especializadas em bancos de dados competem em taxa de transferência, latência e qualidade de pesquisa. Os benchmarks citados pelo Google foram executados em máquinas AlloyDB C4A equipadas com 16 CPUs virtuais.










