Databricks dos EUA lança tecnologia LTAP, alegando zero cópia

2026-07-06 10:58
Favoritos

De acordo com pt.wedoany.com-A Databricks anunciou o lançamento de uma tecnologia chamada LTAP (lake transactional/analytical processing), com o slogan de marketing "um único dado, zero compromisso, zero cópia", visando resolver o desafio de coexistência entre OLTP e OLAP no mesmo sistema. A tecnologia é baseada no mecanismo de análise unificado de código aberto Apache Spark e depende de dois novos produtos: Reyden (um novo mecanismo de computação) e Lakebase (PostgreSQL sem servidor baseado em armazenamento de objetos aberto). A Databricks tenta unificar dados transacionais, analíticos, de fluxo e operacionais em uma única cópia de armazenamento do data lakehouse (combinação de data lake e data warehouse), enfrentando o desafio fundamental de que o OLTP executa leituras orientadas a linhas pequenas e gravações frequentes, enquanto o OLAP executa leituras orientadas a colunas grandes e gravações em lote. Esse problema torna-se particularmente urgente à medida que o mercado de bancos de dados busca cargas de trabalho geradas pela implantação de agentes de IA.

No entanto, há controvérsias em torno de sua alegação de "zero cópia". Engenheiros de dados apontam que, atualmente, no LTAP, os dados do PostgreSQL são armazenados localmente no formato pageserver e, em seguida, propagados para o armazenamento de objetos no formato de arquivo Parquet para persistência de longo prazo. O PostgreSQL/Lakebase pode recuperar dados do armazenamento de objetos e converter os dados Parquet de volta para o pageserver. Um comentarista de um concorrente da Databricks observou que isso é, na verdade, "dois conjuntos de dados, não um". Em uma conferência do PostgreSQL em maio deste ano, os slides dos engenheiros da Databricks Hristo Stoyanov e Jonathan Katz também confirmaram isso, mostrando que o pageserver fornece armazenamento, enquanto os executores de análise do Spark extraem arquivos de camada contendo imagens completas de páginas da camada de espelho no armazenamento de objetos. Em uma comunidade de mensagens privadas vista pelo The Register, um engenheiro da Databricks respondeu que, tecnicamente, são duas cópias, pois o pageserver atua como cache ou camada de materialização na arquitetura Neon. O Lakebase é baseado na tecnologia da Neon, adquirida pela Databricks no ano passado, oferecendo ramificações copy-on-write e computação sem servidor com escalonamento automático.

Unificar OLTP e OLAP não é uma inovação da Databricks. Em 2014, a SingleStore começou a pesquisar armazenamento em memória orientado a linhas e armazenamento em disco orientado a colunas, adotando tecnologia de armazenamento em camadas que permite análise e processamento transacional em um único sistema. Um serviço de banco de dados em nuvem lançado pela empresa em 2020 supostamente gerencia automaticamente dados em três camadas: memória, cache local e armazenamento de objetos. Em resposta à alegação da Databricks de que o processamento híbrido transacional/analítico (HTAP) falhou, o CTO da SingleStore, Nadeem Asghar, respondeu que unificar OLTP e OLAP é exatamente o objetivo do HTAP, e "renomeá-lo para LTAP apenas muda o marketing. Não muda a realidade física". Ele observou que o sistema da Databricks executa três mecanismos, cada um com seu próprio cache e julgamento sobre a atualidade dos dados, e a forma física de "dois conjuntos de dados" requer algum mecanismo para mantê-los sincronizados. Além disso, o MongoDB oferece índices de armazenamento em colunas, o HeatWave for MySQL da Oracle permite executar análises em aplicações transacionais, e a SAP promove análises em tempo real desde 2011 com base no banco de dados em memória HANA.

A Databricks insiste que sua alegação de "zero cópia" é verdadeira, pois evita duas cópias autoritativas de dados que precisam ser sincronizadas. Em uma declaração ao The Register, um porta-voz da Databricks disse que, no LTAP, os usuários operam em uma única cópia autoritativa dos dados, que possui uma única fonte de verdade no Iceberg, enquanto outras cópias internas intermediárias pertencem à "hierarquia de armazenamento do banco de dados". Em uma conferência recente, a Databricks limitou a alegação a que os dados têm apenas uma cópia "autoritativa" ou apenas uma cópia "no armazenamento", semelhante à descrição da SingleStore de que sua camada de armazenamento é "transparente para o usuário".

Andy Pavlo, professor associado de banco de dados da Universidade Carnegie Mellon, observou que, independentemente das discussões de marketing, a Databricks realizou um trabalho de engenharia impressionante ao permitir que o novo mecanismo Reyden lesse páginas do PostgreSQL. Ele afirmou que não é fácil para o mecanismo Reyden interpretar o conteúdo das páginas do PostgreSQL, pois as páginas não são completamente autocontidas, exigindo retorno ao Neon/PostgreSQL para obter metadados do catálogo. A tecnologia permite análises mais oportunas, realizadas de forma transacionalmente segura, sem esperar que os dados sejam enviados para o S3. Além disso, o Reyden é sem estado e pode ser escalado horizontalmente aumentando os recursos de computação. Pavlo também reconheceu que "no final, elas ainda copiam dados".

Este boletim é uma compilação e reprodução de informações de parceiros estratégicos e da internet global, destinado apenas para troca de informações entre leitores. Em caso de infração ou outros problemas, por favor, informe-nos imediatamente, e este site fará as devidas modificações ou exclusões. A reprodução deste artigo é estritamente proibida sem autorização formal. E-mail: news@wedoany.com