Databricks VLDB2026:Agent-Native数据基础设施全解析

Databricks在VLDB 2026展示Agent-Native数据平台愿景,以Lakebase、LTAP和学习型优化器重构AI时代数据基础设施。
Databricks在VLDB 2026大会上以黄金赞助商身份系统阐述了其「Agent-Native」技术路线:当LLM驱动的AI智能体取代人类成为数据系统的主要调用方时,传统数据库在接口设计、查询优化和架构融合等层面都需要根本性重构。本次会议重点展示了三大技术方向:以AutoLiquid和Ultron为代表的学习型查询优化器,以Lakehouse//RT、Lakebase(PostgreSQL兼容存储引擎)和LTAP(湖仓事务分析融合处理)构成的统一数据技术栈,以及面向AI工作负载的系统级设计哲学转变。联合创始人Reynold Xin的主题演讲将这些技术收敛为一个核心判断:Agent时代需要同时支持事务、分析和实时流处理的融合平台,而非在现有架构上叠加AI功能。
Databricks的Agent-Native愿景
VLDB 2026正在进行中,Databricks作为黄金赞助商带来了一系列面向未来的技术创新。这家数据湖仓公司正在重新定义数据基础设施的形态,核心理念是构建「Agent-Native」(原生智能体)的数据系统。
Databricks联合创始人Reynold Xin在主题演讲中阐述了为何Agent时代需要Lakebase Postgres。这一论断背后,是对AI应用架构根本性变化的深刻洞察——当大语言模型驱动的智能体成为数据处理的主要参与者时,传统数据库架构面临的已不是优化问题,而是范式重构的挑战。

「Agent-Native」的概念源于软件架构设计的演进逻辑。传统数据系统以人类用户为中心设计接口和优化策略——SQL是人类可读的声明式语言,查询计划缓存基于人类重复操作的规律,权限模型假设用户具备主动的意图判断能力。而在以LLM为核心的Agent架构中,数据库的调用方变成了自主运行的AI程序:它们以极高频率动态生成查询、在多步推理中反复读写状态、并发执行多个子任务,且无法像人类DBA那样提前规划或人工干预异常。这要求数据系统在接口语义、并发控制、错误恢复和可观测性等层面重新设计,而不仅仅是在现有架构上叠加AI功能。
三大核心技术突破:查询优化、实时处理与统一架构
此次VLDB会议上,Databricks重点展示了三大技术方向,每一项都指向Agent时代的数据处理需求。
查询优化的革命性进展
AutoLiquid和Ultron代表了新一代查询优化器的技术方向。AutoLiquid实现了自动化的液态查询优化,能够根据工作负载特征动态调整执行策略,而非依赖静态规则。Ultron则更进一步,将机器学习深度集成到查询计划生成过程中,使优化器能够从历史执行数据中持续学习、自主进化。
两者的共同目标很明确:当查询来自AI Agent而非人类DBA时,优化器必须具备更强的自适应能力。
查询优化器的演进历史可以分为三个阶段:基于规则的优化(RBO)依赖专家预设的启发式规则;基于代价的优化(CBO)引入统计信息和代价模型来枚举执行计划;而以Ultron为代表的学习型优化器(Learned Optimizer)则尝试用机器学习模型替代或增强代价估算模块。学界在这一方向已有大量探索,包括用深度强化学习做Join顺序选择的DQ(Deep Q-Network)方法,以及用图神经网络建模查询结构的Bao等系统。工程落地的挑战在于:ML模型在训练分布之外的泛化能力有限,而生产查询的多样性远超离线训练数据,AutoLiquid试图通过持续的在线学习机制来缓解这一问题。
Lakehouse架构的三大支柱
Lakehouse//RT(实时湖仓)、Lakebase和LTAP(湖仓交易分析处理)构成了Databricks完整的技术栈:
- Lakehouse//RT 专注于低延迟流式数据处理,满足实时决策场景的需求
- Lakebase 提供PostgreSQL兼容的存储引擎,降低迁移和学习成本
- LTAP 打通事务处理和分析查询的壁垒,实现真正统一的数据平台
这三者的组合,本质上是在回答一个问题:AI Agent需要怎样的数据底座?答案是一个同时支持事务、分析和实时流处理的融合平台。
LTAP(Lakehouse Transactional-Analytical Processing)是对HTAP(混合事务/分析处理)概念的湖仓化延伸。传统HTAP系统通过在同一数据库引擎内维护行存与列存两份数据副本,实现事务与分析的并行处理,Oracle、TiDB、SingleStore均走这一路线。LTAP则将这一思想与开放表格式(如Delta Lake)结合:事务写入直接落到对象存储上的共享数据层,分析查询通过向量化引擎扫描同一份数据,无需ETL搬运。这一设计的优势在于消除数据冗余、降低一致性维护成本,但对存储层的并发控制和元数据管理提出了更高要求,也是Lakebase选择深度绑定PostgreSQL兼容协议的工程背景之一。
与学术界的深度对话
Databricks在VLDB上不仅展示产品,更重视与数据库研究社区的交流。会议现场的对话环节聚焦于一个关键命题:当查询不再由人类编写,而是由AI自动生成时,数据库需要怎样的接口和优化策略?
即将进行的技术分享涵盖多个方向:
- Lakebase架构的深度剖析
- Apache Spark Structured Streaming的最新进展
- Enzyme编译优化技术的实战应用
这些话题反映了Databricks在系统层面的持续深耕,也为学术研究提供了丰富的工程实践参考。
Apache Spark Structured Streaming是Spark在2016年引入的统一流批处理框架,其核心设计思想是将流数据处理抽象为对无界表的连续查询,底层采用微批(Micro-Batch)或持续处理(Continuous Processing)两种执行模式。与早期的Spark Streaming相比,Structured Streaming提供了端到端的Exactly-Once语义保证,并与DataFrame/Dataset API统一,大幅降低了流批一体开发的复杂度。在Agent时代,流处理的重要性进一步凸显——AI Agent的实时感知、多轮对话的状态维护、以及在线特征的低延迟计算都依赖高吞吐、低延迟的流处理能力,这也是Lakehouse//RT在Databricks整体架构中占据独立支柱地位的根本原因。
技术趋势解读:Agent时代的数据基础设施走向何方
Databricks的技术路线揭示了数据基础设施的三个重要趋势:
趋势一:智能体优先设计
传统数据库假设用户精通SQL,但在LLM驱动的Agent时代,数据库需要能够理解自然语言意图、自动生成优化查询,并提供可解释的执行计划。这不是功能层面的增强,而是设计哲学的转变。
趋势二:湖仓融合持续深化
Lakebase的推出表明,单纯的存算分离已不足以满足需求。市场需要的是一个能同时保证事务一致性、支撑大规模分析、处理实时流数据的统一平台。湖仓一体正在从概念走向成熟落地。
趋势三:优化器从规则驱动转向学习驱动
AutoLiquid和Ultron所代表的自适应优化技术,预示着查询优化将完成从基于规则到基于学习的范式迁移。优化器本身正在成为一个持续进化的智能系统。
对数据工程师的启示
对于数据工程师和架构师而言,Databricks在VLDB 2026上展示的这些创新意味着数据平台选型标准需要更新。除了传统的性能指标和成本考量,系统对AI工作负载的原生支持能力正在成为关键评估维度。
具体来说,需要关注的评估要素包括:数据库是否支持Agent友好的接口设计、查询优化器的自适应学习能力、以及平台在事务-分析-实时处理之间的融合程度。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。