Agentic应用重塑数据栈:Databricks为何押注Postgres与LTAP

Databricks提出以Postgres为底座、通过LTAP融合事务与分析,应对AI智能体对数据实时性与统一治理的苛刻需求。
随着AI智能体应用兴起,传统OLTP与OLAP分离的数据架构暴露出明显瓶颈:智能体在执行任务时需要毫秒级读写记忆与状态,而跨系统的同步延迟会直接拖慢决策循环。Databricks联合创始人Reynold Xin提出以Postgres为基石的新架构方案,核心技术理念是LTAP——让事务处理与分析处理读取同一份数据副本,从根本上消除同步间隔。与此同时,新架构将智能体记忆、应用状态和历史业务数据纳入统一权限体系,解决多系统治理碎片化的安全隐患。选择Postgres作为底座,既保留了对现有驱动、扩展和ORM工具的完整兼容,也降低了企业引入智能体数据能力的迁移成本,体现了在满足新需求与尊重既有技术投资之间的务实平衡。
智能体应用给数据栈带来的新压力
随着Agentic应用(智能体应用)的兴起,传统数据栈正面临前所未有的挑战。这类应用不再是简单地读写数据库,而是需要在运行过程中持续维护智能体记忆(agent memory)、应用状态(application state)以及历史数据,并在这三者之间频繁交互。Databricks联合创始人兼首席架构师Reynold Xin(@rxin)在一场主题分享中指出,正是这种新型工作负载,让业界不得不重新思考数据处理架构的底层设计。
智能体的工作模式与传统应用有本质区别。一个AI Agent在执行任务时,需要实时读取自己的记忆、检索历史上下文、更新当前状态,同时还可能触发对企业既有业务数据的分析查询。这种事务处理(transaction)与分析处理(analytics)高度交织的场景,恰恰是经典数据架构最难兼顾的部分。
为什么是Postgres
Xin的核心观点之一是:Postgres将成为这套新数据处理架构的基石。这个选择背后有清晰的逻辑。Postgres不仅是一个成熟稳定、生态庞大的开源关系型数据库,更重要的是它积累了海量的驱动(drivers)、扩展(extensions)和ORM工具。对于企业而言,迁移成本和兼容性往往是采用新架构的最大障碍。
基于Postgres构建,意味着新架构能够保持与现有Postgres生态的完全兼容。开发者无需更换驱动,无需重写ORM层,现有的扩展依然可用。这种"向后兼容"的设计思路,降低了企业引入智能体数据能力的门槛,也让Databricks的方案更容易被现有技术栈接纳。
Postgres之所以能成为AI基础设施领域的"隐形标准",与近年来向量数据库生态的演进密切相关。pgvector等扩展的出现,使Postgres能够原生存储和检索高维向量,这正是智能体记忆系统的核心操作——将对话历史、知识片段编码为向量后进行语义检索。与此同时,Postgres的逻辑复制(logical replication)协议已被众多云服务和数据工具广泛支持,使其天然具备作为数据流转枢纽的能力。在智能体应用中,Postgres协议兼容性意味着开发者可以用同一套连接字符串和驱动,无缝对接本地开发环境与云端生产系统,极大降低了从原型到生产的迁移摩擦。
LTAP:让事务与分析读取同一份数据
这场分享中最值得关注的技术概念是LTAP——让事务处理和分析处理从同一份数据副本中读取。长期以来,企业普遍采用OLTP(联机事务处理)和OLAP(联机分析处理)分离的架构,数据需要通过ETL或同步管道在两套系统之间流转。
这种分离架构在智能体场景下暴露出明显短板。Xin特别强调了"同步间隔(sync intervals)"的问题:在智能体记忆循环(agent memory loop)中,如果事务数据需要等待同步才能被分析查询读取,那么这个延迟就会成为整个循环的瓶颈。智能体需要基于最新状态做决策,而陈旧的数据会直接影响其表现。
LTAP的价值在于消除了这一瓶颈。当事务和分析读取同一份数据时,就不存在同步延迟,智能体可以始终基于实时、一致的数据运行。这对于需要高频读写记忆的Agent应用来说,是架构层面的根本性改善。
LTAP(Lakehouse Transaction and Analytics Processing)是对传统HTAP(Hybrid Transactional/Analytical Processing)概念的延伸与升级。HTAP的思路早在2014年前后由Gartner提出,目标同样是让一套系统同时承载事务与分析负载,代表性产品包括TiDB、SingleStore等。LTAP的差异在于它将这一能力置于湖仓(Lakehouse)架构的语境下——底层存储通常是基于开放格式(如Delta Lake)的对象存储,而非传统的行存或列存引擎。这意味着数据可以在保持低延迟写入的同时,直接被分析引擎扫描,无需维护两套物理存储。对于智能体场景而言,这一点尤为关键:Agent写入的记忆和状态条目能够毫秒级对分析查询可见,从根本上消除了传统ETL管道带来的数据新鲜度问题。
统一权限:记忆、状态与历史数据
除了性能,Xin还提到了一个常被忽视但极其重要的维度——权限治理。在智能体应用中,智能体记忆、应用状态和历史数据往往分散在不同系统里,各自维护独立的访问控制策略,这会带来安全隐患和管理复杂度。
新架构的目标是将这三类数据纳入同一套权限体系。统一权限管理不仅简化了治理,也更符合企业级应用对合规和安全的严格要求。对于处理敏感数据的企业而言,能够用一致的权限模型覆盖智能体的全部数据触点,是落地生产环境的关键前提。
智能体应用的权限治理之所以复杂,根源在于其数据触点的异构性。典型的Agent系统可能同时涉及:存储短期上下文的内存缓存(如Redis)、存储长期记忆的向量数据库、存储业务状态的关系型数据库,以及存储历史日志的数据湖。这些系统各自拥有独立的身份认证机制和访问控制模型,当一个Agent跨系统操作时,安全审计人员几乎无法从单一视图还原完整的数据访问轨迹。在受监管行业(如金融、医疗),这种碎片化的权限模型可能直接违反数据最小权限原则(Principle of Least Privilege)和审计留痕要求。将三类数据统一纳入同一权限体系,本质上是将Unity Catalog这类元数据治理能力延伸至智能体的运行时数据域。
对数据架构演进的观察
这次分享折射出一个更大的行业趋势:AI Agent正在成为驱动数据基础设施变革的新力量。过去数据栈的演进更多围绕BI分析、大数据处理展开,而今天,智能体对实时性、一致性和统一治理的苛刻要求,正在倒逼事务与分析的融合。
Databricks选择以Postgres为底座、通过LTAP打通事务与分析,体现了一种务实的路线——既要满足智能体的新需求,又要尊重企业既有技术投资。这场围绕Agentic应用的数据架构讨论,将通过现场演示和企业落地模式进一步展开,活动于11月10日至12日在线举行。
注:本文基于Databricks官方在社交平台发布的活动预告整理,具体技术细节有待官方正式资料补充。
相关推荐

无GPU也能跑大模型?老旧DDR3服务器的本地推理性价比探讨
一场Reddit讨论探讨了无GPU本地部署大模型的可行性:用老旧DDR3多路服务器靠内存带宽跑Qwen 3.8 Flash,以及4bit量化、KV缓存与上下文长度的实用权衡与电费成本争议。

拓扑域外泛化:让AI预测系统从未见过的动力学突变
NeurIPS论文提出拓扑域外泛化方法,通过特征分离与物理稀疏先验修复分层DSR模型缺陷,使AI能在不知控制参数的情况下预测系统分岔与动力学突变,适用于PLRNN和Neural ODE。

用不好AI Agent是你的错吗?破解AI工具焦虑的实用指南
用不好AI Agent是你的能力问题吗?本文从产品成熟度、使用预期和场景匹配三个角度剖析AI工具使用困境,提供破解AI焦虑的实用方法与选型建议。