[控场AI]
· 4 分钟阅读· 2,351 字

Databricks Genie重大更新:上下文、数据接入与自动化全面升级

Databricks Genie重大更新:上下文、数据接入与自动化全面升级

Databricks Genie升级为企业数据工作流AI协作者,覆盖上下文理解、多格式接入、规范统一与自动化四大维度。

Databricks 对 AI 助手 Genie 进行了一轮系统性升级,核心变化体现在四个方向:一是将 Genie Ontology(业务本体)设为默认启用,让 AI 查询自动携带企业语义层的业务定义,提升结果准确性;二是引入工作区指令,把命名规则、口径定义等数据规范统一注入每一次提问,解决大型组织内部的一致性问题;三是大幅扩展数据接入能力,支持 Word、PDF、CSV 等多格式文件上传,并实现对 Unity Catalog 表的原生查询与权限申请;四是新增可引用历史运行记录的定时任务,满足周期性报表与指标监控的稳定性需求。这组更新的整体方向是将 Genie 从单纯问答工具升级为深度嵌入企业数据栈的 AI 协作者,强调即开即用而非复杂配置。

Databricks 的 AI 助手 Genie One 迎来一轮覆盖面颇广的功能升级,涉及上下文理解、数据接入、协作和自动化四大维度。这组更新把 Genie 从一个单纯的问答工具,推向了更贴近企业真实工作流的智能助手。下面拆解这次更新的核心变化,以及它对数据团队意味着什么。

twitter source: Genie One just got a major set of updates across context, data access, collaboration, and automation

业务感知上下文:Genie Ontology 默认启用

过去使用 AI 查询数据时,一个常见痛点是模型缺乏对企业业务语境的理解——它知道 SQL 语法,却不知道你公司里「活跃用户」或「净收入」具体指什么。这次更新中,Genie Ontology(本体)被设置为默认启用,意味着提问时自动带入业务感知的上下文。

这背后的逻辑是把企业的语义层与 AI 查询能力打通。当模型理解了数据背后的业务定义,生成的查询结果就更可能符合用户的真实意图,而不是机械地匹配字段名。对于非技术背景的业务人员来说,这降低了「问对问题」的门槛。

**本体(Ontology)**在数据领域是指对业务概念及其关系的形式化描述——它定义了「什么是活跃用户」「净收入如何计算」「哪些维度属于同一口径」等知识,相当于企业专属的语义词典。传统上,这类知识散落在数据字典、BI 层的指标定义或员工的隐性经验中,大语言模型在没有这层知识的情况下只能依赖字段名做推断,极易产生语义偏差。Genie Ontology 的作用是把企业已有的语义层(通常来自 Unity Catalog 中的表描述、指标定义或 dbt 模型注释)结构化地注入到每一次 AI 推理过程,使模型在生成 SQL 或解读结果时能对齐企业自己的业务逻辑,而非依赖通用的自然语言猜测。

工作区指令:让数据规范贯穿每一次提问

另一项值得关注的能力是 workspace instructions(工作区指令)。企业可以把自己的数据约定——比如命名规则、口径定义、过滤逻辑——配置成统一指令,让这些规范自动应用到每一个 prompt 上。

这解决的是一致性问题。在大型组织中,不同人对同一指标的理解可能存在偏差,AI 生成的结果也容易各说各话。通过工作区级别的指令统一约束,团队内部的查询输出能保持在同一套标准之下,减少后续的对齐成本。

数据接入扩展:多格式文件与 Unity Catalog 直连

这次更新明显拓宽了 Genie 能处理的数据来源。用户现在可以直接把 Word 文档、图片、CSV、电子表格和 PDF 上传进工作流,让 AI 在这些非结构化或半结构化数据上进行分析。这把 Genie 的适用场景从数据库查询延伸到了日常办公文档处理。

更关键的是对 Unity Catalog 表的原生支持。用户可以在 Genie 内部直接查询 Unity Catalog 中的表,配合 schema 预览功能快速了解表结构,并通过一键申请获取访问权限。这把数据治理和数据查询两个环节衔接起来——既保留了权限管控的安全边界,又避免了频繁跳转带来的流程摩擦。

Unity Catalog 是 Databricks 推出的统一数据与 AI 治理层,覆盖表、文件、ML 模型、函数等多类资产,提供跨工作区的细粒度权限控制、数据血缘追踪和审计日志。在 Unity Catalog 出现之前,Databricks 各工作区的权限管理相互独立,跨团队共享数据需要繁琐的手动同步。Unity Catalog 通过集中式 Metastore 将治理逻辑统一,管理员可以在一处定义「谁能访问哪张表的哪些列」,并把策略自动下发到所有关联工作区。Genie 与 Unity Catalog 的原生集成意味着用户在提问时无需离开对话界面去另行申请权限或查阅文档,整个「发现数据 → 了解结构 → 申请权限 → 开始查询」的链路得以在同一上下文中完成,大幅压缩了数据探索的摩擦成本。

自动化:可引用历史运行的定时任务

自动化部分,Genie 新增了 scheduled tasks(定时任务),支持把重复性工作设置为周期性自动执行。更有意思的设计是,这些任务可以引用过去的运行记录,从而保证输出结果的一致性。

这一点对于需要定期生成报表、监控指标的团队很实用。引用历史运行不仅省去了每次重复配置的麻烦,也让输出格式和口径在多次运行间保持稳定,减少了人工复核的负担。

更新背后的产品思路

把这几项更新放在一起看,可以读出 Databricks 对 Genie 的定位调整:从「能回答数据问题的 AI」升级为「嵌入企业数据工作流的 AI 协作者」。

上下文和工作区指令解决的是理解准确性,多格式接入和 Unity Catalog 直连解决的是数据可及性,定时任务解决的是效率与可重复性。这三类能力共同指向一个目标——让 AI 真正融入数据团队的日常运转,而不只是停留在演示阶段的炫技工具。

据 Databricks 团队成员 Youssef Mrini 的演示,这一整套功能可以在三分钟内完整走一遍,说明其设计强调的是即开即用的体验,而非复杂的配置门槛。

对数据团队意味着什么

对于已经在使用 Databricks 平台的组织,这组更新降低了业务人员自助查询数据的技术门槛,同时通过本体和工作区指令维持了数据口径的统一。对数据工程师而言,与 Unity Catalog 的深度集成意味着治理和分析可以在同一界面内完成,权限申请流程也更顺畅。

整体来看,这次升级的价值不在于单个功能有多惊艳,而在于它把分散的能力整合进了一条连贯的工作流。随着企业级 AI 助手竞争加剧,谁能更好地把 AI 嵌入现有数据栈和治理体系,谁就更可能赢得数据团队的长期使用。

分享:

相关推荐