AI AI工具情报站
AI资讯tip

Databricks 如何在兼顾治理的前提下让 Genie Agents 同时基于结构化数据与文档运行

Databricks:Blog(RSS)2026-08-10T23:08:50.000Z

核心亮点

Databricks 让 Genie 智能体同时查询结构化表与文档,且治理不打折。难点不在“跑起来”,而在统一权限、血缘与策略管控下的安全合规执行。这对金融、医药、政务等强监管行业尤为关键,因为企业最怕智能体“查到不该查的数据”,治理是准入门槛而非附加项。

具体能力或事件经过

Databricks 介绍了一套让 Genie 智能体同时基于结构化数据与文档运行的方法。现实中,企业的知识一半躺在数据仓库的表里,一半散在 PDF、工单、邮件等文档中。让一个智能体既能写 SQL 又能读合同,历来要拆成两条流水线。Databricks 的思路是把两类源纳入同一治理边界:智能体生成的每一次查询,无论目标是表还是文档,都经过同一套鉴权与审计,避免“两套权限、两份真相”带来的合规黑洞。

技术细节

落地要跨过三道坎。其一是数据权限:表有行列级授权,文档有目录与标签授权,二者策略模型不同,需要在智能体规划阶段就做“能力最小化”裁剪,只暴露当前任务必需的子集。其二是血缘追踪:智能体可能先把文档向量化再与表 join,每一步都要记录来源与变换,否则无法回答“这个结论来自哪条数据”。其三是策略管控:哪些字段禁止出境、哪些文档仅限内网,需要以策略即代码(policy-as-code)形式注入执行引擎,而非依赖模型自觉,这样才能在审计时拿出可证明的证据链。

与竞品对比

相较 Snowflake Cortex 偏重仓库内语义查询,以及纯 RAG 框架(如 LangChain 接向量库)常把治理推给应用层,Databricks 的优势在于治理与计算同源——Unity Catalog 本就是其权限与血缘中枢,智能体天然复用这套控制面。代价是更重的平台绑定与更高的上手门槛,小团队可能觉得过重,但对于受监管的大企业恰恰是最省心的选择。

行业影响或适用场景

说白了,企业最怕智能体“能查到不该查的数据”。在金融、医药、政务等强监管场景,治理不是附加项而是准入门槛。Databricks 的这套打法把“聪明”和“守规矩”绑在一起,降低了合规团队对智能体的抵触。对想用智能体替代一部分数据分析师与合规审查的企业,这比单纯追求问答准确率更有现实意义,也更容易通过内审,让创新不至于踩到合规红线。