返回
RSS Databricks Blog AI 逐段翻译 发布 2026-09-04 04:20

治理不止安全:湖仓上的知识、上下文与本体

DataHot 速览

文章从医疗场景谈起,指出面向AI的数据治理不能只回答“谁能访问数据”,还要解释数据的含义、可信度以及是否适合被AI学习。文中提出DEP(Data Empowerment Program)视角:分类标签、去标识化策略、模型卡、数据契约等治理工件都是企业语义的原材料,治理应是知识、上下文和本体,而不只是安全控制。文章认为在湖仓(lakehouse)环境中,应从数据、AI、人员、产品与共享上下文五个维度统一设计治理体系,让治理成为AI运行的基础。

为什么值得关注:这篇文章把数据目录、质量、血缘等治理资产重新定义为语义基础而非合规成本,有助于数据从业者理解如何在湖仓上为AI建立可信上下文,是数据平台与语义层建设者值得关注的视角。

本文目录 9 节
  1. 治理必须通过一个视角在五个支柱上更广泛地思考
  2. 通过代理实现愿景
  3. 数据和AI构建生命周期:证明与持续上下文
  4. AI认证是门控背后的引擎
  5. 当智能体出错时,谁负责修复?
  6. 在不损害安全性的前提下进行严格测试
  7. 捕获指标,证明结果,赢得信任
  8. 不要追逐模型头条,要追逐模型经济学。
  9. 采取行动:从一个数据产品开始

译文

AI 逐段翻译

问大多数组织AI的数据治理意味着什么,你会听到一个安全答案:锁定它,限制访问,通过审计。在医疗保健中,安全是毋庸置疑的——但它并不完整。安全告诉你谁能接触数据。它没有说明数据意味着什么,数据是否可以被信任,或者AI模型是否应该从中学习

我们的数据赋权计划(DEP)从一个不同的前提开始:治理是知识、上下文和本体,而不仅仅是控制。大多数团队视为合规开销的工件,如分类标签、去标识化政策、模型卡片和数据契约,是企业数据语义的原材料。

这样看,你不是在治理和AI之间做选择,而是治理有助于构建AI。在AI时代需要实施新的治理方法。唯一的问题是,你是为了通过审计而稍后做这项工作,还是现在做以为你的AI奠定基础。

我们的目标是展示你已经完成的安全和治理工作是你的AI运行的基础。充分治理数据,AI就能以更便宜的模型运行并拥有更多信任。

治理必须通过一个视角在五个支柱上更广泛地思考

从每个治理工件都有助于语义的视角开始。每个分类标签都是一个概念。每个模型卡片都是上下文。每个数据契约都是一个共享定义。每个血缘链接都是一个关系。这样解读,你已经运行的安全栈就是你本体的初稿,而目录是它的所在之处。

治理就不再是一件事,而成为单一学科五个方面:数据本身及其控制方式、构建在其上的AI、需要理解它的人、将其带入业务的产品,以及将四者联系在一起的共享上下文。这是同一个视角,但从五个方面切入。

通过DEP,我们设想通过五个支柱来构建语义:

  • 数据治理——目录、质量、策展、血缘,并内置安全性和合规性,如PII分类、访问控制、HIPAA/GDPR以及AI特定的隐私风险。
  • 知识(AI/ML)治理——模型文档、治理和负责任AI标准,如偏见与公平性、可解释性、人工监督以及欧盟AI法案就绪。
  • 数据素养——培训、自助服务赋能、从业者认证,以及采用率、使用指标和项目ROI等KPI。
  • 数据管理——架构、数据工程和数据产品契约应包括模式协议、SLA和质量阈值,以及生产者/消费者义务。
  • 本体——词汇表、分类法、知识图谱——最终形成AI语义层。这包括LLMs的上下文、RAG基础和聊天查询准备。

通过代理实现愿景

我们的五支柱愿景如果平台不能将其转化为可操作的东西,就只是幻灯片。一旦你的治理工件以结构化、机器可读的元数据形式存在,它们就不再仅仅是文档,而成为代理的指令集。

当我们提到“代理”时,我们从两个层面思考:“构建代理”组装并交付数据产品,而“分析代理”基于它们回答业务问题;每个代理都绑定到一个数据产品。

让我们从构建代理开始。构建代理自动化数据产品从源映射到ETL、测试和去标识化再到生产发布的交付生命周期。它们所需的一切都作为受治理的元数据存在于Unity Catalog中:源到目标的映射、业务定义、分类层级、去标识化政策、数据契约和模型卡片。平台从标签、评论、认证标志、血缘和词汇表关联术语中派生。目录不仅仅是你记录治理的地方;它是代理执行所依据的运行时。

每个代理都循环工作。它从目录中读取指令;执行一个具体任务,如生成管道代码、运行测试套件、生成去标识化数据或部署认证数据集;然后将证据写回为测试结果、质量分数、血缘或变更捕获数据。如此循环。

image1.png

在实践中,我们首先排列De-ID和测试代理。它们消除了最高的风险和前期最繁重的手动工作。从回报最快的地方开始有助于早期建立动力。当我们继续循环时,没有代理会接触目录未描述的数据。

现代目录使这种方法可扩展,因为它可以自动生成列和表描述供管理员批准,自动分类敏感字段,并捕获列级血缘,而无需手动维护。人的角色从编写元数据转变为批准它,这正是人类应该做的判断性工作。

数据和AI构建生命周期:证明与持续上下文

构建代理在端到端生命周期内运作,旨在同时发布两个资产:受治理的数据产品(映射、策展、管道)和基于其运行的分析代理(语义层、提示配置、评估套件)。

这种方法标志着从管道中心工程(将数据从A点移到B点)向上下文中心工程(使数据对LLMs可理解且可操作)的根本转变。此生命周期中的门控不是只验证代码质量,而是验证语义、上下文和所有权。

两个核心属性使此框架与传统SDLC区分开来:

  • 它是自动证明的:可信度证明是交付的自然副产品,而不是事后才拼凑的审计应急。
  • 它持续改进上下文:生产行为反馈到AgentOps循环中——将失败的查询、幻觉集群和用户点踩转化为下一个迭代的语义积压。

人类管理者作为这两条轨道的责任层:智能体提议,人批准。虽然管理两条轨道上的五个门控看似会形成冗长的瓶颈,但大多数门控可以在几小时内通过。审批直接在标准开发者工具中进行。自动化测试套件在开票前附加数据质量结果、评估分数和数据血缘。正式的门控会议是调查的例外情况,而非标准操作流程。

image3.png

AI认证是门控背后的引擎

使这些门控客观而非任意的机制是AI认证。该认证直接记录在Unity Catalog中,作为自动化的、可查询的记分卡,而非手动法律证明。它在四个核心维度上管理发布资格:

  • 自动化与人工评分:治理、质量和语义分数从可查询的系统表、管道结果和评估运行中自动计算。所有权分数和最终部署标记需要明确的管理者签名。
  • 持续过期:认证是动态的。模式更改、合同更新或评估套件失败会立即撤销认证,直到检查重新运行并通过。
  • 数据层强制:访问控制通过基于属性的访问控制(ABAC)在数据层而非应用层实施。如果用户无法在SQL中查询一行,则任何智能体都不能通过向量搜索或嵌入检索它。
  • 严格边界隔离:非生产环境(SIT、回归、模型测试)仅使用合成或去标识化的数据。这确保生产环境中的PHI永远不会离开受控边界。

当智能体出错时,谁负责修复?

认证和门控证明智能体在发布时值得信赖。但治理领导者问的问题不是“它如何工作”——而是“当它给出错误答案时谁负责?”答案必须是一个具体的人名,而非指导委员会。

为了解决这个问题,每个分析智能体(例如,Databricks Genie Agent)都绑定到一个受治理的数据产品,该产品有一个指定的所有者。当智能体因底层指标定义错误而返回不正确的结果时,问题不属于AI工程团队。相反,它直接归到数据产品所有者,由其修正目录定义。将智能体绑定到领域范围的、认证的数据产品也是最大的准确性杠杆:针对认证元数据查询的专注智能体始终优于在整个企业资产中猜测的全局模型。

重要的是,这种共享指标定义是强制执行的,而非仅记录在案。一旦认证指标在目录中定义,答案智能体必须直接根据它计算。这会将静态文档转化为活跃的运行时逻辑。

责任得以落实,是因为对AI在无人值守下允许做的事情有严格限制:没有智能体在无人干预下将代码提升到生产环境、修改策略或处理未分类数据。虽然认证分数自动计算,但最终发布门控始终需要人工签名。如果目录未明确描述数据资产,系统默认抑制而非猜测。在运行时,这种故障关闭策略强制执行明确边界:

  • 对于分析智能体:不是对原始数据推测或推断上下文,而是明确拒绝回答——返回透明消息(例如,“此数据集缺少处理您的请求所需的活动认证或语义映射。”)
  • 对于构建智能体:如果在管道组装期间检测到未分类的模式或缺失的合同,执行会在达到暂存环境之前自动停止,并记录未映射资产标志以供管理者审查。

在纸上定义这些护栏很容易,但在实践中使其发挥作用,需要将模糊的治理委员会替换为四个明确且负责任的角色:

  • 数据产品所有者:对受治理产品的定义和质量负责。当答案错误时,他们是唯一的联系点。
  • 数据与AI治理工程师:将策略转换为可执行的目录元数据(分类、合同、血缘),以便规则在运行时运行,而非停留在PDF中。
  • 管理者:审查自动化发现并签署发布门控。自动化提议;管理者决定。
  • 安全/IAM:拥有分类层级和访问属性,这些自动驱动去标识化和行级权限。

在不损害安全性的前提下进行严格测试

我们描述的生命周期中隐藏着一个硬性先决条件:每个测试和评估阶段都需要真实数据来运行——而在医疗保健领域,您不能测试真实的PHI。因此,挑战变得无处不在:如何在保证安全的情况下获得真实的测试数据。

去标识化是我们保持数据分析有用且安全的方法。去标识化智能体从哪里获得知识?不是来自手工维护的电子表格。它基于企业工具已经生成的安全策略工作。流程分为三个步骤:

  • 发现 - 自动化发现扫描器和InfoSec策略引擎对敏感列和文件进行分类。
  • 整理 - 分类作为整理后的策略元数据进入目录;智能体读取该整理并执行。
  • 执行 - 摄取元数据,并生成合成数据或去标识化的源文件。符合HIPAA安全港要求,保持引用完整性,并具备分析能力。
image2.png

对于安全与IAM团队来说,这是一条双向通道。信息安全策略不再是PDF,而是变得可执行:分类级别和保留规则自动驱动去标识化。作为回报,安全团队获得了持续更新的敏感数据视图,对新发现的内容进行故障关闭保护,以及每次运行都生成审计证据的残留扫描。访问模型从始至终保持一致。由于任何代理数据检索都继承查询用户的目录授权,RAG方法无法呈现用户无权查看的行的嵌入。相同的ABAC规则同时适用于SQL和向量搜索,代理以查询用户的权限行事,而非特权服务账户。每个代理提示都记录了用于回答该提示的血统,并与数据本身处于相同的治理之下。

这才是真正的解锁:一个统一的数据、模型、嵌入和审计跟踪权限模型——而不是将数据目录与单独的模型注册表、单独的向量存储拼接在一起。治理工作成为AI基础,而非并行项目。

捕获指标,证明结果,赢得信任

注意整个生命周期一直在做什么:每个阶段、每个门禁、每个认证都在产生指标。将四个认证维度汇总为每个数据集的单一AI就绪分数,并使其可操作,而非理想化。只有当每个列都有链接到词汇表的定义且表有签署的数据契约时,语义才能达到100%;只有当指定的所有者响应问题时,所有权才能达到100%。

评分之后的结果是整个DEP计划的商业案例:指标证明AI的结果,证明赢得信任,而信任是将试点转化为日常使用的关键。没有业务用户会因为架构图美观而采用代理。他们之所以采用,是因为上周数据正确,而当数据不正确时,有责任人进行了修复。分数解释了为什么数据首先会正确:分数越高,模型需要猜测的就越少。它不需要推断列的含义、弥补重复或虚构连接——因为目录已经告知了。

image4.png

不要追逐模型头条,要追逐模型经济学。

每周都会出现更大、更昂贵的模型。以下是炒作周期所忽视的:当目录已经提供含义、质量和上下文时,模型就不必提供。对于治理数据上的报告和分析,较小或开放权重的模型足以满足大多数需求。

前沿模型往往被用来掩盖底层元数据的不足。当模式和业务规则被明确编目时,较小的领域特定模型可以以极低的token成本提供同样准确的精度。

这是一个成本与质量的选择,而非质量上限。将日常工作中的模型规模合理化,并将前沿模型支出保留给真正需要的问题,成本永远不会迫使AI暂停。修复数据,调整模型规模,保持准确性。这就是治理根基为AI战略带来的:不是更便宜的AI,而是不可阻挡的AI。

采取行动:从一个数据产品开始

不要试图一次性进行企业范围的全面改革。通过将一个数据产品完整经历整个生命周期来证明该模式:

  1. 扫描:在单个目标模式上启用自动发现扫描。
  2. 定义:在Unity Catalog中为完整性、语义和质量设置明确的认证阈值。
  3. 绑定:将一个人工智能分析代理与数据集绑定,同时绑定专用的评估套件和去标识化测试路径。
  4. 指定:指定一个单一的命名数据产品所有者,负责定义和问题解决。

一旦循环运行起来,就每次一个认证数据产品地重复该过程。安全告诉你谁能访问你的数据,但治理告诉你数据的含义以及AI是否可以信任它。

治理不是面向数据的组织前的闸门。如果做得好,它是组织下的地基。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存