返回
RSS Databricks Blog AI 逐段翻译 发布 2026-09-02 09:30

Databricks发布AgentOps实践指南《Big Book of AgentOps》

DataHot 速览

Databricks发布《Big Book of AgentOps》,系统阐述AgentOps——在生产环境中构建、部署和迭代AI代理的运营纪律。该指南将架构、评估、可观测性、治理、安全和成本管理整合为可重复流程,并列出团队在可靠性、可追溯性、权限控制、成本和上线决策等关键问题。文章指出AgentOps是MLOps、LLMOps之后的新阶段,并援引FactSet等客户实践说明其价值。

为什么值得关注:数据从业者应关注AgentOps:它从模型能力转向生产级Agent的架构、评估、观测、治理与成本管理,是Data Agent落地的关键方法论。

本文目录 20 节
  1. 什么是AgentOps?
  2. 为什么AI代理需要AgentOps?
  3. 《AgentOps大手册》的内容
  4. 1. 理解AI代理架构
  5. 2. AI代理部署架构模式
  6. 3. AgentOps项目生命周期
  7. 4. 将DevOps原则应用于AI代理
  8. 5. 如何运维AI代理
  9. 6. 管理生产AI代理的利益相关者
  10. 生产 AI 智能体的 AgentOps 最佳实践
  11. 从简单的 AI 智能体架构开始
  12. 从第一天起就建立 AI 智能体评估
  13. 统一 AI 智能体的可观测性和治理
  14. 适合谁阅读
  15. 在 Databricks 上开始使用 AgentOps
  16. AgentOps 常见问题解答
  17. 什么是 AgentOps?
  18. 为什么 AI 智能体需要 AgentOps?
  19. 《AgentOps 大全》涵盖了什么?
  20. 我如何开始在 Databricks 上使用 AgentOps?

译文

AI 逐段翻译

什么是AgentOps?

AgentOps是在生产环境中构建、部署和改进AI代理的运营纪律。它将架构、评估、可观测性、治理、安全性和成本管理整合到一个团队可以重复的流程中。

AI代理不仅仅是产生响应的模型。代理可以在运行时选择工具、检索企业数据、调用API,并自主完成多步骤任务。这些能力中的每一项都可能出错,例如错误的工具调用、过宽的权限或无人计划到的成本激增。

AgentOps的存在是为了防止这种复杂性成为负担。如果做得好,它能让系统足够可靠,使人们信任它,并且足够简单,让团队能够实际运行它。

为什么AI代理需要AgentOps?

生成式AI从实验阶段进入企业领域的速度比大多数技术浪潮都要快。接下来的挑战是将有前景的试点项目转变为人们可以依赖的系统。

大多数团队在相同的运营问题上停滞不前:

  • 代理是否为此任务产生了正确的结果?
  • 我们能否追踪它做了什么,包括它使用的工具和数据?
  • 我们如何控制对敏感数据和操作的访问?
  • 一旦请求触发多次模型调用、重试或护栏检查,成本将是多少?
  • 谁决定代理准备好发布,谁在其上线后监控?

回答这些问题需要的不仅仅是一个更强大的模型。它需要代理本身的运营模式。

这是熟悉的领域。MLOps随着团队将机器学习模型从笔记本带入生产环境而成熟。LLMOps紧随其后,增加了提示和模型版本管理、分布式服务和成本控制等实践。AgentOps是下一层,将该纪律扩展到能够推理、使用工具并自主采取行动的系统。

生产级代理需要对其工具可触及的边界有明确的界限,有多步骤执行的可追溯记录,有衡量质量的方法,有发生故障时的计划,以及工程、产品、安全、合规和财务之间的足够协调,以免发布时出现意外。

客户体验证实了这一点。FactSet的文本到代码知识代理从一个基础模型演变为完整的代理系统,准确率提高了44%。阅读FactSet的故事

《AgentOps大手册》编纂了帮助企业团队实现这一转变的实践:架构模式、分阶段交付管道、评估和反馈循环、治理、成本管理以及决定代理是否真正投入生产的利益相关者决策。

《AgentOps大手册》的内容

本书通过六章从概念到实施。

1. 理解AI代理架构

代理不同于提示-响应的LLM调用。

日志记录、评估门禁、治理、回滚和监控都很重要,但需求因四种代理架构而异。我们概述了每种架构及其对应的运营要求,以便参考。

此外,同样重要的是阻碍试点项目交付的反模式:从一个过于宽泛的用例开始,在复杂性变得合理之前就采用多代理编排,不必要的推理循环,以及评估被推迟到不应推迟的时间。我们分享了常见的列表,以避免类似错误。

2. AI代理部署架构模式

部署架构根据用例和组织需求从简单到复杂。我们涵盖四种部署模式,从单个Databricks工作区部署到最复杂的设置:多账户、多代理的企业拓扑。每种模式都附有指导,说明如何根据需求变化选择模式和演进。在每个阶段,Unity CatalogUnity GatewayMLflow仍然是支持架构的核心。

3. AgentOps项目生命周期

一个七阶段的路线图,从如何组建团队、选择用例,到设置数据基础设施、评估循环和治理最佳实践。

我们强调每个阶段的重要事项。例如,成本是生命周期的重要组成部分。考虑到子代理、重试和护栏检查,单个用户请求可能触发多次模型调用。这使得归因使用、设置限制和建立明确的支出问责制至关重要。

4. 将DevOps原则应用于AI代理

团队需要快速迭代以开发高质量的代理。他们还需要根据研究前沿的发展和组织不断变化的需求来演进代理。为此,我们强调了从《DevOps手册》中借鉴的流动、反馈和持续学习原则,为运营AI代理系统提供了有用的基础。《DevOps手册》为运营AI代理系统提供了有用的基础。

将这些原则应用于代理系统意味着从真实轨迹构建黄金评估数据集,根据主题专家反馈校准自动评判器,并使用评估结果驱动后续构建。一个客户电子邮件代理的实例展示了人工审查、基于模型的评判和基于规则的检查协同工作,而无需将每次发布都变成手动审计。

5. 如何运维AI代理

一个六步规划序列帮助团队将精力投入到真正改变结果的地方:映射人工工作流程,将其转化为技术架构,按角色定义可观测性需求,将追踪设计到系统中,映射数据访问控制到数据和工具,并确定可以重用的内容。

一个电信客户支持代理将该序列付诸实践,包括数据模式、计费子代理可用的工具以及精细的控制,确保一个客户永远不会看到另一个客户的数据。

6. 管理生产AI代理的利益相关者

好的工程并不能保证智能体进入生产环境。许多技术上健全的项目反而因为人的问题而停滞。

生产就绪取决于利益相关者在整个组织中的一致性,从执行发起人和产品负责人到 SME、安全、合规和财务。本节提供了一个实用的 RACI 矩阵,明确了最容易卡住决策的所有权,并建议了发布前后项目阶段的沟通节奏。这些团队流程确保了紧密的 SME 反馈循环,发布后的运营监控和审查顺利进行,项目长期创造价值。

生产 AI 智能体的 AgentOps 最佳实践

从简单的 AI 智能体架构开始

在考虑编排之前,选择一个定义明确、具有清晰成功指标的用例。尽早将工作原型展示给利益相关者。让所学到的经验,而不是预先制定的路线图,决定下一步构建什么。

DXC Technology 在扩展其 AI 产品组合时采用了这条路径。该公司现在有三个 AI 智能体在生产中运行,还有八个处于试点或开发阶段,并在迁移到 Databricks 后将平台的总拥有成本降低了 30%。阅读 DXC Technology 案例

从第一天起就建立 AI 智能体评估

评估让团队能够自信地交付智能体,并在之后安全地持续更新。从让 SME 审查真实跟踪开始,而不是少数精选的聊天提示。这种人工判断能发现失败模式,构建代表性的评估集,并校准最终接管常规检查的自动化评判器。

Databricks 直接将这构建到平台中:智能体评估、AI 辅助评判器和基于跟踪的分析,让团队能够发现问题、深入分析根本原因并在重新部署前测试修复。

洲际交易所(ICE) 在一个受治理的文本到 SQL 应用程序中应用了这一点,该应用使用财务数据回答业务问题,在约 50 个查询中实现了 77% 的语法准确率和 96% 的执行匹配率。

统一 AI 智能体的可观测性和治理

随着智能体数量的增长,驻留在单个应用程序中的控制措施变得难以审计。平台方法为团队提供了一个管理数据访问、模型和工具使用、跟踪、评估和策略执行的地方,而不是为每个新智能体重建治理。

在 Databricks 上,该基础是 MLflow 用于评估和跟踪,Unity Gateway 用于模型和工具流量,以及 Unity Catalog 用于跨数据和 AI 资产的受治理发现、权限、沿袭和访问控制。

Block 是一个很好的例子,说明了受治理的基础能带来什么。其 Databricks 环境支持 AI 和运营用例,Unity Catalog 管理跨业务部门的数据访问。Databricks 报告称,Block 的面向卖家运营的 AI 智能体系统带来了 1000 万美元的生产力提升。

适合谁阅读

《AgentOps 大全》是为任何负责将 AI 智能体投入生产或在其上线后保持运行的人编写的:

  • 构建和运营智能体系统的 AI、数据、软件和平台工程师
  • 对结果负责的产品经理和业务负责人
  • 定义“好”的标准并审查实际行为的 SME
  • 负责安全部署的安全、合规和风险团队
  • 跟踪使用情况、成本和规模的财务和 FinOps 团队

任何其用户依赖智能体行为的人都应该把这本书放在手边。

在 Databricks 上开始使用 AgentOps

阅读完整电子书 以深入了解,并探索生产 AI 智能体背后的平台能力:

AgentOps 常见问题解答

什么是 AgentOps?

它是一套实践,用于构建、评估、部署、治理、观察和改进在线上运行的 AI 智能体,以及让系统可靠地推理、使用工具和采取行动的运营纪律。

为什么 AI 智能体需要 AgentOps?

因为在请求进入和答案输出之间可能发生很多事情:工具调用、检索、权限检查、重试和编排。这些都会影响质量、风险、延迟或成本,如果您只盯着模型的最终输出,这些都不会显现出来。

《AgentOps 大全》涵盖了什么?

智能体格局和反模式、部署架构、七阶段项目流程、评估和反馈循环、适用于非确定性系统的 DevOps 实践、高杠杆规划活动以及利益相关者管理。

我如何开始在 Databricks 上使用 AgentOps?

选择一个范围狭窄、具有可衡量成功标准的用例。根据真实示例构建评估集,跟踪智能体的实际操作,应用最小权限治理,并在扩展到更复杂的编排之前确定运营节奏。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存