Databricks发布AgentOps实践指南《Big Book of AgentOps》
DataHot 速览
Databricks发布《Big Book of AgentOps》,系统阐述AgentOps——在生产环境中构建、部署和迭代AI代理的运营纪律。该指南将架构、评估、可观测性、治理、安全和成本管理整合为可重复流程,并列出团队在可靠性、可追溯性、权限控制、成本和上线决策等关键问题。文章指出AgentOps是MLOps、LLMOps之后的新阶段,并援引FactSet等客户实践说明其价值。
为什么值得关注:数据从业者应关注AgentOps:它从模型能力转向生产级Agent的架构、评估、观测、治理与成本管理,是Data Agent落地的关键方法论。
本文目录 20 节
- 什么是AgentOps?
- 为什么AI代理需要AgentOps?
- 《AgentOps大手册》的内容
- 1. 理解AI代理架构
- 2. AI代理部署架构模式
- 3. AgentOps项目生命周期
- 4. 将DevOps原则应用于AI代理
- 5. 如何运维AI代理
- 6. 管理生产AI代理的利益相关者
- 生产 AI 智能体的 AgentOps 最佳实践
- 从简单的 AI 智能体架构开始
- 从第一天起就建立 AI 智能体评估
- 统一 AI 智能体的可观测性和治理
- 适合谁阅读
- 在 Databricks 上开始使用 AgentOps
- AgentOps 常见问题解答
- 什么是 AgentOps?
- 为什么 AI 智能体需要 AgentOps?
- 《AgentOps 大全》涵盖了什么?
- 我如何开始在 Databricks 上使用 AgentOps?
译文
AI 逐段翻译什么是AgentOps?
AgentOps是在生产环境中构建、部署和改进AI代理的运营纪律。它将架构、评估、可观测性、治理、安全性和成本管理整合到一个团队可以重复的流程中。
AI代理不仅仅是产生响应的模型。代理可以在运行时选择工具、检索企业数据、调用API,并自主完成多步骤任务。这些能力中的每一项都可能出错,例如错误的工具调用、过宽的权限或无人计划到的成本激增。
AgentOps的存在是为了防止这种复杂性成为负担。如果做得好,它能让系统足够可靠,使人们信任它,并且足够简单,让团队能够实际运行它。
为什么AI代理需要AgentOps?
生成式AI从实验阶段进入企业领域的速度比大多数技术浪潮都要快。接下来的挑战是将有前景的试点项目转变为人们可以依赖的系统。
大多数团队在相同的运营问题上停滞不前:
- 代理是否为此任务产生了正确的结果?
- 我们能否追踪它做了什么,包括它使用的工具和数据?
- 我们如何控制对敏感数据和操作的访问?
- 一旦请求触发多次模型调用、重试或护栏检查,成本将是多少?
- 谁决定代理准备好发布,谁在其上线后监控?
回答这些问题需要的不仅仅是一个更强大的模型。它需要代理本身的运营模式。
这是熟悉的领域。MLOps随着团队将机器学习模型从笔记本带入生产环境而成熟。LLMOps紧随其后,增加了提示和模型版本管理、分布式服务和成本控制等实践。AgentOps是下一层,将该纪律扩展到能够推理、使用工具并自主采取行动的系统。
生产级代理需要对其工具可触及的边界有明确的界限,有多步骤执行的可追溯记录,有衡量质量的方法,有发生故障时的计划,以及工程、产品、安全、合规和财务之间的足够协调,以免发布时出现意外。
客户体验证实了这一点。FactSet的文本到代码知识代理从一个基础模型演变为完整的代理系统,准确率提高了44%。阅读FactSet的故事。
《AgentOps大手册》编纂了帮助企业团队实现这一转变的实践:架构模式、分阶段交付管道、评估和反馈循环、治理、成本管理以及决定代理是否真正投入生产的利益相关者决策。
《AgentOps大手册》的内容
本书通过六章从概念到实施。
1. 理解AI代理架构
代理不同于提示-响应的LLM调用。
日志记录、评估门禁、治理、回滚和监控都很重要,但需求因四种代理架构而异。我们概述了每种架构及其对应的运营要求,以便参考。
此外,同样重要的是阻碍试点项目交付的反模式:从一个过于宽泛的用例开始,在复杂性变得合理之前就采用多代理编排,不必要的推理循环,以及评估被推迟到不应推迟的时间。我们分享了常见的列表,以避免类似错误。
2. AI代理部署架构模式
部署架构根据用例和组织需求从简单到复杂。我们涵盖四种部署模式,从单个Databricks工作区部署到最复杂的设置:多账户、多代理的企业拓扑。每种模式都附有指导,说明如何根据需求变化选择模式和演进。在每个阶段,Unity Catalog、Unity Gateway和MLflow仍然是支持架构的核心。
3. AgentOps项目生命周期
一个七阶段的路线图,从如何组建团队、选择用例,到设置数据基础设施、评估循环和治理最佳实践。
我们强调每个阶段的重要事项。例如,成本是生命周期的重要组成部分。考虑到子代理、重试和护栏检查,单个用户请求可能触发多次模型调用。这使得归因使用、设置限制和建立明确的支出问责制至关重要。
4. 将DevOps原则应用于AI代理
团队需要快速迭代以开发高质量的代理。他们还需要根据研究前沿的发展和组织不断变化的需求来演进代理。为此,我们强调了从《DevOps手册》中借鉴的流动、反馈和持续学习原则,为运营AI代理系统提供了有用的基础。《DevOps手册》为运营AI代理系统提供了有用的基础。
将这些原则应用于代理系统意味着从真实轨迹构建黄金评估数据集,根据主题专家反馈校准自动评判器,并使用评估结果驱动后续构建。一个客户电子邮件代理的实例展示了人工审查、基于模型的评判和基于规则的检查协同工作,而无需将每次发布都变成手动审计。
5. 如何运维AI代理
一个六步规划序列帮助团队将精力投入到真正改变结果的地方:映射人工工作流程,将其转化为技术架构,按角色定义可观测性需求,将追踪设计到系统中,映射数据访问控制到数据和工具,并确定可以重用的内容。
一个电信客户支持代理将该序列付诸实践,包括数据模式、计费子代理可用的工具以及精细的控制,确保一个客户永远不会看到另一个客户的数据。
6. 管理生产AI代理的利益相关者
好的工程并不能保证智能体进入生产环境。许多技术上健全的项目反而因为人的问题而停滞。
生产就绪取决于利益相关者在整个组织中的一致性,从执行发起人和产品负责人到 SME、安全、合规和财务。本节提供了一个实用的 RACI 矩阵,明确了最容易卡住决策的所有权,并建议了发布前后项目阶段的沟通节奏。这些团队流程确保了紧密的 SME 反馈循环,发布后的运营监控和审查顺利进行,项目长期创造价值。
生产 AI 智能体的 AgentOps 最佳实践
从简单的 AI 智能体架构开始
在考虑编排之前,选择一个定义明确、具有清晰成功指标的用例。尽早将工作原型展示给利益相关者。让所学到的经验,而不是预先制定的路线图,决定下一步构建什么。
DXC Technology 在扩展其 AI 产品组合时采用了这条路径。该公司现在有三个 AI 智能体在生产中运行,还有八个处于试点或开发阶段,并在迁移到 Databricks 后将平台的总拥有成本降低了 30%。阅读 DXC Technology 案例。
从第一天起就建立 AI 智能体评估
评估让团队能够自信地交付智能体,并在之后安全地持续更新。从让 SME 审查真实跟踪开始,而不是少数精选的聊天提示。这种人工判断能发现失败模式,构建代表性的评估集,并校准最终接管常规检查的自动化评判器。
Databricks 直接将这构建到平台中:智能体评估、AI 辅助评判器和基于跟踪的分析,让团队能够发现问题、深入分析根本原因并在重新部署前测试修复。
洲际交易所(ICE) 在一个受治理的文本到 SQL 应用程序中应用了这一点,该应用使用财务数据回答业务问题,在约 50 个查询中实现了 77% 的语法准确率和 96% 的执行匹配率。
统一 AI 智能体的可观测性和治理
随着智能体数量的增长,驻留在单个应用程序中的控制措施变得难以审计。平台方法为团队提供了一个管理数据访问、模型和工具使用、跟踪、评估和策略执行的地方,而不是为每个新智能体重建治理。
在 Databricks 上,该基础是 MLflow 用于评估和跟踪,Unity Gateway 用于模型和工具流量,以及 Unity Catalog 用于跨数据和 AI 资产的受治理发现、权限、沿袭和访问控制。
Block 是一个很好的例子,说明了受治理的基础能带来什么。其 Databricks 环境支持 AI 和运营用例,Unity Catalog 管理跨业务部门的数据访问。Databricks 报告称,Block 的面向卖家运营的 AI 智能体系统带来了 1000 万美元的生产力提升。
适合谁阅读
《AgentOps 大全》是为任何负责将 AI 智能体投入生产或在其上线后保持运行的人编写的:
- 构建和运营智能体系统的 AI、数据、软件和平台工程师
- 对结果负责的产品经理和业务负责人
- 定义“好”的标准并审查实际行为的 SME
- 负责安全部署的安全、合规和风险团队
- 跟踪使用情况、成本和规模的财务和 FinOps 团队
任何其用户依赖智能体行为的人都应该把这本书放在手边。
在 Databricks 上开始使用 AgentOps
阅读完整电子书 以深入了解,并探索生产 AI 智能体背后的平台能力:
AgentOps 常见问题解答
什么是 AgentOps?
它是一套实践,用于构建、评估、部署、治理、观察和改进在线上运行的 AI 智能体,以及让系统可靠地推理、使用工具和采取行动的运营纪律。
为什么 AI 智能体需要 AgentOps?
因为在请求进入和答案输出之间可能发生很多事情:工具调用、检索、权限检查、重试和编排。这些都会影响质量、风险、延迟或成本,如果您只盯着模型的最终输出,这些都不会显现出来。
《AgentOps 大全》涵盖了什么?
智能体格局和反模式、部署架构、七阶段项目流程、评估和反馈循环、适用于非确定性系统的 DevOps 实践、高杠杆规划活动以及利益相关者管理。
我如何开始在 Databricks 上使用 AgentOps?
选择一个范围狭窄、具有可衡量成功标准的用例。根据真实示例构建评估集,跟踪智能体的实际操作,应用最小权限治理,并在扩展到更复杂的编排之前确定运营节奏。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏