返回
官网 Claude 官方博客 精选 收录 2026-08-11 10:19 44

Claude skill-creator增强:测试、度量与优化Agent Skills

Anthropic为Claude Code等产品发布skill-creator增强功能,支持技能作者编写评估、运行基准测试,并在模型演进时保持技能持续有效。自去年十月推出Agent Skills以来,多数作者并非工程师,缺少工具判断技能是否兼容新模型、正确触发或改进有效。新功能将软件开发的测试、基准测试和迭代改进引入技能创作,无需编写代码。
推荐理由:涉及Data Agent技能的可测试性与评估,对Agent构建与生产评估具有直接参考价值
Data AgentAnthropicClaude

译文 AI 逐段翻译

改进技能创建器:测试、衡量并优化 Agent 技能

技能作者现在可以验证其技能是否有效、捕获回归问题并改进描述。

技能创建器现在可以帮助您编写评估、运行基准测试,并 随着模型的演进保持技能的有效性。这些更新现已可在 Claude.ai 和 Cowork 中使用,并可作为Claude Code 插件,以及在我们的仓库中使用。

自去年十月推出 Agent 技能以来,我们注意到大多数作者是领域专家而非工程师。他们了解自己的工作流程,但缺少工具来判断技能是否仍适用于新模型、是否在应触发时触发,以及编辑后是否确实有所改进。

今天,我们宣布对技能创建器进行增强,帮助作者更有信心地进行构建。我们将软件开发的严谨性(测试、基准测试、迭代改进)引入技能创作,而无需任何人编写代码。

两种技能

技能通常分为两类:

能力提升技能帮助 Claude 完成基础模型无法完成或无法一致完成的任务。我们的文档创建技能就是很好的例子。它们编码了技术和方法,能够产生比单纯提示更好的输出。

编码偏好技能记录了 Claude 已经能够完成每个部分的工作流程,但技能会根据您团队的流程对它们进行排序。例如:一个按照设定标准进行 NDA 审查的技能,或者一个使用来自各种 MCP 的数据起草每周更新的技能。

这种区别很重要,因为这两种类型的技能可能需要出于不同的原因进行测试:

  • 随着模型的改进,能力提升技能可能变得不那么必要。评估会告诉您何时发生这种情况。
  • 编码偏好技能则更为持久,但其价值取决于对实际工作流程的忠实度。评估验证了这种忠实度。

无论哪种方式,测试都把看似有效的技能变成您似乎知晓其有效的技能。知道它有效。

使用评估来测试和改进技能

技能创建器现在可以帮助您编写评估,这些测试检查 Claude 是否对给定提示执行了预期操作。如果您编写过软件测试,您会感到熟悉:定义一些测试提示(如果需要,还包括文件),描述正确的输出是什么样的,技能创建器会告诉您技能是否经得住考验。

例如,我们的 PDF 技能以前在处理不可填写表单时遇到困难。Claude 必须在没有定义字段指导的情况下将文本放置在精确坐标处。评估隔离了失败点,我们发布了一个修复,将定位锚定到提取的文本坐标上。

评估在许多方面都有帮助,但两个重要的用途是捕获质量回归和理解模型进展。

第一,捕获质量回归。随着模型及其周围基础设施的演进,上个月运行良好的技能今天可能表现不同。在影响团队工作之前,对新模型运行评估会在变化发生时给您一个早期信号。

第二,了解通用模型能力何时超越了您的技能。这主要适用于能力提升技能。如果基础模型在没有加载技能的情况下就能通过评估,那表明该技能的技术可能已融入模型的默认行为。技能没有坏,只是不再必要。没有加载该技能,这表示该技能的技术可能已被纳入模型的默认行为中。技能没有损坏,只是不再必要了。

我们还添加了基准测试模式,使用您的评估运行标准化评估。这可以在模型更新后或您迭代技能本身时运行。它跟踪评估通过率、耗时和令牌使用量。

您的评估和结果由您保留。将它们存储在本地、集成到仪表板中,或接入 CI 系统。

通过多代理支持实现更快、更一致的评估

顺序运行评估可能很慢,且上下文累积可能在不同测试运行之间产生泄漏。技能创建器现在会启动独立代理并行运行评估,并支持多代理支持——每个代理在干净上下文中运行,有自己的令牌和计时指标。结果更快,无交叉污染。

我们还添加了比较代理用于 A/B 比较:两个技能版本,或技能与无技能。它们在不了解哪个是哪个的情况下判断输出,因此您可以判断更改是否确实有帮助。

让技能在正确的时间触发

评估衡量输出质量,但只有当您的技能在应触发时触发时才重要。随着技能数量增长,描述精确度变得至关重要:过于宽泛会导致误触发,过于狭窄则永远无法触发。技能创建器现在可以帮助您调整描述以实现更可靠的触发——它根据示例提示分析您当前描述,并建议编辑以减少误报和漏报。

我们将其应用于文档创建技能,发现 6 个公开技能中有 5 个触发效果得到改善。

展望未来

随着模型改进,“技能”和“规范”之间的界限可能会模糊。如今,SKILL.md 文件本质上是一个实施计划,提供详细说明,告诉 Claude 如何做某事。随着时间推移,用自然语言描述技能应做什么可能就足够了,模型会自己解决其余问题。如何做某事。随着时间推移,用自然语言描述什么技能应该做什么可能就足够了,模型会自己解决其余问题。

我们今天发布的评估框架就是朝着这个方向迈出的一步。评估已经描述了“什么”。最终,这个描述可能就是技能本身。

开始使用

所有技能创建器更新现已可在 Claude.ai 和 Cowork 上使用。请让 Claude 使用技能创建器来开始。

Claude Code 用户可以安装插件或从我们的仓库下载。

未找到项目。

上一页

0/5

下一页

电子书

常见问题解答

未找到项目。

相关文章

探索更多产品新闻和团队使用 Claude 的最佳实践。

2026年8月11日

合规 API 覆盖扩展到 Claude Cowork 和 Claude Code

企业 AI

合规 API 覆盖扩展到 Claude Cowork 和 Claude Code

合规 API 覆盖扩展到 Claude Cowork 和 Claude Code

2026年8月7日

自动模式现已成为Claude Code中Pro、Max和Team计划的默认模式

Claude Code

自动模式现已成为Claude Code中Pro、Max和Team计划的默认模式

自动模式现已成为Claude Code中Pro、Max和Team计划的默认模式

2026年8月5日

推理钩子:为Claude Enterprise提供内联数据丢失防护

企业AI

推理钩子:为Claude Enterprise提供内联数据丢失防护

推理钩子:为Claude Enterprise提供内联数据丢失防护

2026年8月7日

在生产环境中运行自动模式

Claude Code

在生产环境中运行自动模式

在生产环境中运行自动模式

通过Claude改变您组织的运营方式

查看定价

查看定价

联系销售

联系销售

获取开发者通讯

产品更新、操作指南、社区亮点等,每月发送至您的邮箱。

谢谢!您已订阅。

抱歉,您的提交出现问题,请稍后重试。

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存