Claude skill-creator增强:测试、度量与优化Agent Skills
译文 AI 逐段翻译
改进技能创建器:测试、衡量并优化 Agent 技能
技能作者现在可以验证其技能是否有效、捕获回归问题并改进描述。
- 分类Claude Code产品公告
- 产品Claude Code
- 日期:2026年3月3日
- 阅读时间:5分钟
- 分享复制链接https://claude.com/blog/improving-skill-creator-test-measure-and-refine-agent-skills
技能创建器现在可以帮助您编写评估、运行基准测试,并 随着模型的演进保持技能的有效性。这些更新现已可在 Claude.ai 和 Cowork 中使用,并可作为Claude Code 插件,以及在我们的仓库中使用。
自去年十月推出 Agent 技能以来,我们注意到大多数作者是领域专家而非工程师。他们了解自己的工作流程,但缺少工具来判断技能是否仍适用于新模型、是否在应触发时触发,以及编辑后是否确实有所改进。
今天,我们宣布对技能创建器进行增强,帮助作者更有信心地进行构建。我们将软件开发的严谨性(测试、基准测试、迭代改进)引入技能创作,而无需任何人编写代码。
两种技能
技能通常分为两类:
能力提升技能帮助 Claude 完成基础模型无法完成或无法一致完成的任务。我们的文档创建技能就是很好的例子。它们编码了技术和方法,能够产生比单纯提示更好的输出。
编码偏好技能记录了 Claude 已经能够完成每个部分的工作流程,但技能会根据您团队的流程对它们进行排序。例如:一个按照设定标准进行 NDA 审查的技能,或者一个使用来自各种 MCP 的数据起草每周更新的技能。
这种区别很重要,因为这两种类型的技能可能需要出于不同的原因进行测试:
- 随着模型的改进,能力提升技能可能变得不那么必要。评估会告诉您何时发生这种情况。
- 编码偏好技能则更为持久,但其价值取决于对实际工作流程的忠实度。评估验证了这种忠实度。
无论哪种方式,测试都把看似有效的技能变成您似乎知晓其有效的技能。知道它有效。
使用评估来测试和改进技能
技能创建器现在可以帮助您编写评估,这些测试检查 Claude 是否对给定提示执行了预期操作。如果您编写过软件测试,您会感到熟悉:定义一些测试提示(如果需要,还包括文件),描述正确的输出是什么样的,技能创建器会告诉您技能是否经得住考验。
例如,我们的 PDF 技能以前在处理不可填写表单时遇到困难。Claude 必须在没有定义字段指导的情况下将文本放置在精确坐标处。评估隔离了失败点,我们发布了一个修复,将定位锚定到提取的文本坐标上。

评估在许多方面都有帮助,但两个重要的用途是捕获质量回归和理解模型进展。
第一,捕获质量回归。随着模型及其周围基础设施的演进,上个月运行良好的技能今天可能表现不同。在影响团队工作之前,对新模型运行评估会在变化发生时给您一个早期信号。
第二,了解通用模型能力何时超越了您的技能。这主要适用于能力提升技能。如果基础模型在没有加载技能的情况下就能通过评估,那表明该技能的技术可能已融入模型的默认行为。技能没有坏,只是不再必要。没有加载该技能,这表示该技能的技术可能已被纳入模型的默认行为中。技能没有损坏,只是不再必要了。
我们还添加了基准测试模式,使用您的评估运行标准化评估。这可以在模型更新后或您迭代技能本身时运行。它跟踪评估通过率、耗时和令牌使用量。

您的评估和结果由您保留。将它们存储在本地、集成到仪表板中,或接入 CI 系统。
通过多代理支持实现更快、更一致的评估
顺序运行评估可能很慢,且上下文累积可能在不同测试运行之间产生泄漏。技能创建器现在会启动独立代理并行运行评估,并支持多代理支持——每个代理在干净上下文中运行,有自己的令牌和计时指标。结果更快,无交叉污染。
我们还添加了比较代理用于 A/B 比较:两个技能版本,或技能与无技能。它们在不了解哪个是哪个的情况下判断输出,因此您可以判断更改是否确实有帮助。

让技能在正确的时间触发
评估衡量输出质量,但只有当您的技能在应触发时触发时才重要。随着技能数量增长,描述精确度变得至关重要:过于宽泛会导致误触发,过于狭窄则永远无法触发。技能创建器现在可以帮助您调整描述以实现更可靠的触发——它根据示例提示分析您当前描述,并建议编辑以减少误报和漏报。
我们将其应用于文档创建技能,发现 6 个公开技能中有 5 个触发效果得到改善。

展望未来
随着模型改进,“技能”和“规范”之间的界限可能会模糊。如今,SKILL.md 文件本质上是一个实施计划,提供详细说明,告诉 Claude 如何做某事。随着时间推移,用自然语言描述技能应做什么可能就足够了,模型会自己解决其余问题。如何做某事。随着时间推移,用自然语言描述什么技能应该做什么可能就足够了,模型会自己解决其余问题。
我们今天发布的评估框架就是朝着这个方向迈出的一步。评估已经描述了“什么”。最终,这个描述可能就是技能本身。
开始使用
所有技能创建器更新现已可在 Claude.ai 和 Cowork 上使用。请让 Claude 使用技能创建器来开始。
Claude Code 用户可以安装插件或从我们的仓库下载。
未找到项目。
0/5
电子书
常见问题解答
未找到项目。
相关文章
探索更多产品新闻和团队使用 Claude 的最佳实践。
2026年8月11日
合规 API 覆盖扩展到 Claude Cowork 和 Claude Code
企业 AI
合规 API 覆盖扩展到 Claude Cowork 和 Claude Code
合规 API 覆盖扩展到 Claude Cowork 和 Claude Code
2026年8月7日
自动模式现已成为Claude Code中Pro、Max和Team计划的默认模式
Claude Code
自动模式现已成为Claude Code中Pro、Max和Team计划的默认模式
自动模式现已成为Claude Code中Pro、Max和Team计划的默认模式
2026年8月5日
推理钩子:为Claude Enterprise提供内联数据丢失防护
企业AI
推理钩子:为Claude Enterprise提供内联数据丢失防护
推理钩子:为Claude Enterprise提供内联数据丢失防护
2026年8月7日
在生产环境中运行自动模式
Claude Code
通过Claude改变您组织的运营方式
查看定价
联系销售
获取开发者通讯
产品更新、操作指南、社区亮点等,每月发送至您的邮箱。
谢谢!您已订阅。
抱歉,您的提交出现问题,请稍后重试。