Claude控制台新增提示词评估功能
译文 AI 逐段翻译
在开发者控制台中评估提示词
直接在 Anthropic 控制台中生成、测试和评估提示词,并带有自动测试用例生成和并排输出比较功能。
在构建人工智能驱动的应用程序时,提示词质量会显著影响结果。但制作高质量的提示词具有挑战性,需要深入了解应用程序的需求并具备大型语言模型的专业知识。为了加快开发速度并改善结果,我们简化了这一流程,使用户更容易生成高质量的提示词。
您现在可以在 Anthropic 控制台中生成、测试和评估提示词。我们添加了新功能,包括自动生成测试用例和比较输出的能力,让您能够利用 Claude 为您生成最适合您需求的响应。
生成提示词
编写一个好的提示词可以简单到向 Claude 描述一个任务。控制台提供了一个内置提示词生成器,由 Claude 3.5 Sonnet 驱动,允许您描述任务(例如“对入站客户支持请求进行分类”),并让 Claude 为您生成高质量的提示词。

您可以使用 Claude 的新测试用例生成功能为您的提示词生成输入变量——例如,一条入站客户支持消息——并运行提示词以查看 Claude 的响应。或者,您也可以手动输入测试用例。

生成测试套件
针对一系列真实世界输入测试提示词可以帮助您在生产环境部署前建立对提示词质量的信心。借助新的 Evaluate 功能,您可以直接在控制台中进行测试,而无需在电子表格或代码中手动管理测试。
手动添加或从 CSV 导入新的测试用例,或使用“生成测试用例”功能让 Claude 自动为您生成测试用例。根据需要修改测试用例,然后一键运行所有测试用例。查看并调整 Claude 对每个变量生成要求的理解,以获得对 Claude 生成的测试用例的更精细控制。

评估模型响应并迭代提示词
现在完善提示词所需的步骤更少,因为您可以创建提示词的新版本并重新运行测试套件,以快速迭代和改进结果。我们还增加了并排比较两个或多个提示词输出的功能。
您甚至可以让主题专家以 5 分制对响应质量进行评分,以查看您所做的更改是否提高了响应质量。这两项功能都提供了一种更快、更易用的方式来改进模型性能。
开始使用
测试用例生成和输出比较功能对所有 Anthropic 控制台用户开放。要了解有关如何使用 Claude 生成和评估提示词的更多信息,请查看我们的文档。
未找到项目。
0/5
电子书
常见问题解答
未找到项目。
相关文章
探索更多产品新闻和使用 Claude 构建团队的最佳实践。
2026年8月11日
合规 API 覆盖范围扩展至 Claude Cowork 和 Claude Code
企业人工智能
合规 API 覆盖范围扩展至 Claude Cowork 和 Claude Code
合规 API 覆盖范围扩展至 Claude Cowork 和 Claude Code
2026年8月5日
推理钩子:为 Claude Enterprise 提供内联数据丢失防护
企业人工智能
推理钩子:为 Claude Enterprise 提供内联数据丢失防护
推理钩子:为 Claude Enterprise 提供内联数据丢失防护
2026年8月6日
在您自己的计算资源上运行 Claude Code 会话
产品公告
2026年7月28日
将 MCP 2026-07-28 引入 Claude
产品公告
使用 Claude 改变您组织的运营方式
查看定价
联系销售
获取开发者新闻通讯
产品更新、操作指南、社区亮点等。每月发送到您的收件箱。
谢谢!您已订阅。
抱歉,您提交时出现问题,请稍后再试。