Thomson Reuters如何用Claude构建高风险专业AI
DataHot 速览
Thomson Reuters在Claude平台分享为高风险专业场景构建AI的经验,涉及法律、税务等领域的AI应用实践,强调准确性与可靠性。文章探讨了如何将Claude集成到专业工作流中,并确保输出的可信度。这对数据与AI从业者理解专业领域AI落地具有参考价值。
为什么值得关注:展示了在专业高风险场景中构建AI的实践,对数据与AI从业者有借鉴意义。
译文
AI 逐段翻译汤森路透,一家全球性的内容和技术公司,花了超过175年的时间,为做出重大决策的专业人士和机构建立值得信赖的内容和技术。如今,同样的使命正在塑造该公司如何为法律、税务、会计、合规以及其他高风险专业工作流构建人工智能。
“我们是一家专注于要求准确性和精确性的专业领域的技术公司,”汤森路透首席技术官乔尔·赫伦说。
其产品是这些专业所依赖的参考工具:用于法律研究和实践指导的Westlaw和Practical Law,以及汤森路透专业级法律AI平台CoCounsel Legal,旨在让法律专业人士在工作中更加出色,提供他们可以捍卫的答案和带来真正价值的成果。赫伦在四年前加入汤森路透,当时他的初创公司被该公司收购,他在产品、技术和战略的交汇处工作。他说,在那段时间里,人工智能已经重塑了构建软件的意义。选择正确的技术合作伙伴从未如此重要。
选择哪些LLM来驱动这些产品的标准异常具体。赫伦和他的团队评估一个新模型时,会问它的工作能否经受住律师在工作中依赖之前进行的那种专业审查。
为法律工作评估模型
许多公司可以构建法律AI工具,但能构建律师愿意以其名义背书的工具的却少得多。汤森路透为专业AI带来了通用系统难以复制的三大优势:权威内容、深厚的领域专业知识和工作流集成。
赫伦说,律师能够依赖Westlaw答案的原因不在于模型本身。而是数十年精心整理的判例法、全球2700多名领域专家每天对这些内容进行注释和增强的工作,以及汤森路透在Claude等模型之上构建的评估。“那位人类专业人士仍然是对最终工作产品负责的人。”
Claude是一个有价值的模型伙伴,但专业级系统来自于Anthropic的前沿模型与汤森路透的权威内容、深厚领域专业知识、工作流集成和评估基础设施的结合。
汤森路透将这种方法描述为Fiduciary-Grade AI™:一种以权威内容为基础、由深厚领域专业知识塑造、并直接嵌入专业工作流的人工智能,因此在风险高时,输出透明、可验证且可辩护。
这种责任意味着,在这里,验证比流畅性更重要。汤森路透围绕为“不仅仅是搜索和检索,还包括引文验证和核查”而调优的代理,重建了法律研究。要求是一个帮助验证引文并清晰显示来源的系统,以便专业人士能够有信心地进行审查、验证和应用他们的判断。
这一变化体现在客户的反馈中。赫伦说,那些“需要数十小时”的研究现在“几分钟内”就能完成,给专业人士一个高质量的起点,他们可以评估、完善并采取行动。“深度研究已经彻底改变了对法律研究的思考方式。”
构建代理优先的产品
对于汤森路透而言,构建代理并不是为了创造更聪明的聊天机器人。它反映了一种交付现有产品的新方式。赫伦和他的团队开始教一个代理使用公司过去作为独立软件提供的所有工具。现在,一个代理可以同时访问数百种公司工具。
这一转变改变了汤森路透评估模型的方式。“我们对Claude的大考验是真正评估它在制定计划和使用这些工具有效且正确方面的能力,”他说。
CoCounsel Legal展示了这一点。它过去按顺序运行单独的技能。重建于Claude Agent SDK之上,它现在可以实时规划、委派和协调各种工具和内容来源,因此专业人士可以定义结果,而不是指定每一步。客户数据受到保护,不会用于训练第三方模型。
赫伦将这一选择追溯到两家公司如何开始合作。汤森路透是Anthropic最早的企业客户之一,而决定的因素不是基准测试。“最打动我们的是Anthropic构建企业AI的方法,”他说,并引用了透明度、安全性和负责任AI开发。第一个验证点是法律领域的深度研究,这是双方共同构建的,因为两个团队都注意到Anthropic的工程师使用工具的方式,正是汤森路透已经在提供这些工具的方式。
知识工作对模型的要求

在这些项目中,赫伦的团队确定了模型在汤森路透信任它之前必须完成的四件事。
首先,作为CoCounsel Legal系统的一部分,模型必须检查自己的引文。它不能只检索来源就继续,而必须在将发现呈现给人进行最终审查和验证之前,验证其引用的内容。
在这个系统中,模型还必须在长时间的工具调用链中保持稳定。较长的任务需要更好的上下文管理和在扩展运行中可靠的工具使用。模型必须跨多个步骤和多个系统保持线索,以便代理完成实际工作,而不是半途停滞。
它还必须将人带入工作中,而不仅仅是答案。对于最困难的工作,赫伦希望模型能够“将人带入工作产品的开发过程中,而不是仅仅依赖代理一次性给出答案。”
最后,它还必须为汤森路透团队腾出时间,去处理他们此前没有精力去应对的工作。汤森路透正在为复杂的法律工作开发高级起草功能,包括动议起草和文件提交,这些工作专业人士原本需要“花数天或数周来完善”,他说。这项任务对早期模型来说“总是需要太多上下文和精确度”。有了Claude Fable 5,这一切现在触手可及。
人工智能的投资回报率
赫隆对人工智能的投资回报率持逆向观点,其他推广模型的领导者可能会觉得这一观点很有用。“如果你过于优化回报率的计算,你会只见树木不见森林,”他说。他希望团队在调整每项任务的成本之前,先感受到文化和心态的转变。一旦心态转变发生,回报自然会随之而来。
他仍然追踪传统的工程指标,如DevOps研究与评估(DORA)以及从创意到生产的时间,并指出一个基于Claude构建的内部错误修复工具,将生产问题的根因分析从三个小时缩短为四分钟的修复。“能在几分钟而不是几小时内恢复健康,这是一个实质性的差异。”
在赫隆看来,更深层次的变化在于工作本身。
“编写代码行不再是工作,”赫隆谈到他的工程师时说道;现在最重要的技能是系统思维、判断力和品味。他看到同样的模式正在工程领域之外蔓延,人工智能让人们变得更加“T型”,能够跨越产品、设计和金融领域,而不是局限于一个领域。
下一步是什么

赫隆和他的团队渴望通过Claude Fable 5和未来的Claude模型来突破界限:更长远的任务、更好的上下文管理,以及他们可以信赖的工具调用,贯穿代理运行的整个任务链。
他也同样渴望在自己的工作中使用这些模型。Claude Code让他“再次变得更具技术性”,在几分钟内而不是一天内就能熟悉一个他几个月没碰过的代码库,他还使用Claude Cowork来扮演首席财务官或战略官的角色,对想法进行压力测试。
这些正是Claude Fable 5等模型的构建方向,而对于最终必须在法庭上站得住脚的工作,赫隆认为这是接下来值得推进的前沿领域。毕竟,专业人工智能必须在几乎正确还不够好的环境中工作。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏