返回
官网 Anthropic Economic Index AI 逐段翻译 发布 2026-07-09 06:08 收录于 08-14

Anthropic经济指数:AI使用衡量新维度

DataHot 速览

Anthropic发布第四份经济指数报告,提出任务复杂度、技能水平、用途、自主性和成功率五个经济基元,用于追踪Claude对经济的影响。报告基于2025年11月以Claude Sonnet 4.5为主的对话样本,分析AI在不同任务上的成功率及对职业的去技能化风险。该报告为理解AI在实际工作中的使用模式提供了量化框架。

为什么值得关注:报告用大规模真实对话数据拆解AI任务特征,为数据分析师和AI应用研究者提供了衡量AI经济影响的方法论与实证发现。

本文目录 11 节
  1. 我们从经济基元中学到了什么
  2. 任务
  3. 人工智能加速了哪些任务,加速了多少?
  4. Claude可以支持的任务的时间跨度是多少?
  5. Claude的工作性质在不同国家之间有何不同?
  6. 职业
  7. 覆盖率
  8. 任务内容
  9. 总体影响
  10. 先前指标的更新
  11. 结论

译文

AI 逐段翻译

人工智能真的能让人们工作得更快吗?人工智能最擅长支持哪些类型的任务?它又会如何改变人们职业的性质?

在Anthropic,我们持续测量现实世界中的人工智能使用情况,正是为了回答这些问题。我们注重隐私的分析方法使我们能够更深入地了解Claude.ai上的对话(涵盖消费者的使用),以及我们第一方API上的对话(主要涵盖企业的使用)。1 在过去的报告中,我们按职业和工资水平评估了人工智能任务,更仔细地考察了软件开发,并研究了人工智能在不同国家和美国各州的使用情况。

现在,我们为经济指数增加了新的详细程度。在第四份报告中,我们引入了所谓的经济基元:一套五个简单的基础度量,用于随时间追踪Claude的经济影响。我们初始的集合包括任务复杂度、技能水平、目的(工作、教育或个人使用)、人工智能自主性和成功率。2 我们通过让Claude回答关于本报告样本中每次对话的一套常见问题来推导这些基元。

这些基元为人工智能的潜在经济影响提供了先行指标——并使我们能够回答关于人工智能如何已经改变工作的更复杂问题。我们最新的报告抽样了2025年11月的对话(主要使用Claude Sonnet 4.5),利用我们的基元探索了广泛的问题,而这些问题我们原本无法回答——包括Claude的任务级成功率如何随任务复杂度变化,以及迄今为止对Claude的使用是否可能预示着许多工作的净去技能化效应。

你可以在此处阅读第四份经济指数报告。下面,我们总结了其结果。

我们从经济基元中学到了什么

我们将经济基元应用于关于单个任务、职业的问题,然后应用于我们观察到的变化的可能总体影响。(我们的完整方法论——包括我们如何测试基元准确性的细节——在完整报告的第二章中有描述。)

任务

人工智能加速了哪些任务,加速了多少?

我们发现,Claude对更复杂的任务的加速效果最明显。我们通过Claude估计的理解对话输入所需的受教育年限来衡量这一点:在Claude.ai上,需要高中教育(12年)才能理解的提示词所对应的任务加速了9倍,而需要大学学位(16年)的任务加速了12倍。(在API上,加速幅度更大。)这些结果表明,人工智能的生产力提升目前主要发生在需要相对较高人力资本的任务中,这与证据一致,即白领专业人士更有可能在工作中使用人工智能。

当我们根据任务成功率进行调整时,这一趋势依然存在——尽管形式较弱。Claude成功完成需要大学学位的任务的时间占比为66%,而完成那些需要低于高中教育的任务的时间占比为70%。这降低了总体效应,但并未消除:Claude对任务加速的影响随复杂度增加而更急剧地扩大,而不是复杂度与成功率下降的相关性更大。

Claude可以支持的任务的时间跨度是多少?

METR对人工智能任务时限的衡量表明,时间更长的任务对人工智能模型来说更难完成。但随着模型变得更好,人工智能模型能够工作的时间长度正在稳步增加:这一衡量标准现在已成为人工智能进展的关键指标。

我们能够利用经济基元来补充METR的分析。在下图中,我们展示了Claude的任务级成功率相对于人类完成相同任务所需时间的对比,分别针对Claude.ai和我们的API:

METR的基准测试表明,Claude Sonnet 4.5(我们分析中的模型)在2小时任务上达到50%的成功率。相比之下,我们自己的API数据发现,Claude在需要接近两倍时间(约3.5小时)的任务上成功率达到50%,而在Claude.ai上,时长更长得多——大约19小时。但这可能不像看起来那么不一致:我们的方法与METR在一些重要方面有所不同。在我们的样本中,用户可以将复杂的任务分解为更小的步骤,形成一个反馈循环,使Claude能够纠正方向。而且,我们的样本包含某种选择偏差,而不是一组固定的任务:用户会把他们更有信心能够成功的任务交给Claude。

我们的分析显示,Claude的有效时间跨度可能与在具有一致任务集的研究中发现的不同。我们将在后续报告中追踪这一指标。

Claude的工作性质在不同国家之间有何不同?

我们发现,在不同经济发展阶段的国家,Claude完成的任务类型截然不同。在人均GDP较高的国家,Claude更常用于工作或个人用途——而另一端国家则更可能将其用于教育课程。这符合一个简单的“采用曲线”叙事,即低收入国家在人工智能用于教育和少数工作任务上占很大比例,而随着国家变得富裕,人工智能的使用多样化转向个人目的。

这些结果与微软最近的工作该研究将教育领域的AI使用与较低的人均收入相关联,而休闲领域的AI使用则与较高收入相关联。我们的近期合作与卢旺达政府及技术培训提供商ALX的合作正是基于这一考量:参与者首先培养AI素养,我们正在试点一个项目,为部分毕业生提供为期一年的Claude Pro访问权限,支持从教育用途向更广泛应用的过渡。

职业

覆盖率

在我们的第一份报告中,根据2025年1月的数据,我们发现样本中36%的工作至少有四分之一的岗位任务使用了Claude。汇总各期报告数据,这一比例已上升至49%。但一旦我们考虑到Claude的成功 率(我们根据工人执行该任务的频率和耗时进行加权),我们对哪些工作受AI影响最大的看法便有所不同。

在下图中,我们将先前测量的职业任务覆盖率沿x轴绘制,并将我们新的调整后测量值沿y轴绘制。虽然两者确实相关,但我们发现某些职业(如数据录入员和放射科医生)受AI影响的程度远高于单纯任务覆盖率所暗示的,而其他职业(如教师和软件开发人员)受影响程度相对较低。

尽管如此,我们修订后的评估仍有局限:我们仅评估在Claude.ai上执行的任务,且这些对话如何映射到现实世界的变化并不总是清晰。这是我们计划未来深入探究的领域。

任务内容

我们提出的另一个问题是,AI覆盖的任务是代表特定职业中技能较高还是较低的组成部分。利用我们为每项任务所需技能水平创建的估计,我们发现Claude相对更可能覆盖需要更高教育水平的任务——具体而言,需要平均14.4年教育(相当于美国副学士学位)的任务,而经济体的平均水平为13.2年(如下所示)。这与我们早先的发现一致,即Claude更常被白领工作者使用。

作为实验,我们估计移除这些Claude覆盖的任务将如何改变人们工作的任务构成。作为一阶效应,这将去技能化平均而言的工作,因为会移除这些高教育任务。像技术文档撰写者、旅行代理人和教师等职业将受到影响(我们将在报告中进一步讨论),尽管少数职业(如房地产经理)将看到相反的影响。

我们并不必然预测这种去技能化会发生:有可能即使AI完全自动化了它目前支持的任务,劳动力市场也会以这种分析未考虑的方式动态调整。(当然,随着模型改进,AI覆盖的任务构成也会变化。)尽管如此,我们认为这为AI在不久的将来可能对职业产生的最直接影响提供了有用的信号。3

总体影响

在我们早期的研究中,我们估计AI的广泛采用可能在未来十年内使美国劳动生产率年增长率提高1.8个百分点——约为趋势增长率的两倍。我们新的原始数据使我们能够重新审视这一分析。

仅基于我们对任务加速的估计,我们复制了早先1.8个百分点的发现(即使加入我们的API数据)。但当我们考虑任务可靠性——即当我们根据任务成功的概率调整任务级时间节省估计时,我们的估计在Claude.ai上完成的任务下降了约三分之一(降至每年1.2个百分点),而在我们API上通常更具挑战性的任务则下降略多(降至1.0个百分点)。Claude.ai(每年增长至1.2个百分点),而对于我们API上通常更具挑战性的任务,这一数字略高(增长至1.0个百分点)。

即使年劳动生产率增长仅增加1个百分点仍然显著:这将使美国生产率增长回到1990年代末和2000年代初的水平。而且,正如我们在早期研究中提到的,这一总体估计并未考虑AI模型变得更强大或工作中AI使用变得更加复杂的可能性——这可能使数字大幅提高。事实上,自我们调查以来,随着Claude Opus 4.5的发布,Claude已变得强大得多。

先前指标的更新

除了原始数据,我们还收集了之前报告中跟踪指标的新一轮数据。这使我们能够识别2025年1月至11月期间AI使用的趋势。在此,我们主要发现与先前分析结果相比只有小幅演变,这些分析指出Claude的使用分布不均。

首先,我们发现Claude的使用仍然高度集中在某些任务上:尽管我们的样本包含Claude.ai上的3,000个独特工作任务,但前十名占据了24%,这一比例从2025年1月的21%稳步上升。更具体地说,计算机和数学任务继续主导Claude的使用:它们约占Claude.ai上所有对话的三分之一,以及我们API流量的近一半。

其次,我们的新报告发现,增强(占对话的52%)已经超过自动化(45%),成为与Claude互动的最流行模式Claude.ai。这与我们在8月样本中看到的情况相反(当时自动化以49%对47%领先),但是,当我们从更长的时间框架评估这个问题时,我们仍然看到自动化在任务中的份额缓慢上升:去年1月,增强以55%对41%领先,3月以55%对42%领先。

第三,我们的最新分析表明,AI使用的地理集中性(正如我们上次讨论)仍然明显。美国、印度、日本、英国和韩国在Claude.ai的整体使用上仍然领先,而采用率也与人均GDP高度相关。尽管如此,在美国,我们观察到了更大的变化:Claude的使用在美国各州之间变得更加均匀。事实上,如果这种趋势持续下去,我们的模型预测Claude的使用将在两到五年内在全国范围内达到均衡。我们在报告中更详细地讨论了这一模型。

结论

我们最新一期经济指数报告最直接的结论是,AI对全球劳动力的影响仍然高度不均衡:AI的使用仍然集中在特定国家和职业,并且正如任务覆盖的证据所表明的,它对某些职业的影响与对其他职业的影响非常不同。

更一般地说,这份报告为我们提供了一个新的基准,以便与未来的调查进行比较。随着Claude的改进,我们预计它将承担更难的任务,并且很可能取得更大的成功。我们还预计,随着任务变得更加可靠,任务可能会从Claude.ai转移到API(即从主要面向消费者转向主要面向企业),如果发生这种情况,这将为未来的经济影响提供另一个可能的指示,因为企业采用对AI提高生产力的影响至关重要。通过我们的原始数据,我们将能够衡量这些变化如何开始影响现实世界的结果,包括人们工作的性质,以及在这个快速技术转型期间哪些人(以及在哪里)可能受到最大影响。

与此同时,研究人员、记者和公众可以利用我们的数据来为他们的研究和思考提供信息,并为我们可能需要的潜在政策回应提供实证基础。关于上述每个领域的更多细节,请参阅我们的完整报告。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存