Anthropic经济指数:Claude 3.7使用数据揭示AI对劳动力市场影响
DataHot 速览
Anthropic发布第二期经济指数报告,基于Claude 3.7 Sonnet发布后11天内的100万条匿名Claude.ai对话,分析AI对劳动力市场的影响。结果显示,编程及教育、科学、医疗类用途占比上升;增强式思考模式主要用于技术任务。报告还发布了按任务和职业划分的增强/自动化分解数据,以及涵盖630个细分类别的Claude.ai使用分类法,数据集免费开放下载。
为什么值得关注:数据从业者可利用这份大规模真实AI使用行为数据,理解AI在各职业中的增强与自动化边界,为数据产品设计和劳动力规划提供实证依据。
本文目录 11 节
译文
AI 逐段翻译上个月,我们推出了Anthropic经济指数——一项新举措,我们定期发布数据和研究,旨在了解AI对劳动力市场和经济随时间的影响。
今天,我们发布该指数的第二份研究报告,涵盖了Claude 3.7 Sonnet推出后Claude.ai的使用数据。Claude 3.7 Sonnet——我们最新、最强大的模型,在代理编码和新的“扩展思维”模式方面具有优势。
简而言之,我们最新的结果如下:
- 自Claude 3.7 Sonnet发布以来,我们观察到编码、教育、科学和医疗保健应用的 usage 份额有所上升;
- 人们使用Claude 3.7 Sonnet的新“扩展思维”模式主要用于技术任务,包括与计算机科学研究人员、软件开发者、多媒体动画师和电子游戏设计师等职业相关的任务;
- 我们发布了任务和职业层面的增强/自动化分解数据。例如,与文案撰写和编辑相关的任务显示出最高的任务迭代,即人类和模型共同撰写内容。相比之下,与笔译和口译员相关的任务显示出最高的指令性行为——即模型在最少人工参与的情况下完成任务。
此外,我们发布了一个首创的自下而上的Claude.ai使用分类法。该新数据集涵盖630个细粒度类别,从“帮助解决家庭管道、维护问题”到“提供电池技术和充电系统指导”。我们希望这个自下而上的分类法对研究人员有用,并揭示自上而下方法(将使用映射到预定义任务列表)可能遗漏的用例。
这些分析的数据集可免费下载。
请继续阅读我们发现的更多细节。
Claude 3.7 Sonnet发布以来有哪些变化?
上个月,我们推出了Claude 3.7 Sonnet,这是我们最强大的模型,具有“扩展思维模式”。我们重新运行了之前的分析,使用了发布后11天的数据,涵盖了100万次匿名的Claude.ai免费和Pro对话。我们分析的数据绝大多数来自Claude 3.7 Sonnet,因为它是Claude.ai和移动应用的默认模型。previous analysis关于之前分析的具体内容,请参考上个月的报告。
提醒一下,我们的隐私保护分析工具Clio将每次对话映射到美国劳工部O*NET数据库中的17,000个任务之一。然后我们查看与这些任务相关的职业和高层职业类别的总体模式。
在查看这100万次对话的分解时,我们看到几个职业类别的使用比例略有增加,包括编码、教育和科学。虽然由于Claude 3.7 Sonnet在编码基准上的改进分数,编码使用增加是预期的,但其他类别的增加可能反映了AI在经济中的持续扩散、编码在这些领域的新应用,或模型意想不到的能力提升。

人们如何使用扩展思维模式?
Claude 3.7 Sonnet具有新的“扩展思维”模式,当用户激活时,该模式使模型在回答更复杂的问题时能思考更长时间。
我们的分析显示,Claude 3.7 Sonnet的扩展思维模式主要用于技术和创造性问题解决情境。与计算机和信息研究科学家相关的任务领先,近10%使用扩展思维,其次是软件开发者,约8%。与数字创意角色如多媒体艺术家(约7%)和电子游戏设计师(约6%)相关的任务也显示出大量使用。
虽然这些早期使用模式揭示了人们选择何时使用扩展思维模式的见解,但关于这种新模型能力仍有许多重要问题。为了促进这一领域的进一步研究,我们发布了一个新数据集,将每个O*NET任务映射到其相关的思维模式分数。该数据集可在我们的Hugging Face页面上获取。
增强与自动化如何因任务和职业而异?
在我们的上一份报告中,我们分析了AI使用在增强性使用(如学习或迭代输出)和自动化使用(如要求模型直接完成任务或调试错误)之间的差异。我们的分析显示,在我们的新数据中,增强和自动化的平衡基本不变,增强仍占使用的57%。然而,我们确实看到了一些自动化使用类型的"types"变化——例如,我们看到学习交互(用户向Claude询问不同主题的信息或解释)从约23%上升到约28%。增强的自动化使用类型的变化——例如,我们看到学习交互从约23%上升到约28%。类型的变化——例如,我们看到学习交互从约23%上升到约28%。学习交互
我们通过我们的研究人员输入表单在任务和职业层面发布自动化和增强数据。我们在本报告中正是这样做的,将数据提供在我们的Hugging Face 页面上。
当按高层职业类别划分数据时,我们发现某些类别高度偏向增强;例如,社区和社会服务任务(包括教育和指导咨询)接近75%的增强比例。而在另一端,与生产或计算机和数学职业相关的任务,比例则接近50-50%。我们没有看到任何自动化占主导的职业类别。
更细致地看,我们还可以查看这些职业类别中的具体职业,以及与这些职业相关的任务。例如,与文案撰写和编辑相关的任务显示出最高的任务迭代量,即用户与模型迭代处理各种写作和编辑任务。相比之下,与翻译和口译相关的任务则显示出最高的指令行为量——即模型在最少人工参与的情况下用于文档翻译。请注意,O*NET 的描述可能无法完全代表 Claude 的实际使用场景——例如,虽然我们观察到“美术家,包括画家、雕塑家和插画师”这一职业的使用情况,但 Claude 可能更多地用于数字艺术创作,而非绘画或雕塑。
从下而上的 Claude.ai 使用分类
我们目前的研究依赖于美国劳工部创建和维护的 O*NET 任务与职业数据集。虽然 O*NET 涵盖了非常多的任务,但它可能不是描述通用模型能力的最佳分类体系,因为模型可以用于 O*NET 中未包含的任务——因此可能会被我们的分析遗漏。
为了弥补这一缺口,我们发布了一个新的自下而上的 Claude.ai 用户活动模式数据集。该数据集同样由 Clio 创建,使用了与上述分析相同的匿名对话数据集,从而能够比较自上而下和自下而上的方法。它包含630个细粒度聚类,并附有相关描述、流行度指标以及自动化/增强细分,组织为三个层级。
虽然我们将对该数据集的详细分析留给未来工作,但我们重点介绍几个特别有趣的聚类:
- 帮助处理水资源管理系统和基础设施项目
- 创建具有交互式可视化功能的基于物理的模拟
- 帮助我进行字体选择、实施和故障排除
- 帮助我创建或改进求职申请材料
- 提供电池技术和充电系统的指导
- 帮助处理代码和数据库中的时区问题
结论
随着模型的不断进步,我们对其经济影响的衡量也必须随之提升。在我们的第二份报告中,涵盖了自 Claude 3.7 Sonnet 发布以来的数据,我们发现编程、教育和科学用例的增长相对温和,增强和自动化之间的平衡没有变化。我们发现 Claude 新的扩展思维模式在技术领域和任务中使用频率最高,并识别了跨任务和职业的自动化/增强模式。我们发布了这两项分析的数据集。
在未来几个月,随着能力的提升和模型在经济中的持续应用,我们旨在继续跟踪这些指标并开发新的指标。
与我们合作
如果您有兴趣在Anthropic 工作,研究 AI 对劳动力市场的影响,我们鼓励您申请我们的社会影响研究科学家和研究工程师职位,以及经济学家职位。
附录
在本附录中,我们分享一些额外的结果和技术细节。
任务曲线
我们还重新计算了原始论文中的“任务使用深度”图表。我们发现曲线与我们第一次分析的结果大致相似。如果有任何不同,新模型的曲线下面积略小——这可能是由于样本对话中编程内容的集中度增加所致。尽管如此,尽管在过去两个月我们未看到此曲线的显著变化,但随着模型能力和产品表面的不断进步,我们将继续监测。
职业类别的完整变化
其他交互模式的结果
其他方法论细节
虽然我们主要遵循原始报告的方法论,但我们为透明起见记录了一些更改:
- 与上一份报告不同,我们不过滤与职业类别相关的对话。相反,我们仅过滤掉触发我们安全分类器的对话。我们发现这些方法与原始分析得到的结果相似,同时保留了更多数据,可通过我们的自下而上的使用分类进行发布。
- 我们使用 Claude 3.7 Sonnet 替代了之前所有使用 Claude 3.5 Sonnet 的情况。我们发现使用较新的模型提高了分类的准确性,根据我们用于评估 Clio 准确性的内部基准。
补充来源
1 个信源 · 1 篇报道这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏