AI资讯 / 产业

产业 / 分析

远非正常水平

Tomer Tunguz

根据Tomasz Tunguz的分析,AI工程生产力成果集中在三个层级:平均20-46%的提升来自分发IDE;2.5-3倍的前沿水平来自构建代理操作层的公司,如Replit、NVIDIA、Amplitude和Anthropic;8倍以上的工厂层级则出现在代理作为一级组织单元的场景,如Nubank使用Devin。差距不在于模型本身,而在于围绕模型建立的操作纪律。NVIDIA报告称3万名开发者提交代码量增加3倍,错误率持平;Amplitude每周生产提交量增长3倍,AI代理成为代码库前三贡献者;Anthropic每位工程师编写代码量增加2.5倍,质量稳定。Replit团队规模翻倍,人均产出增长3倍,审查时间、回退和事故均持平。

过去六个月,一个又一个数据点证实了AI工程生产力的显著提升。NVIDIA报告称,在3万名开发者中,提交代码量增加了3倍,而错误率保持稳定。Amplitude的每周生产提交量增长了三倍,AI代理已成为其代码库中贡献排名前三的贡献者。Anthropic内部采用Claude Code后,每位工程师编写的代码量增加了2.5倍,质量保持稳定。Replit在团队规模翻倍的同时,人均产出也增长了三倍,审查时间、回退和事故率均未上升。

这些数据将生态系统划分为三个不平等的层级,每个层级由公司捕获模型能力的程度决定。第一个层级是大多数公司当前的体验:分发AI IDE,不改变其他任何东西,结果相对温和。工程领导者期望2-3倍的生产力提升,但实际接近30%。Faros对2.2万名开发者的遥测数据证实,工程师完成史诗任务的速度提高了66%,但每位开发者的错误数增加了54%。Google的随机对照试验将这一数字定为21%,接近GitHub的24%。这是默认结果。

前沿层级紧随其后。这些公司围绕模型构建了操作层,编排代理在GitHub、Linear和Slack之间共享上下文,并将需要判断的任务升级给工程师。Replit的CEO Amjad Masad描述道:每位员工都有一个管理代理,它会循环生成工作代理。他们的内部代理在安全测试和事件分类方面,以十分之一的成本超越了七位数的SaaS工具。人工PR审查时间下降了30%,复杂支持处理时间下降了60%,总代码贡献量增长了5.8倍。这就是3倍数字的来源。

第三个层级是软件工厂,这个名称恰如其分。它们是机械地生产软件的AI机器。Cognition的Devin端到端地重构单体代码库。Factory.ai正在NVIDIA、Adobe、Blackstone和EY部署软件工厂。Nubank使用Devin进行大规模重构,实现了8倍的工程效率提升和20倍的成本降低。高盛正在与1.2万名人类开发者一起试点Devin,并公开估计代理AI可能比之前的工具提供3-4倍的速度提升。

AI工程生产力的提升已经到来。初始数据显示了预期:大多数团队应该从20%的生产力提升迁移到3倍的生产力提升,而这些远非正常水平。差距不在于模型本身,而在于围绕模型建立的操作纪律。我们现在正处于一个应该期望彼此产出3倍的时代。

这些数据点来自Cursor、Faros、Google、GitHub、Factory.ai、Contrary Research和CNBC等来源,共同描绘了一幅清晰的图景:AI工程生产力的提升是真实的,但成果分布极不均匀。从IDE分发到代理操作层,再到软件工厂,每个层级都代表了不同的操作纪律和模型能力捕获程度。

要点

  • AI工程生产力呈现三个明显层级:IDE分发(20-46%提升)、代理操作层(2.5-3倍提升)和软件工厂(8倍以上提升)。
  • 差距不在于AI模型本身,而在于公司围绕模型建立的操作纪律和组织方式。
  • NVIDIA、Amplitude、Anthropic和Replit等前沿公司已实现3倍左右的生产力提升,且质量指标保持稳定。
  • Nubank使用Devin进行大规模重构,实现了8倍工程效率提升和20倍成本降低。
  • 大多数公司应从当前的20%生产力提升迁移到3倍提升,这需要改变操作纪律而非仅依赖工具。
查看原始来源

原始标题:AI Engineering Productivity is Anything But Normal

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。