AI资讯 / 产业

产业 / 媒体

任务耗时预估偏差高达10倍

The Decoder

一项由两位独立AI研究员在MATS研究项目框架下完成的新研究揭示,主流AI编程助手在时间感知方面存在系统性缺陷。研究团队以Anthropic的Claude Code和OpenAI的Codex为测试对象,使用ProgramBench中的200个任务及研究者自建的18个基准测试,评估这两款工具在任务开始前的时长预估能力,以及任务完成后对已用时间的回顾判断。结果显示,两款工具均大幅高估所需时间,Claude Code的偏差约为实际时长的3倍,Codex则高达6至10倍,短任务的误差尤为突出。与此同时,两款工具对自身工作质量的评分平均高出实际得分约20个百分点。在一个典型案例中,两款工具均认为自己完成了约70%的任务,而实际得分分别仅为7%和14.5%。研究者指出,时间感知能力对于执行「持续工作两小时」等长时任务指令至关重要,而当前AI代理在这一能力上的缺失,使其难以被有效监管和控制。

AI编程助手正越来越多地被用于执行耗时数小时的复杂自主任务,但一项新研究表明,这些工具对时间的感知能力几乎为零。研究由两位独立AI研究员在MATS研究项目框架下完成,测试对象为Anthropic的Claude Code和OpenAI的Codex。研究人员在每项编程任务开始前要求AI预估所需时间,任务完成后再让其回顾实际耗时,以此衡量两款工具的时间判断能力。

测试结果令人担忧。在ProgramBench的200个任务中,两款工具无论任务难度如何,预估时长几乎都集中在90分钟左右,缺乏对任务复杂度的有效区分。在研究者自建的基准测试中,Claude Code的时长预估平均偏差约为实际值的3倍,Codex则高达6至10倍。偏差在短任务上尤为明显,只有当任务实际耗时进入多小时区间时,部分预估才开始接近真实情况。

研究还发现,同一底层语言模型在不同软件框架下的表现差异显著。Claude Code会持续工作直至认为任务完成,中位运行时长约为90分钟;而Codex则倾向于在约半小时后停止,几乎不受任务性质影响。数据显示,同一模型在Claude Code中平均执行的步骤数是在Codex中的2.5倍,说明运行时长不仅取决于模型本身,还在很大程度上受到外围软件框架的影响。

除时间感知外,这两款工具在自我质量评估方面同样表现失准。较旧版本的Opus 4.8和GPT-5.5平均将自身得分高估约20个百分点,甚至在任务明显失败的情况下仍给出高分。研究中记录了一个极端案例:两款工具均认为自己完成了约70%的任务目标,而实际测试得分分别仅为7%和14.5%,差距触目惊心。

研究者指出,时间感知与自我评估能力对于AI代理的可靠运行至关重要。若要让AI代理执行「在两小时内持续迭代此任务」这类指令,它必须具备准确感知时间流逝的能力。一个持续误判时间的代理将极难被有效监控和控制,这对当前AI系统的自主部署构成实质性风险。值得注意的是,当研究者为代理提供一个可查询已用时间的工具时,其时间判断准确率大幅提升,几乎每次都能给出正确答案,这为未来的改进方向提供了参考。

要点

  • Claude Code和Codex均存在系统性时间感知缺陷,任务耗时预估偏差分别达实际值的3倍和6至10倍,短任务误差尤为突出。
  • 两款工具对自身工作质量的评分平均高出实际得分约20个百分点,在任务失败时仍可能给出虚高评价。
  • 同一底层模型在不同软件框架下的运行时长差异显著,Claude Code中的执行步骤数平均是Codex的2.5倍,说明框架设计对AI行为影响深远。
  • 当为AI代理提供可查询已用时间的外部工具时,其时间判断准确率大幅提升,提示工具辅助是弥补这一缺陷的可行路径。
  • 时间感知能力的缺失使AI代理难以可靠执行长时自主任务,对当前AI系统的监管与控制构成实质性挑战。
查看原始来源

原始标题:AI agents have no sense of time and are not aware of it

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。