AI资讯 / 产业

产业 / 媒体

单靠扩大规模不够,训练数据将迎来千亿美元投入

The Decoder

前OpenAI员工Andrew Ho在任职仅八个月后选择离职,创办一家专注于高质量训练数据的初创公司。他认为,大型语言模型的泛化能力存在根本性缺陷,即便在编程这类资金充裕的领域,模型表现依然参差不齐。根本原因在于:绝大多数具有经济价值的技能在现有数据集中几乎没有覆盖。Ho预测,AI实验室未来数年将不得不在定向数据采集上投入逾千亿美元。剑桥大学研究员Adam Hunt与Ho持相近观点,他发现最新模型并非在向通用方向演进,而是愈发走向专业化——编程和数学能力持续提升,语言质量与简单逻辑却停滞甚至退步。谷歌DeepMind研究员Tom Zahavy则从结构层面指出,语言模型擅长演绎与归纳,却在创造性溯因推理上存在本质局限,即无法凭空发明尚无语言先例的因果关系。

Andrew Ho在OpenAI工作仅八个月便选择离开,理由是他对大型语言模型的泛化能力越来越不抱信心。他在公开文章中写道,大多数工作高度依赖情境,难以被编码进可评分的环境,即便能观察到人类走过的「黄金路径」,也很难判断其他反事实路径会带来好结果还是坏结果。在他看来,单纯扩大模型规模无法解决这一问题,AI实验室迟早要在定向数据采集上投入超过千亿美元。

Ho创办的新公司首批产品聚焦两个方向:一是生物信息学领域的复杂科学分析数据集,他在OpenAI期间曾参与相关工作,而当前最先进的模型在该领域的成功率仅约30%;二是日常实验室工作数据集,例如研究人员将实验照片提交给AI模型进行评估的场景。化学、材料科学、医疗健康及更广泛的知识工作领域也在后续计划之列。

剑桥大学研究员Adam Hunt的观察与Ho高度吻合。Hunt描述了自己对大型语言模型的看法如何从乐观转向悲观:最新模型并非变得更加通用,而是愈发专业化。编程和复杂数学能力持续进步,但语言质量和简单逻辑却在停滞乃至退步。他将原因归结为强化学习的特性——在代码领域,清晰的奖励信号和完整的训练数据天然存在,而在其他领域,这些条件根本不具备。

Hunt进一步指出,早期大型语言模型看似能够通过规模和推理实现泛化,本质上是在海量文本语料上训练的副产品,并非真正通用理解能力的体现。他对模型能否突破当前局限的信心仅有约40%,但也承认技术进步可能证明他的判断有误,例如若干专业AI模型的组合或许能涌现出更接近通用智能的能力。

谷歌DeepMind研究员Tom Zahavy在题为《大型语言模型无法跳跃》的立场论文中,从结构层面为模型能力的不均衡提供了解释。他认为,语言模型擅长演绎和归纳,却在创造性溯因推理上存在根本缺陷——即无法为尚无语言先例的现象发明成因。他提出,允许进行反事实实验的可动作控制世界模型或许是一条出路,而大型语言模型在这类更高级的系统中仍可扮演重要角色,只是单独运作时会触及天花板。

这场争论的核心始终指向同一个问题:语言模型能否发展出超越训练数据复现与重组的能力,尤其是在结果无法被自动验证的领域?Ho对前沿实验室的高估值同样持怀疑态度,认为OpenAI、Anthropic等机构长期处于亏损状态,不得不持续投入巨资开发新模型,才能在Qwen、Kimi等低成本竞争者面前保持优势。训练数据的稀缺性与经济可行性,正在成为整个行业无法回避的结构性挑战。

要点

  • 前OpenAI研究员Andrew Ho认为,大型语言模型泛化能力不足的根源在于训练数据匮乏,而非模型规模不够,预测AI实验室将在定向数据采集上投入逾千亿美元。
  • 剑桥研究员Adam Hunt发现,最新模型正走向专业化而非通用化,编程和数学能力提升的同时,语言质量与简单逻辑能力出现停滞甚至退步。
  • 谷歌DeepMind研究员Tom Zahavy指出,语言模型在创造性溯因推理上存在结构性局限,无法凭空发明尚无语言先例的因果关系。
  • 强化学习在代码等领域效果显著,是因为存在清晰的奖励信号和完整数据,而大多数具有经济价值的技能缺乏这一条件,导致模型能力发展严重不均衡。
  • Ho对OpenAI、Anthropic等前沿实验室的高估值持怀疑态度,认为其长期亏损的商业模式在低成本竞争者崛起的背景下面临严峻挑战。
查看原始来源

原始标题:Ex-OpenAI researcher bets $100 billion will flow into training data because scaling alone won't cut it

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。