AI资讯 / 产业

产业 / 媒体

大模型集体陷入“随大流”困境,澳洲创业公司尝试破局

MIT Technology Review

主流大语言模型在面对开放性问题时往往给出高度雷同的答案,从随机数字到品牌命名几乎都遵循相似的概率分布。澳大利亚创业公司 Springboards 认为,这种“群体思维”让模型在需要发散创意的场景中表现乏力。公司基于阿里通义千问 3 开源模型训练出 Flint,刻意保留一定幻觉以追求答案多样性,并将其作为创意工具的一部分提供给广告和营销从业者使用。行业研究也指出,多家头部模型在隐喻生成等问题上的同质化程度惊人,相关论文曾获 NeurIPS 最佳论文奖。

主流大语言模型在面对开放式提问时表现出惊人的一致性。报道中以“给我一个 1 到 10 之间的随机数字”为例,ChatGPT、Claude 等模型几乎总是先回答 7,再次提问后又会落在 3、4、8、9 等少数几个数字上。这种高度可预测的模式并不只出现在数字游戏中,要求模型举例汽车类型时,结果往往集中在丰田、本田等少数品牌。

同质化问题并非个案。2025 年 11 月发表的一篇论文《Artificial Hivemind》系统测试了 25 个不同的大模型,让它们各写 50 句关于时间的隐喻,结果绝大多数回答都落在“时间是河流”或“时间是编织者”这类表达上。该研究在 NeurIPS 大会上获得最佳论文奖,提示人们主流模型在训练数据、训练方式和任务目标上的趋同可能是导致答案趋同的深层原因。

澳大利亚创业公司 Springboards 试图打破这种困境。公司开发了一款集成多种大模型的创意工具,允许用户在广告策划、营销文案等场景中拖拽不同模型的回答进行组合。作为该工具的差异化选项,团队推出了自研模型 Flint,其设计目标是刻意放大回答的多样性。创始人 Pip Bingemann 表示,公司并不把幻觉当作敌人,反而主动保留一定幻觉以换取更具创意的输出。

Flint 建立在阿里通义千问 3 开源模型之上,团队坦言自训基础模型成本过高并不现实。在工程实现上,团队尝试过调节 temperature 等常见参数,但发现单纯提高随机性会让模型输出变得不连贯,因此转向在训练阶段就内化多样性偏好。技术负责人 Kieran Browne 认为,大多数聊天界面让人误以为在进行个性化对话,实际上不同用户拿到的内容高度雷同。

部分早期试用者反馈积极。商业策略公司 Bodacious 创始人 Zoe Scaman 在对比测试中让 Flint 与多家主流模型回答同一商业案例,结果 Flint 提出“重新定义财富积累”这一跳出常规的方向。但她也提醒,Flint 目前仍是原型,在被推到极限时仍会失稳。OpenAI 则回应称,训练模型追求稳定可靠自然会收敛到高概率回答,过度追求新奇反而会牺牲回答质量。

围绕大模型同质化的讨论正在升温。研究者与从业者普遍认为,下一代模型需要在创意类任务上引入更多机制来摆脱“群体思维”。Springboards 选择以小模型加专精训练的方式切入市场,试图在巨头的标准答案之外为创意工作者提供一个真正不同的工具箱。

要点

  • 主流大语言模型在开放性问题上高度同质化,从随机数字到隐喻生成都存在明显的趋同现象。
  • 论文《Artificial Hivemind》在 NeurIPS 获最佳论文奖,揭示不同厂商的模型在回答上同样高度相似。
  • 澳洲创业公司 Springboards 基于通义千问 3 开源模型训练 Flint,刻意保留一定幻觉以换取答案多样性。
  • 创意从业者认为 Flint 在头脑风暴场景下能提供更有冲击力的方向,但稳定性仍是短板。
  • OpenAI 等厂商认为追求可靠性与追求新奇之间存在权衡,模型同质化是训练目标的副产品。
查看原始来源

原始标题:LLMs are stuck in a groupthink groove. This startup is trying to get them out.

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。