AI资讯 / 产业

产业 / 媒体

一边主张合理使用,一边限制他人蒸馏

IT之家

微软 CEO 萨提亚·纳德拉日前在 X 平台发文,批评包括 Anthropic 在内的 AI 大模型公司存在双重标准:一边主张利用公开数据训练模型属于合理使用,一边却对其他公司通过蒸馏学习其模型能力施加严格限制,并保留利用客户数据和交互数据继续训练的权利。纳德拉认为,若知识流动始终单向,最终获利的是掌握算力基础设施的一方。外界普遍认为,他的矛头主要指向 Anthropic,后者近期曾指控中国公司实施大规模模型蒸馏攻击。与此同时,纳德拉也提醒企业用户,过度依赖头部模型等同于把自身专有数据交由供应商再付费使用,企业应建立属于自己的 AI 基础设施、评估体系和数据边界。

微软 CEO 萨提亚·纳德拉在 X 平台发文,对包括 Anthropic 在内的 AI 大模型厂商的训练方式提出含蓄批评。他指出,一些模型厂商一方面主张利用公开数据训练模型属于合理使用,另一方面却对其他公司通过模型蒸馏学习其能力施加严格限制,同时保留利用客户使用数据和交互数据继续训练的权利,这种做法具有明显的讽刺意味。

模型蒸馏是指利用性能更强的大模型输出结果,训练参数更少、能力较弱的新模型。纳德拉认为,如果知识的学习只能单向流动,那么最终赚到钱的将是掌握 AI 算力基础设施的人,而真正创造知识的人却无法从中受益。这一观点将矛头指向了当前 AI 产业中数据获取与能力迁移的不对等关系。

目前 Anthropic、OpenAI 和 Google DeepMind 等头部 AI 公司都依赖大量由他人创作的公开内容来训练 ChatGPT、Claude 和 Gemini 等模型。围绕未经授权抓取数据的诉讼持续增加,而纳德拉的言论被普遍认为主要针对 Anthropic。此前 Anthropic CEO 阿莫代伊曾公开指责中国 AI 公司利用 Claude 输出训练自家模型,并致信美国参议员,称阿里巴巴发起了已知规模最大的模型蒸馏攻击。

在批评同行的同时,纳德拉也对企业用户发出提醒:过度依赖头部大模型服务,本质上是把自身的专有数据交给模型提供商,再付费使用这些模型。他建议企业建立属于自己的 AI 基础设施和组织知识,并配套模型评估体系和持续学习机制,让 AI 能力随着时间不断积累。

纳德拉还提出,企业需要为人力资本和 Token 资本建立真正可信的边界,使其能够持续积累价值。这条边界应当足够严格,未经许可,任何信息都不能跨越,即便是 AI 推理过程中产生的智能副产品也不例外。在他看来,掌握自有数据资产与算力资产,将成为企业未来在 AI 时代的核心竞争力。

值得注意的是,埃隆·马斯克此前也曾批评 Anthropic 的数据收集与训练方式。今年 2 月,他在 X 平台发文称 Anthropic 大规模窃取训练数据,并因此支付了数十亿美元和解金。多位行业高管的相继表态,意味着围绕 AI 训练数据来源与模型蒸馏边界的争议,正在成为头部厂商之间公开博弈的新焦点。

要点

  • 纳德拉批评头部 AI 公司存在双重标准:既主张合理使用公开数据训练,又对模型蒸馏设限。
  • 外界普遍认为其矛头主要指向 Anthropic,后者此前曾指控中国公司实施大规模模型蒸馏。
  • 纳德拉提醒企业,过度依赖头部大模型等同于将专有数据交给供应商后再付费使用。
  • 他建议企业建立自有 AI 基础设施、评估体系和持续学习机制,掌握数据与算力资产。
  • 纳德拉主张企业为人力资本与 Token 资本设立严格边界,连 AI 推理产生的智能副产品也不应外流。
查看原始来源

原始标题:微软 CEO 纳德拉批评 AI 模型公司“双标”:一边主张“合理使用”数据,一边限制他人蒸馏

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。