AI资讯 / 产业

产业 / 媒体

汤森路透斥资4000万美元自研大模型Thomson,底座来自阿里千问

IT之家

路透社母公司汤森路透集团近日正式发布其首款自研大语言模型Thomson,底座采用阿里巴巴千问系列的Qwen3.5-397B版本。该模型总研发成本约4000万美元(约合人民币2.69亿元),此前外界流传的45万美元仅为最后一次训练的费用,并非全部投入。汤森路透与帝国理工学院合作对基础模型进行重新训练,使其满足安全、伦理及政治中立性要求,随后利用公司自有内容完成预训练、后训练及内部强化学习。在Stanford LegalBench测试中,Thomson得分0.823,略低于Gemini 3.1 Pro和GPT-5.5;在Harvey Legal Agent Benchmark中,表现仅次于Opus 4.8。汤森路透表示,选择自研而非采购OpenAI、Anthropic等闭源模型,主要考量是长期成本控制与高自由度定制需求,自研小规模模型更适合文档审查等垂直业务场景。

汤森路透集团于近日正式对外公布旗下首款大语言模型Thomson。该模型以阿里巴巴千问系列中的Qwen3.5-397B为基础模型构建,是这家全球领先的新闻与专业信息服务集团在生成式AI领域迈出的重要一步。汤森路透表示,Thomson已跻身全球最佳AI模型之列,将重点服务于法律、合规及文档审查等专业场景。

在成本层面,外界此前广泛流传的45万美元数字仅代表最后一次训练的费用,而Thomson的实际总研发投入约为4000万美元,按现行汇率折合人民币约2.69亿元。这一数字揭示了大型企业自研专业模型的真实门槛,也表明汤森路透将AI能力建设视为长期战略投资,而非短期技术试验。

在模型训练路径上,汤森路透首先与帝国理工学院合作,对Qwen3.5-397B基础模型进行重新训练,使其在安全性、伦理规范和政治中立性方面达到企业标准。此后,公司利用自有的海量新闻与专业内容对模型进行预训练和后训练,并在内部封闭环境中完成强化学习,从而将通用基础模型转化为高度定制化的专业工具。

在基准测试表现方面,Thomson在Stanford LegalBench中得分0.823,落后于Gemini 3.1 Pro和GPT-5.5,但在Harvey Legal Agent Benchmark中仅略低于Opus 4.8。值得注意的是,Thomson在测试中启用了推理阶段扩展,而GPT-5.5则在未开启推理模式的条件下参与对比,两者测试条件存在差异。在深度搜索测试中,Thomson得分0.53,GPT 5.4为0.65,差距仍较为明显。

汤森路透明确表示,放弃采购OpenAI、Anthropic等美国闭源模型的核心原因有两点:一是外部模型的长期使用成本较高,二是闭源架构限制了企业对模型的深度定制能力。相比之下,基于开源底座自研的小规模专业模型,在文档审查、法律分析等垂直场景中具备更强的适配性与可控性,也更符合汤森路透对数据安全和业务合规的严格要求。

汤森路透选择阿里千问作为底座,折射出全球企业在AI基础设施选型上的多元化趋势。随着中国开源大模型在性能和生态上持续成熟,越来越多的国际机构开始将其纳入技术选型视野。Thomson的发布也预示着,专业信息服务行业的AI竞争正从单纯的API调用走向深度自研与场景定制的新阶段。

要点

  • Thomson总研发成本约4000万美元,外界流传的45万美元仅为最后一次训练费用,两者相差近90倍。
  • 模型底座采用阿里千问Qwen3.5-397B,并联合帝国理工学院完成安全、伦理与政治中立性改造。
  • 在Stanford LegalBench测试中得分0.823,略低于Gemini 3.1 Pro和GPT-5.5,但测试条件存在差异。
  • 汤森路透放弃闭源商业模型,主因是长期成本过高且定制自由度不足,自研路线更适合垂直专业场景。
  • 此案例表明中国开源大模型正被更多国际头部机构纳入企业级AI建设的底座选型。
查看原始来源

原始标题:路透社母公司汤森路透花 4000 万美元研发 AI 模型,基于阿里千问

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。