AI资讯 / 研究

研究 / 官方

Thinking Machines 如何在开放与风险之间寻求平衡

Thinking Machines

Thinking Machines 近期发布了两款开放权重语言模型 Inkling 与 Inkling-Small,并同步公布了一套关于开放权重模型安全发布的系统性框架。该框架的核心逻辑是:安全发布取决于模型本身与其所进入的生态系统两个维度。在模型层面,需要进行严格的安全测试,并研究是否能将危险能力与通用智能解耦;在生态层面,则需通过分阶段发布、支持防御方、与安全研究者合作等方式提升整体韧性。Thinking Machines 对 Inkling 进行了内部评估、四家独立机构的外部红队测试以及对抗性微调研究,结论是该模型不会在现有开放权重模型的基础上带来实质性的增量风险。该公司同时指出,随着模型能力逼近前沿,安全策略也必须随之演进,并计划推出 Tinker 安全资助计划,支持社区共同构建生态防线。

开放权重模型被 Thinking Machines 视为一种公共品:它将 AI 开发与安全工作分散到更多人手中,使训练决策可被审查和修正。该公司认为,若缺乏强大的开放模型,训练与部署专业知识将集中于少数实验室,其他人将难以理解、适应或治理这项技术。正是基于这一理念,公司发布了 Inkling 与 Inkling-Small,允许任何人拥有、运行和定制这两款模型。

然而,开放权重也带来真实的滥用风险。一旦权重公开,任何人——包括恶意行为者——都可以使用。以网络安全为例,Anthropic 于 2026 年 4 月报告称,Claude Mythos Preview 在无人工引导的情况下发现了数千个未知漏洞并编写了可用的攻击代码。这类能力可能大幅降低发动网络攻击所需的时间、成本与专业门槛。类似的两用困境同样存在于化学和生物等领域,因此无差别地发布权重并非安全之道。

Thinking Machines 提出的安全路径围绕两个核心问题展开:模型是否安全,以及生态系统是否就绪。在模型安全方面,公司对 Inkling 进行了三轨内部评估,涵盖化学、生物、放射性、核武器等危险双用途领域,以及广泛的滥用场景和跨 17 种语言的多模态内容测试。同时,四家外部机构分别针对通用滥用、脆弱用户交互、CBRN 与网络安全、以及失控行为进行了独立红队测试,均未发现超出现有开放权重模型风险水平的新能力。

在对抗性微调测试中,研究团队对 Inkling 进行了专门优化,使其倾向于响应有害请求而非拒绝,以评估移除安全护栏后的最坏情形。结果显示,即便在这种条件下,模型在 CBRN 和网络安全任务上也未提供超出现有模型的实质性能力提升。这一发现支持了公司的结论:发布 Inkling 不会在现有开放权重模型的基础上带来实质性的增量风险。

在生态系统就绪方面,Thinking Machines 倡导分层防御与分阶段发布策略。具体路径包括:向防御方提供早期推理 API 访问权限,向经过审查的防御者开放微调访问,向安全研究者提供白盒访问,最后才向公众开放监控下的访问。每个阶段都应在证据支持的前提下才扩大访问范围,而非按固定顺序自动推进至完全开放。这一迭代逻辑意味着,今天被暂缓发布的模型,随着生态系统的成熟,未来可能变得更适合开放。

在更长远的研究方向上,Thinking Machines 对将危险能力与通用智能解耦抱有期待。初步研究表明,在预训练阶段对 CBRN 相关内容进行文档级过滤,可以在不影响其他能力的情况下降低有害能力评估的表现。尽管这仍是开放性研究问题,但公司认为这一方向值得深入探索。与此同时,公司计划推出 Tinker 安全资助计划,资助社区强化生态防线,并表示欢迎安全研究者、系统防御者和模型评估者共同参与这项工作。

要点

  • Thinking Machines 发布 Inkling 与 Inkling-Small 时同步公布安全框架,强调开放权重发布须同时评估模型能力与生态系统就绪程度
  • 经内部评估、四家机构外部红队测试及对抗性微调研究,Inkling 被认定不会在现有开放权重模型基础上带来实质性增量风险
  • 公司提出分阶段发布路径,从受监控 API 访问到微调访问再到完全开放权重,每一步扩大访问范围均需有证据支撑
  • 初步研究显示,通过预训练数据过滤可在不损害通用能力的前提下降低危险双用途能力,但这仍是开放性研究问题
  • Thinking Machines 计划推出 Tinker 安全资助计划,支持社区共同构建开放权重生态系统的防御层
查看原始来源

原始标题:A Safe Path to Open Weights

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。