AI资讯 / Agent

Agent / 分析

Thinking Machines 发布首款开放权重模型 Inkling:975B 总参 / 41B 激活,支持百万 token 上下文

Latent Space

Thinking Machines 正式推出 Inkling 模型家族,这是该公司的首款开放权重基础模型。Inkling 采用混合专家架构,总参数 9750 亿、每 token 激活 410 亿,支持最长 100 万 token 的上下文窗口,预训练数据量达 45 万亿 token,覆盖文本、图像、音频与视频四种模态。团队同步开放了参数量更小的 Inkling-Small 预览版,总参数 2760 亿、激活 120 亿。该模型采用 Apache 2.0 协议,首日即获得 vLLM、SGLang、Modal、Baseten、Databricks 等推理与部署框架的生态支持。在第三方评测中,Inkling 的智能指数达到 41 分,成为目前美国最强的开放权重模型,但与顶尖中国开源及闭源旗舰相比仍有差距。

Thinking Machines 正式发布其首款完全开放权重的基础模型 Inkling,标志着 Mira Murati 团队从研究阶段迈入产品化交付。Inkling 是一款混合专家架构的 Transformer 模型,总参数量达到 9750 亿,但每个 token 仅激活 410 亿参数,兼顾规模与推理成本。模型支持最长 100 万 token 的上下文窗口,覆盖文本、图像、音频和视频四种模态的原生输入,并仅以文本形式输出,适合作为可定制化的多模态基座。

在训练数据方面,Inkling 在约 45 万亿 token 的多模态语料上完成从零开始的预训练。团队还设计了可控的推理强度调节机制,允许用户根据任务复杂度灵活控制思考深度。同步推出的 Inkling-Small 预览版采用相似的训练策略,总参数 2760 亿、激活 120 亿,主打更低延迟与更低部署成本,同时在多项评测中展现出与完整版相近的竞争力。

技术报告披露了多项架构层面的非常规选择。Inkling 采用了 5:1 比例的局部与全局混合滑动窗口注意力,窗口大小为 512;同时使用相对位置编码替代了当前主流的旋转位置编码,并在注意力与前馈流中加入短卷积层。混合专家模块配置了 2 个共享专家,并采用 DeepSeek 风格的免辅助负载均衡策略,配合 8 个 MTP 头用于推测解码。优化器方面则使用了 MuonC / AdamC 权重衰减方案与 muP 初始化。

生态支持方面,Inkling 首日即登陆 vLLM、SGLang、Modal、Baseten、Databricks、Hugging Face 等主流推理与部署平台,并提供了多种量化方案。第三方评测机构 Artificial Analysis 给出的智能指数评分为 41,领先于 Nemotron 3 Ultra(38)、Gemma 4 31B(29)以及 gpt-oss-120b(24),成为目前美国地区最强的开放权重模型。然而评论普遍指出,Inkling 仍略逊于中国顶尖开源模型 GLM 系列以及最强闭源旗舰。

值得注意的是,Inkling 的定位并非追求榜单极限的旗舰,而是一款面向广泛能力、便于二次开发与微调的基础底座。Thinking Machines 团队多位成员强调,这是后续迭代的起点而非终点。Mira Murati 表示 Inkling 是公司从零训练的第一款模型,同日即在 Tinker 平台开放微调能力,整体策略呈现出明显的开放生态导向。

要点

  • Thinking Machines 推出首款开放权重模型 Inkling,总参数 975B / 激活 41B,采用 MoE 架构与 Apache 2.0 协议
  • Inkling 原生支持文本、图像与音频模态输入,上下文窗口达 100 万 token,预训练数据量为 45 万亿 token
  • 同步发布的 Inkling-Small 预览版总参数 276B / 激活 12B,主打更低延迟与部署成本
  • 模型采用滑动窗口混合注意力、相对位置编码、短卷积层及免辅助负载均衡等多项非主流架构选择
  • 在第三方评测中 Inkling 智能指数达 41,成为目前美国最强开放权重模型,但仍落后于中国顶尖开源与闭源旗舰
查看原始来源

原始标题:[AINews] Thinky's Inkling: 975B-A41B multimodal, new best American Apache 2.0 open model (with Inkling-Small, 276B-A12B)

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。