AI资讯 / 产业

产业 / 媒体

Thinking Machines发布Inkling Small:以效率挑战规模

The Decoder

Thinking Machines近日发布开放权重推理模型Inkling Small,这是该公司继Inkling之后推出的第二款产品。根据Artificial Analysis的评测,Inkling Small在智能指数上得分40分,仅比Inkling低1分,但其总参数量为276亿、活跃参数仅120亿,不足前作的三分之一。在多项关键基准测试中,Inkling Small表现出色:在Humanity's Last Exam上以32%的得分超越Inkling的30%,在GPQA Diamond上以89%超越前作的87%。该模型在代理任务和事实知识方面略有不足,但在令牌效率上优势显著,每项任务平均输出2.4万个令牌,远低于Deepseek V4 Flash的4.5万和GPT-5.4 mini的7.8万。模型支持文本、图像和语音输入,上下文窗口达25.6万令牌,采用Apache 2.0协议开源发布,权重已上传至Hugging Face。

前OpenAI首席技术官Mira Murati创立的AI实验室Thinking Machines于近日正式发布Inkling Small,这是该公司推出的第二款开放权重推理模型。与业界普遍追求参数规模的趋势不同,Thinking Machines选择以效率为核心设计理念,打造出一款体量更小却性能不俗的推理模型。

根据Artificial Analysis的独立评测,Inkling Small在智能指数上获得40分,仅比其前作Inkling低1分。值得注意的是,该模型总参数量为276亿,活跃参数仅120亿,不足Inkling的三分之一。评测机构指出,在同等或更小规模的开放模型中,目前尚无模型能在该指数上超越Inkling Small。

在具体基准测试中,Inkling Small展现出超越前作的能力。在旨在衡量真实智能水平的Humanity's Last Exam测试中,Inkling Small得分32%,高于Inkling的30%;在科学推理基准GPQA Diamond上,前者以89%的得分超越后者的87%。不过,该模型在代理任务执行和事实性知识问答方面仍落后于Inkling。

令牌效率是Inkling Small最突出的竞争优势之一。该模型每项任务平均输出约2.4万个令牌,而Deepseek V4 Flash为4.5万,GPT-5.4 mini则高达7.8万。更低的令牌消耗意味着更低的推理成本和更快的响应速度,这对于需要大规模部署的企业用户而言具有重要的实际价值。

在功能层面,Inkling Small支持文本、图像和语音三种输入模式,上下文窗口达25.6万令牌。模型以Apache 2.0协议开源,权重已发布至Hugging Face平台,用户还可通过Tinker Playground在浏览器中直接对模型进行微调。Thinking Machines将其模型定位为企业利用自有数据进行微调的基础底座,这一策略被部分业界人士视为AI应用落地的重要方向。

要点

  • Inkling Small参数量不足Inkling三分之一,但在智能指数上仅低1分,在编程与推理基准上多项超越前作
  • 该模型令牌效率显著领先同类竞品,每任务平均输出2.4万令牌,远低于Deepseek V4 Flash和GPT-5.4 mini
  • 模型采用Apache 2.0协议开源,支持多模态输入,并提供浏览器端微调工具,降低企业定制门槛
  • Thinking Machines以微调友好型底座为核心定位,押注效率而非规模,走出差异化竞争路线
查看原始来源

原始标题:Thinking Machines bets on efficiency over size with its second model, Inkling Small

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。