产业 / 媒体
定价亲民,但基准测试与Claude和GPT-6差距明显
xAI近日推出旗下迄今能力最强的模型Grok 4.7,主打编程与知识工作场景。该模型基于更大的基础模型构建,经过更长时间的强化学习训练,并具备更强的自我输出验证能力。定价方面,输入每百万token收费2美元,输出每百万token收费6美元,与中国模型的价格区间更为接近,远低于西方前沿模型。然而,在独立机构Artificial Analysis发布的智能指数(v4.3.2)中,Grok 4.7综合得分仅为46分,处于中游水平,而Claude Fable 5.1和GPT-6均以53分领跑。在智能体编程测试Terminal-Bench 4.0中,Grok 4.7仅得26%,不仅远落后于GPT-6 Astra的60%和Claude Fable 5.1的55%,甚至被更廉价的DeepSeek V4.1 Flash以27%的成绩微弱超越。该模型目前已通过Grok API、Cursor及Grok Build平台提供访问。
xAI于2026年9月正式发布Grok 4.7,将其定位为公司迄今最强的编程与知识工作模型。据xAI介绍,该模型在更大基础模型之上构建,采用了更长周期的强化学习训练流程,并强化了模型对自身输出结果的验证机制。这一系列改进旨在提升模型在复杂推理和代码生成任务中的可靠性。
在定价策略上,Grok 4.7选择了极具竞争力的路线:输入每百万token仅需2美元,输出每百万token为6美元。这一价格水平与国内主流模型相当,与Anthropic、OpenAI等西方前沿模型的定价存在显著差距,显示出xAI在市场渗透上的明确意图。
然而,独立评测机构Artificial Analysis发布的智能指数(v4.3.2)给出了较为冷静的评价。该指数综合十项基准测试,Grok 4.7最终得分为46分,在所有参评模型中处于中游位置。相比之下,Claude Fable 5.1与GPT-6均以53分并列领先,两者之间的差距达到7个百分点,并非微不足道的差异。值得注意的是,Grok 4.7的两个最高推理级别在测试中表现几乎相同,未能体现出明显的层级分化。
在智能体编程这一当前AI竞争的核心赛道上,Grok 4.7的表现更令人担忧。Terminal-Bench 4.0测试结果显示,Grok 4.7得分仅为26%,而GPT-6 Astra达到60%,Claude Fable 5.1为55%,差距超过一倍。更值得关注的是,定价更低的DeepSeek V4.1 Flash以27%的成绩小幅超越了Grok 4.7,这对xAI的性价比叙事构成了一定挑战。
目前,Grok 4.7已通过多个渠道向开发者开放,包括Grok API、代码编辑器Cursor以及xAI自家的Grok Build平台。对于预算有限、对顶尖性能要求不高的开发者而言,Grok 4.7的低价策略仍具吸引力。但若追求智能体编程或复杂推理任务的最优表现,当前基准数据表明Claude和GPT-6仍是更稳妥的选择。
要点
- Grok 4.7在Artificial Analysis综合智能指数中得分46,落后于Claude Fable 5.1和GPT-6的53分,差距明显
- 智能体编程测试中,Grok 4.7仅得26%,不仅远低于GPT-6 Astra(60%)和Claude Fable 5.1(55%),甚至被DeepSeek V4.1 Flash(27%)超越
- 定价是Grok 4.7最突出的优势,输入2美元、输出6美元每百万token,与中国模型价格区间相当
- 模型已在Grok API、Cursor和Grok Build三个平台上线,面向开发者开放访问
- 性价比定位清晰,但在高要求的编程与推理场景中,与头部模型仍存在实质性能力差距
原始标题:xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。