AI资讯 / 产业

产业 / 媒体

xAI发布Imagine Image 2.0,Arena基准测试中紧追OpenAI GPT-Image-2

The Decoder

xAI正式推出Imagine Image 2.0,作为Grok平台的全新图像生成模式,可在grok.com/imagine及iOS、Android应用中以「Quality Mode」形式使用,API接入支持即将上线。根据2026年8月7日的Arena排行榜数据,该模型的快速版本在图像编辑和文本生成图像两大类别中均位列全球第二,仅次于OpenAI的GPT-Image-2。在图像编辑Arena中,Imagine Image 2.0的Elo评分为1439,GPT-Image-2以1463分领先;文本生成图像Arena中,两者分别为1320分和1380分。此外,新模型在测试中大幅超越上一代的Quality版本。xAI表示,Imagine Image 2.0在指令遵循精度、排版布局清晰度以及多次生成的一致性方面均有显著提升,并将其定位为视频制作工作流的前期准备工具。

xAI于2026年8月正式发布Imagine Image 2.0,将其作为Grok平台的新一代图像生成引擎推出。用户可通过grok.com/imagine网页端及Grok的iOS和Android移动应用访问该模型,API接入功能也将在近期开放。xAI表示,新模型在指令理解精度、复杂视觉内容中的排版与布局处理,以及跨多次生成的风格一致性方面均有明显改进。

在权威的Arena排行榜中,Imagine Image 2.0的快速版本表现亮眼。截至2026年8月7日,该模型在图像编辑Arena中以1439的Elo评分位居全球第二,仅落后于OpenAI GPT-Image-2的1463分;在文本生成图像Arena中同样排名第二,得分1320,GPT-Image-2以1380分领先。xAI Reve 2.1、Meta的Muse-Image、阿里巴巴的Qwen-Image-3.0-Pro、谷歌Gemini以及字节跳动的SeedDream均排在其后。

Imagine Image 2.0内置多项面向迭代创作流程的编辑工具。其中「Magic Wand(魔法棒)」功能可对图像中用户选定的区域进行精准修改,而不影响其余部分;分割功能支持用户圈选精确区域;背景移除工具则可将主体导出为透明背景图像,方便后续合成使用。

「Multi-Ref Editing(多参考图编辑)」功能允许用户将最多五张输入图像合并为一次生成结果,为需要融合多个视觉元素的创作场景提供便利。「Smart Resize(智能调整尺寸)」功能则可将现有图像转换为任意宽高比,模型会自动填充新增的画面空间,无需用户手动补全内容。

xAI还为Imagine Image 2.0配备了预设模板系统,将常见图像工作流整合为开箱即用的起点。模板涵盖照片编辑、产品摄影、营销素材、设计工具、游戏资产及直播表情包等多个类别,旨在降低专业创作门槛。xAI表示,该模型能够在保持统一视觉风格的前提下,分别生成角色、场景和道具,并将这一能力定位为迈向完整视频制作工作流的重要基础。

要点

  • Imagine Image 2.0在Arena基准测试中位居全球第二,Elo评分在图像编辑和文本生成图像两项中均仅次于OpenAI GPT-Image-2
  • 新模型内置Magic Wand、多参考图编辑、智能调整尺寸及背景移除等实用编辑工具,覆盖多种创作场景
  • 预设模板系统横跨产品摄影、游戏资产、营销素材等六大类别,降低专业工作流使用门槛
  • xAI将角色、场景、道具的风格一致性生成能力定位为视频制作前期准备的核心功能
  • API接入支持即将开放,进一步拓展开发者和企业用户的使用空间
查看原始来源

原始标题:xAI's Imagine Image 2.0 lands just behind OpenAI's GPT-Image-2 in Arena benchmarks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。