产业 / 媒体
单次生成完整信息图与可读十像素文字
阿里巴巴Qwen团队发布Qwen-Image-3.0图像生成模型,主打“真实”应用场景。该模型支持最长4500 token的提示输入,能单次生成包含多面板信息图、LaTeX论文、报纸版面等复杂布局。其文字渲染精度达到十像素可读水平,并原生支持12种语言。模型还具备照片级细节表现力,可呈现皮肤纹理、发丝等微观特征。目前仅通过邀请制API开放,后续将集成至Qwen Chat等应用。与早期版本不同,此次模型权重不太可能开源。
阿里巴巴Qwen团队正式发布Qwen-Image-3.0,这是其图像生成模型的第三代版本。团队表示,第一代聚焦“精准”,第二代追求“精准、多样、完整、美观与真实”,而第三代的核心目标只有一个词——“真实”。该模型旨在处理报纸排版、故事板、考试试卷等实际工作,而非仅仅生成美观图片。
Qwen-Image-3.0支持最长4500 token的提示输入,使其能够一次性构建密集布局,而非拼接多张图像。演示中,一个3x3网格包含九张独立信息图,涵盖工程、哲学、物理、医学、数学、金融和细胞生物学等领域的文本与公式。另一示例展示了嵌套界面:VSCode窗口内嵌Qwen Chat屏幕,其中又包含微信对话,对话里还有一张手冲咖啡海报,四层界面融为一体。
模型在文字渲染上实现突破,可生成十像素大小的可读文字。示例包括一张充满文字的鲸鲨信息图,以及一页虚构代数几何论文,其中包含多行LaTeX公式,带有下标、上标、括号、分数、求和与乘积符号。此外,模型还能模拟报纸页面和红色手写批注,类似教师评语。在肖像和物体生成上,模型可呈现可见毛孔、皮肤纹理和发丝等照片级细节。
Qwen-Image-3.0原生支持12种语言,包括日语、韩语和西班牙语。演示还展示了其重建网站、游戏和直播界面的能力。在编辑演示中,模型将一张昆虫照片转化为完整的鉴定图板,包含分类信息、身体特征标签、放大细节图和比例尺。模型还能接入实时互联网数据,例如生成杭州天气预报。另一示例将中国水墨画家齐白石与文森特·梵高置于模拟直播工作室中。
阿里巴巴于今年五月刚发布前代产品Qwen-Image-2.0,其技术报告聚焦训练与推理效率提升。在阿里自家竞技场测试中,Qwen-Image-2.0仅次于OpenAI的GPT-Image-2和Google的Nano Banana Pro。目前Qwen-Image-3.0仅通过邀请制API提供,预计很快将出现在Qwen Chat等自有应用中。与原始Qwen-Image不同,此次模型权重不太可能以开源许可证发布。
尽管技术令人印象深刻,但部分演示的实际价值存疑。研究人员通常使用LaTeX编写和排版论文,而非将其渲染为图像。AI生成的公式页面更适合用于样机和视觉草稿,而非最终论文。报纸页面和复杂信息图也面临类似问题。现代图像模型可编辑单个文字元素,但可搜索和可编辑格式在生产工作中仍更具灵活性。不过,这些示例展示了文字渲染的巨大进步,可能指向超越演示的实用应用。
要点
- Qwen-Image-3.0支持4500 token长提示,可单次生成复杂信息图、论文和报纸版面。
- 模型文字渲染精度达十像素,原生支持12种语言,包括日语、韩语和西班牙语。
- 具备照片级细节表现力,可呈现皮肤纹理、发丝等微观特征,并支持图像编辑与修复。
- 目前仅通过邀请制API开放,后续将集成至Qwen Chat等应用,但模型权重不太可能开源。
- 部分演示场景(如论文渲染为图像)的实际应用价值仍有待验证。
原始标题:Alibaba's Qwen-Image-3.0 renders full infographic grids and readable ten-pixel text in a single pass
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。