产业 / 媒体
Qwen3.8-Omni-Flash多模态性能比肩Gemini Flash,API定价却低出数倍
阿里巴巴旗下通义千问团队发布Qwen3.8-Omni-Flash,这是Qwen系列首个专为AI智能体设计的多模态模型。该模型能够同时处理音频与视频内容,并可自主调用工具完成视频剪辑、短片翻译、电影摘要等任务,上下文窗口长达100万token。在音视频基准测试中,Qwen3.8-Omni-Flash的表现与谷歌Gemini 3.8 Flash相当,但API定价仅为每百万输入token 0.15美元、每百万输出token 0.47美元,远低于Gemini Flash 3.8的0.75美元输入和3.75美元输出的入门价格,且后者计划于2027年1月1日起将价格翻倍。此外,开源插件生态Qwen-MM-Plugins为Claude Code、Gemini CLI等主流智能体框架提供视频编辑、说话人识别、PDF视频笔记及可复用工作流等扩展能力,进一步强化了其在智能体应用场景中的竞争力。
通义千问团队于2026年9月正式推出Qwen3.8-Omni-Flash,将其定位为首个面向AI智能体场景的多模态模型。与此前的多模态模型不同,该模型不仅能够同时理解音频和视频输入,还能在无需人工干预的情况下自主调用外部工具,完成视频博客剪辑、短视频翻译、长片内容摘要等复杂任务。100万token的超长上下文窗口,使其在处理长视频或多轮对话时具备明显优势。
在性能层面,Qwen官方公布的音视频基准测试数据显示,Qwen3.8-Omni-Flash的得分与谷歌Gemini 3.8 Flash基本持平。这一结果意味着开发者在不显著牺牲模型能力的前提下,可以获得大幅降低的使用成本。对于需要大规模调用多模态API的企业和独立开发者而言,这一性价比差距具有实质性的商业意义。
定价是Qwen3.8-Omni-Flash最具竞争力的维度之一。其API定价为每百万输入token 0.15美元、每百万输出token 0.47美元;音频输入估算成本低于每小时0.01美元,720p视频(含音频,每秒一帧)约为每小时0.20美元(不含响应费用)。相比之下,Gemini 3.8 Flash目前的入门价格为输入0.75美元、输出3.75美元,且谷歌已宣布该价格将于2027年1月1日起翻倍,差距将进一步拉大。
在生态建设方面,Qwen团队同步开源了Qwen-MM-Plugins插件库,为主流AI智能体框架提供扩展支持,涵盖Claude Code、Gemini CLI和Qwen Code等平台。插件功能包括视频编辑、说话人识别、PDF视频笔记生成以及可复用的自动化工作流,帮助开发者快速将多模态能力集成到现有智能体项目中,降低二次开发门槛。
此外,Qwen还推出了Qwen-Live Harness工具,支持通过摄像头和麦克风进行实时交互,进一步拓展了模型在实时场景下的应用边界。目前,Qwen3.8-Omni-Flash已通过Qwen Studio、Qwen Cloud及API三种渠道对外开放,开发者可根据自身需求选择接入方式。随着多模态AI竞争持续加剧,低价高效的开源友好策略正成为中国AI厂商在全球市场突围的重要路径。
要点
- Qwen3.8-Omni-Flash是Qwen首个面向AI智能体的多模态模型,支持音视频联合理解与自主工具调用,上下文窗口达100万token。
- 在音视频基准测试中,该模型性能与谷歌Gemini 3.8 Flash相当,但API输入定价仅为Gemini的五分之一,输出定价约为八分之一。
- 谷歌Gemini Flash 3.8已宣布2027年1月起价格翻倍,届时两者的成本差距将进一步扩大。
- 开源插件库Qwen-MM-Plugins支持Claude Code、Gemini CLI等主流智能体框架,提供视频编辑、说话人识别等扩展功能。
- Qwen-Live Harness新增实时摄像头与麦克风交互能力,拓展了模型在实时多模态场景中的应用潜力。
原始标题:Qwen3.8-Omni-Flash undercuts Google's Gemini Flash pricing while matching its multimodal benchmarks
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。