模型 / 官方
实时音视频交互与长期记忆一体化智能体框架
阿里通义团队于2026年9月21日正式发布 Qwen3.8 Omni Flash Realtime 模型,并同步开源配套的智能体框架 Qwen-Live-Harness v1.0.0。该框架基于 Qwen Omni Realtime API 构建,使用 TypeScript 编写,支持实时音视频交互、后台任务委托、主动触发提醒以及跨会话长期记忆四大核心能力。用户只需一条 npm 命令即可完成安装,无需本地模型权重或 GPU,通过阿里云 DashScope API 联网调用即可运行。框架目前完整支持 macOS 12 及以上系统(含 Apple Silicon 与 Intel),Windows 和 Linux 支持正在开发中。后台任务委托方面,框架可对接 Qwen Code、Codex、Claude Code、Gemini CLI 等主流编程智能体,实现任务分发与进度追踪。所有源代码完全开放,社区可自由贡献后端适配、交互方式及应用场景扩展。
2026年9月21日,阿里通义团队同步发布了 Qwen3.8 Omni Flash Realtime 模型与开源智能体框架 Qwen-Live-Harness v1.0.0。这一框架以 Qwen Omni Realtime API 为核心驱动,采用 TypeScript 开发,旨在为桌面端用户提供集实时感知、任务执行与记忆管理于一体的智能体运行环境。项目代码完全开放,欢迎社区在后端适配、交互方式和应用场景等方向持续贡献。
在实时交互能力方面,Qwen-Live-Harness 支持通过麦克风和摄像头进行音视频对话,并可将屏幕内容或摄像头画面作为视觉上下文传入模型。用户可在界面中灵活切换输入设备、视觉来源和截图模式。视觉分析支持按需快照与实时流两种模式,实时流默认以720p、1帧每秒的频率持续传输画面,满足屏幕监控与实时解说等场景需求。
任务委托是该框架的另一项核心能力。用户可将具体工作交由后台智能体处理,目前已支持对接 Qwen Code、Qoder CLI、Codex、Claude Code 和 Gemini CLI 等主流编程工具。框架会自动管理后台连接的启动,并提供任务进度追踪、授权请求处理和结果回传功能。用户还可连接已有的 Qwen Code 终端,通过授权文本指令触发主动汇报。
主动交互功能允许用户预设音频、视觉或时间条件,当特定事件发生时自动触发提醒。监控模式采用固定1帧每秒、两秒分块的方式进行观测,通知会在当前对话和音频播放结束后推送。官方明确指出,由于模型推理存在延迟且可能产生误判,该监控功能不适用于安全关键场景,不能替代专业报警系统。
长期记忆方面,框架支持跨会话保留用户偏好与上下文信息,并提供多记忆库的创建、选择与重命名功能。安装部署极为简便,用户只需依次执行 npm install、init 和启动命令,通过初始化向导配置语言、API 密钥、模型及服务区域即可使用。目前支持北京(中国区)和新加坡(国际区)两个服务区域,两区 API 密钥不可互换,需按需选择。
要点
- Qwen-Live-Harness 是阿里通义配套 Qwen3.8 Omni Flash Realtime 模型同步开源的智能体框架,支持实时音视频感知、任务委托、主动提醒和长期记忆四大能力。
- 框架无需本地 GPU 或模型权重,通过阿里云 DashScope API 联网运行,一条 npm 命令即可完成安装,当前完整支持 macOS 12 及以上系统。
- 后台任务委托支持对接 Qwen Code、Codex、Claude Code、Gemini CLI 等主流编程智能体,实现多智能体协作与任务分发。
- 视觉监控功能基于固定帧率采样,官方明确提示存在推理延迟和误判风险,不适用于安全关键报警场景。
- 所有源代码完全开放,支持社区在后端适配、交互方式和应用场景等方向自由扩展贡献。
原始标题:QwenLM/Qwen-Live-Harness — An open-source agent harness powered by the Qwen Omni Realtime API—see, hear, and act, with built-in memory.
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。