产业 / 媒体
ChatGPT 桌面版上线语音操控功能,一句话可完成多步骤复杂任务
OpenAI 于当地时间周四宣布更新 ChatGPT 桌面应用,正式引入 ChatGPT Voice 功能。该功能基于本月早些时候推出的 ChatGPT-Live 语音模型系列,允许用户通过语音直接控制 AI 智能体,在电脑上执行包含多个步骤的复杂任务。与此前手机版仅专注于流畅对话体验不同,桌面版具备更强的实际执行能力,支持 ChatGPT Work 和 Codex,并可调用计算机操作能力帮助用户访问网站和应用程序。在 macOS 平台上,借助 Appshots 功能,ChatGPT 还可读取屏幕内容,包括替代文本信息。演示视频中,一名开发者仅凭一句语音指令便完成了创建代码线程、提交 Pull Request 并定位 Bug 根因的全流程操作。与此同时,Anthropic 也同步更新了 Claude 的语音模式,支持在 Gmail、Slack、Notion 等主流应用中执行任务。
OpenAI 于 2026 年 8 月 8 日宣布,ChatGPT 桌面应用完成重要更新,正式加入 ChatGPT Voice 语音交互功能。这一能力建立在 OpenAI 本月初推出的全新 ChatGPT-Live 语音模型系列之上,标志着 ChatGPT 从单纯的对话工具向可执行操作的 AI 智能体迈出关键一步。用户无需键盘输入,直接开口说话即可驱动 AI 完成各类电脑端任务。
与手机版 ChatGPT Voice 相比,桌面版在执行能力上有显著提升。手机版上线之初主要优化了语音对话的流畅度以及用户打断 AI 时的响应效果,但并不支持直接在设备上执行操作。桌面版则打通了这一环节,用户可以下达包含多个步骤的复杂指令,ChatGPT 在执行过程中若需要额外信息或用户确认,也会主动发起交互,形成真正意义上的人机协作闭环。
在功能集成层面,ChatGPT Voice 桌面版同时支持 ChatGPT Work 和代码智能体 Codex,并具备调用计算机操作能力,可帮助用户访问指定网站和应用程序。在 macOS 平台上,借助 Appshots 功能,用户还可授权 ChatGPT 读取屏幕上的内容,包括图片的替代文本,进一步拓展了 AI 感知和理解当前工作环境的能力边界。
OpenAI 发布的演示视频直观呈现了这一功能的实际效果:一名开发者仅凭一句语音指令,便让 ChatGPT 依次完成了创建新代码线程、提交 Pull Request,以及追溯并定位某个 Bug 根本原因的完整工作流。这一场景展示了语音操控在软件开发领域的实用潜力,也预示着 AI 智能体正在向更深层的专业工作场景渗透。此外,用户还可通过 iOS 应用的远程访问功能,在 Codex 中调用 ChatGPT Voice。
在 OpenAI 推进语音智能体能力的同时,竞争对手 Anthropic 也同步更新了旗下 Claude 的语音模式。Claude 语音功能可调用 Opus、Sonnet 和 Haiku 三款模型,并支持在 Gmail、Google Calendar、Slack、Notion 和 Canva 等主流生产力与协作应用中执行具体任务。两家头部 AI 公司几乎同期推出语音智能体能力,表明将语音交互与实际任务执行相结合,已成为当前 AI 助手竞争的核心战场。
要点
- ChatGPT 桌面版新增基于 ChatGPT-Live 模型的语音功能,用户可通过语音驱动 AI 智能体在电脑上执行多步骤复杂任务。
- 桌面版执行能力显著强于手机版,支持 ChatGPT Work 和 Codex,并可在 macOS 上通过 Appshots 读取屏幕内容。
- 演示场景显示,开发者可用一句语音指令完成创建代码线程、提交 Pull Request 及定位 Bug 的完整工作流。
- Anthropic 同步推出 Claude 语音模式,支持在 Gmail、Slack、Notion 等应用中执行任务,语音智能体赛道竞争加剧。
原始标题:OpenAI 桌面端 ChatGPT 上线语音交互功能,可语音操控电脑执行多步骤任务
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。