AI资讯 / 产业

产业 / 媒体

谷歌发布 Gemini 3.5 Transcribe,AI 语音转文字能力扩展至更多产品

Ars Technica AI

谷歌正式推出 Gemini 3.5 Transcribe,这是一款基于 Gemini 大模型的 AI 语音转文字服务。该技术此前已在 Gboard 键盘的 Rambler 功能中得到应用,能够将用户的口述内容实时转化为流畅的书面文字。此次发布意味着这一能力将从单一输入法场景扩展至更广泛的谷歌产品生态,Chrome 浏览器被列为首批受益产品之一。Gemini 3.5 Transcribe 的推出,标志着谷歌在语音交互领域的布局进一步深化,也体现出其将 Gemini 系列模型能力系统性整合进旗下各类产品的战略意图。随着 AI 语音识别精度持续提升,该功能有望在无障碍访问、内容创作及多语言沟通等场景中发挥重要作用。

谷歌于近日正式宣布推出 Gemini 3.5 Transcribe,这是其 Gemini 模型家族中专注于语音转文字任务的新成员。与此前发布的多模态或对话类模型不同,Gemini 3.5 Transcribe 将能力聚焦于高精度语音识别,旨在为开发者和终端用户提供更自然、更准确的语音输入体验。

这项技术并非全新起步。Gemini 3.5 Transcribe 的核心能力此前已在谷歌自家输入法 Gboard 的 Rambler 功能中得到实际验证。Rambler 允许用户通过语音快速生成段落文字,并由 AI 自动整理成连贯表达,受到部分用户的广泛好评。此次独立发布,意味着这一经过打磨的语音 AI 将走出输入法的边界。

Chrome 浏览器是谷歌明确列出的首批集成产品之一。考虑到 Chrome 在全球拥有数十亿用户,Gemini 3.5 Transcribe 的加入有望显著提升浏览器在语音输入、实时字幕、网页内容朗读转录等场景下的表现,为用户带来更流畅的人机交互体验。

从更宏观的视角来看,此次发布是谷歌将 Gemini 系列模型能力系统性嵌入自有产品矩阵的重要一步。谷歌正在将 Gemini 打造成贯穿搜索、办公、浏览器、移动端等多个触点的统一 AI 基础设施,语音识别作为人机交互的核心入口,自然成为优先整合的能力模块。

AI 驱动的语音转文字技术在无障碍访问领域同样具有重要意义。对于听障人士、语言学习者以及需要在嘈杂环境中快速记录信息的用户而言,高精度实时转录能够大幅降低信息获取门槛。谷歌此举也被外界解读为在该领域对 OpenAI Whisper 及 Apple 语音识别等竞争方案的直接回应。

目前,谷歌尚未完整披露 Gemini 3.5 Transcribe 支持的语言数量、离线能力及开发者 API 接入细节。随着更多产品陆续完成集成,这款语音 AI 的实际表现与覆盖范围将成为业界持续关注的焦点。

要点

  • 谷歌正式推出 Gemini 3.5 Transcribe,将 AI 语音转文字能力从 Gboard Rambler 扩展至更广泛的产品线
  • Chrome 浏览器是首批集成 Gemini 3.5 Transcribe 的谷歌产品之一,有望提升语音输入与实时转录体验
  • 此举是谷歌将 Gemini 模型系统性整合进自有产品生态的战略延续,语音交互成为关键布局方向
  • 该技术在无障碍访问、多语言沟通及内容创作等场景具有广泛应用潜力
  • 开发者 API 及多语言支持等细节尚待谷歌进一步披露
查看原始来源

原始标题:Google announces Gemini 3.5 Transcribe for AI-powered speech-to-text

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。