AI资讯 / 产业

产业 / 媒体

OpenAI发布GPT Transcribe,错误率仍落后ElevenLabs、谷歌和Mistral

The Decoder

OpenAI近日通过API正式推出两款新语音识别模型:GPT Transcribe与GPT Live Transcribe。前者专为预录音频设计,处理速度约为实时速度的34倍;后者则面向低延迟实时流式转录场景。根据Artificial Analysis发布的AA-WER基准测试,GPT Transcribe的词错误率为3.31%,较一年前的前代模型GPT-4o Transcribe下降了0.7个百分点,同时定价下调25%至每分钟音频0.0045美元。然而,在行业竞争格局中,OpenAI仍未能跻身前三:ElevenLabs Scribe v2以2.3%的错误率领跑,谷歌Gemini 3 Pro以2.9%位居第二,Mistral的Voxtral Small以3%排名第三。Mistral还推出了起价仅为每分钟0.003美元的Voxtral Transcribe V2,在价格层面对市场形成明显压力。两款新模型均支持文本上下文输入、关键词提示及多语言输入。

OpenAI于2026年7月29日通过API发布了两款全新语音识别模型——GPT Transcribe与GPT Live Transcribe。其中,GPT Transcribe专为处理预录音频文件而设计,处理速度约为实时速度的34倍,适合批量转录场景;GPT Live Transcribe则针对实时流式转录进行了优化,主打低延迟响应,适用于直播字幕、实时会议记录等应用场景。两款模型均支持文本上下文输入、关键词提示以及多语言输入。

在性能层面,根据Artificial Analysis运营的AA-WER基准测试,GPT Transcribe的词错误率为3.31%,较前代模型GPT-4o Transcribe下降了约0.7个百分点。与此同时,OpenAI将该模型的定价下调25%,新价格定为每分钟音频0.0045美元,在成本控制方面向开发者释放了一定诚意。

尽管性能有所提升,OpenAI在行业竞争中仍面临较大压力。在AA-WER排行榜上,ElevenLabs Scribe v2以2.3%的词错误率高居榜首,谷歌Gemini 3 Pro以2.9%位居第二,Mistral的Voxtral Small以3%排名第三,OpenAI的GPT Transcribe以3.31%位列第四,与头部竞争对手之间仍存在可见差距。

价格竞争同样不容忽视。Mistral近期推出的Voxtral Transcribe V2起价仅为每分钟0.003美元,大幅低于OpenAI的0.0045美元,对市场定价体系形成明显冲击。这意味着开发者在选择语音转录服务时,不仅需要权衡精度,还需综合考量成本效益。

此次发布的两款转录模型是OpenAI近期语音能力布局的组成部分。OpenAI此前还宣布了新一代实时模型,其中包括实时转录模型GPT-Realtime-Whisper。多款模型的协同推出,显示出OpenAI正在加速完善其语音AI产品矩阵,以应对来自谷歌、ElevenLabs及Mistral等竞争对手的多方位挑战。

要点

  • GPT Transcribe词错误率为3.31%,较前代下降0.7个百分点,定价同步下调25%至每分钟0.0045美元
  • 在AA-WER基准排名中,OpenAI位列第四,落后于ElevenLabs、谷歌和Mistral
  • Mistral推出的Voxtral Transcribe V2起价仅为每分钟0.003美元,在价格层面对市场形成显著压力
  • GPT Live Transcribe专为低延迟实时流式转录设计,与GPT Transcribe共同构成OpenAI语音转录产品线
查看原始来源

原始标题:GPT Transcribe improves on its predecessor but can't catch ElevenLabs, Google, or Mistral on error rates

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。