返回岗位列表

腾讯

语音/音频大模型研发工程师

地点:深圳 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责语音/音频大模型研发,包括语音对话(语音交互/音视频对话)、音频理解(ASR/音频caption)、音频生成(TTS/视频配音)等模型研发;负责语音/音频大模型的预训练、后训练、强化学习(文本和音频强化)相关的数据和算法工作

岗位职责

  • 负责语音/音频大模型研发,包括语音对话(语音交互/音视频对话)、音频理解(ASR/音频caption)、音频生成(TTS/视频配音)等模型研发
  • 负责语音/音频大模型的预训练、后训练、强化学习(文本和音频强化)相关的数据和算法工作
  • 负责语音对话/音频理解/音频生成的模型开源以及产品落地
  • 负责语音对话产品全链路端到端优化
  • 负责音频理解在噪音/口音/远场/音效音乐场景的优化
  • 负责语音合成在播报/闲聊/游戏/社交等场景的优化

任职要求

  • 计算机科学、人工智能、信号处理或相关领域的硕士及以上学历
  • 具备语音或音频大模型研发经验,熟悉语音识别、语音合成、语音对话或音频理解生成技术
  • 熟练掌握PyTorch、TensorFlow等深度学习框架以及Python或C++编程语言
  • 具备大模型预训练、后训练、强化学习相关的算法研发和工程实现经验
  • 熟悉音频信号处理、语音增强、噪声抑制或相关领域的技术原理和算法
  • 具备语音对话或音频处理产品全链路优化和实际落地部署的经验