高级机器学习工程师,语音AI
岗位摘要
优化语音模型(STT、TTS、语音到语音)的推理性能,针对我们精选的模型集,实现最佳的首次字节时间、吞吐量和GPU利用率;在无服务器和专用端点上将语音模型投入生产,包括针对音频工作负载的批处理策略、流式推理和内存管理
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 优化语音模型(STT、TTS、语音到语音)的推理性能,针对我们精选的模型集,实现最佳的首次字节时间、吞吐量和GPU利用率
- 在无服务器和专用端点上将语音模型投入生产,包括针对音频工作负载的批处理策略、流式推理和内存管理
- 构建并维护语音模型评估框架,衡量STT在不同口音、语言和噪声条件下的词错误率,以及TTS的自然度、延迟和发音准确性
- 随着领域发展,在我们的服务栈中启用新的模型架构,包括音频原生大语言模型、基于编解码器的模型(SNAC)和语音到语音系统
- 与模型合作伙伴(Cartesia、Deepgram、Rime等)合作,在Together的基础设施上集成和优化他们的模型
- 对整个推理栈进行性能分析和调试,从GPU内核到框架级别的瓶颈,并交付可衡量的改进
- 与平台工程团队合作,确保服务层满足实时语音API的延迟和可靠性要求
- 为语音模型微调能力(STT和TTS)做出贡献,使客户能够在Together上构建差异化的语音体验
- 为后续多个新产品奠定基础
任职要求
- 5年以上机器学习工程经验,专注于模型服务、推理优化或机器学习基础设施
- 具备大语言模型服务引擎(vLLM、SGLang、TensorRT-LLM或类似)的实践经验,能够阅读和修改引擎内部实现,而不仅仅是使用API
- 精通Python和PyTorch;具备GPU性能分析和优化经验(CUDA、内存管理、内核级调试)
- 有将机器学习系统投入生产并带来可衡量的性能改进的记录
- 强烈的产品意识,能够思考构建语音应用的开发者的实际需求,而不仅仅是技术上的兴趣点
- 适应小型早期团队,能够身兼多职并快速行动
- 具备语音和音频机器学习经验(ASR、TTS架构、音频信号处理)是重要加分项,但不是必须的——如果具备扎实的机器学习工程基础,可以快速学习
- 熟悉音频处理
福利待遇
- 加入一个高影响力的小型早期团队,对快速增长的产品领域产生巨大影响
- 直接使用最先进的加速器(H100s、H200s、B200s)优化语音模型推理
- 与领先的模型合作伙伴(Cartesia、Deepgram、Rime等)合作,将他们的模型投入生产
- 有机会塑造Together的语音平台服务栈,推动行业从流水线架构向端到端语音到语音的转变
- 参与构建质量评估框架,指导客户模型选择并影响产品路线图
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。