返回岗位列表

Together AI

高级机器学习工程师,语音AI

地点:美国 薪资:$200,000-$260,000 日期:2026-07-20

岗位摘要

优化语音模型(STT、TTS、语音到语音)的推理性能,针对我们精选的模型集,实现最佳的首次字节时间、吞吐量和GPU利用率;在无服务器和专用端点上将语音模型投入生产,包括针对音频工作负载的批处理策略、流式推理和内存管理

岗位职责

  • 优化语音模型(STT、TTS、语音到语音)的推理性能,针对我们精选的模型集,实现最佳的首次字节时间、吞吐量和GPU利用率
  • 在无服务器和专用端点上将语音模型投入生产,包括针对音频工作负载的批处理策略、流式推理和内存管理
  • 构建并维护语音模型评估框架,衡量STT在不同口音、语言和噪声条件下的词错误率,以及TTS的自然度、延迟和发音准确性
  • 随着领域发展,在我们的服务栈中启用新的模型架构,包括音频原生大语言模型、基于编解码器的模型(SNAC)和语音到语音系统
  • 与模型合作伙伴(Cartesia、Deepgram、Rime等)合作,在Together的基础设施上集成和优化他们的模型
  • 对整个推理栈进行性能分析和调试,从GPU内核到框架级别的瓶颈,并交付可衡量的改进
  • 与平台工程团队合作,确保服务层满足实时语音API的延迟和可靠性要求
  • 为语音模型微调能力(STT和TTS)做出贡献,使客户能够在Together上构建差异化的语音体验
  • 为后续多个新产品奠定基础

任职要求

  • 5年以上机器学习工程经验,专注于模型服务、推理优化或机器学习基础设施
  • 具备大语言模型服务引擎(vLLM、SGLang、TensorRT-LLM或类似)的实践经验,能够阅读和修改引擎内部实现,而不仅仅是使用API
  • 精通Python和PyTorch;具备GPU性能分析和优化经验(CUDA、内存管理、内核级调试)
  • 有将机器学习系统投入生产并带来可衡量的性能改进的记录
  • 强烈的产品意识,能够思考构建语音应用的开发者的实际需求,而不仅仅是技术上的兴趣点
  • 适应小型早期团队,能够身兼多职并快速行动
  • 具备语音和音频机器学习经验(ASR、TTS架构、音频信号处理)是重要加分项,但不是必须的——如果具备扎实的机器学习工程基础,可以快速学习
  • 熟悉音频处理

福利待遇

  • 加入一个高影响力的小型早期团队,对快速增长的产品领域产生巨大影响
  • 直接使用最先进的加速器(H100s、H200s、B200s)优化语音模型推理
  • 与领先的模型合作伙伴(Cartesia、Deepgram、Rime等)合作,将他们的模型投入生产
  • 有机会塑造Together的语音平台服务栈,推动行业从流水线架构向端到端语音到语音的转变
  • 参与构建质量评估框架,指导客户模型选择并影响产品路线图