返回岗位列表

Together AI

高级机器学习工程师,语音AI

地点:美国 薪资:$220,000-$280,000 日期:2026-07-20

岗位摘要

端到端负责语音推理路线图——定义并执行优化STT、TTS和语音到语音模型的技术策略;推动一流的推理性能——架构并实现针对语音工作负载的领先TTFB、吞吐量和GPU利用率的系统;领导语音模型的大规模生产化——为无服务器和专用端点设计服务架构,包括批处理策略、流式推理管道和针对实时音频的内存管理

岗位职责

  • 端到端负责语音推理路线图——定义并执行优化STT、TTS和语音到语音模型的技术策略
  • 推动一流的推理性能——架构并实现针对语音工作负载的领先TTFB、吞吐量和GPU利用率的系统
  • 领导语音模型的大规模生产化——为无服务器和专用端点设计服务架构,包括批处理策略、流式推理管道和针对实时音频的内存管理
  • 构建语音评估平台——设计一个严谨、可扩展的评估框架,涵盖不同口音、语言和噪声条件下的WER,以及TTS的自然度、延迟和发音保真度
  • 为下一代模型支持塑造架构——预见并支持新兴模型范式,如音频原生LLM、基于编解码器的架构和端到端语音到语音系统
  • 担任模型合作伙伴集成的技术DRI——领导与Cartesia、Deepgram和Rime等合作伙伴的深度协作,负责从集成到优化再到持续性能问责的完整生命周期
  • 诊断并解决堆栈中最棘手的性能问题——进行系统性的性能分析和根本原因分析,从GPU内核行为到框架级瓶颈
  • 影响整个组织的平台架构——与平台工程领导层合作,确保服务层满足实时语音API的延迟和可靠性需求
  • 定义并扩展语音微调能力——领导技术方向,使客户能够在Together的基础设施上微调STT和TTS模型

任职要求

  • 拥有机器学习、计算机科学或相关领域的硕士或博士学位
  • 在机器学习工程方面拥有丰富的经验,特别是在模型推理优化方面
  • 精通推理引擎,如TRT-LLM、SGLang或类似技术
  • 对语音AI模型(如Whisper、Parakeet、Orpheus、Kokoro)有深入理解
  • 具备GPU性能分析和优化经验(如H100、H200、B200)
  • 有设计和实现流式音频处理管道的经验
  • 熟悉语音评估指标,如WER、延迟和自然度
  • 具备出色的编程能力,熟练掌握Python和C++
  • 有与外部合作伙伴进行技术协作的经验
  • 能够在一个小型、快节奏的团队中独立工作并产生重大影响

福利待遇

  • 有竞争力的薪资和股权
  • 在旧金山办公室工作,提供灵活的工作安排
  • 有机会与最先进的GPU加速器(H100、H200、B200)合作
  • 加入一个高影响力的早期团队,塑造语音AI的未来
  • 与行业领先的模型合作伙伴(如Cartesia、Deepgram、Rime)合作
  • 参与定义和构建下一代语音推理基础设施
  • 提供职业成长和学习机会