高级机器学习工程师,语音AI
岗位摘要
端到端负责语音推理路线图——定义并执行优化STT、TTS和语音到语音模型的技术策略;推动一流的推理性能——架构并实现针对语音工作负载的领先TTFB、吞吐量和GPU利用率的系统;领导语音模型的大规模生产化——为无服务器和专用端点设计服务架构,包括批处理策略、流式推理管道和针对实时音频的内存管理
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 端到端负责语音推理路线图——定义并执行优化STT、TTS和语音到语音模型的技术策略
- 推动一流的推理性能——架构并实现针对语音工作负载的领先TTFB、吞吐量和GPU利用率的系统
- 领导语音模型的大规模生产化——为无服务器和专用端点设计服务架构,包括批处理策略、流式推理管道和针对实时音频的内存管理
- 构建语音评估平台——设计一个严谨、可扩展的评估框架,涵盖不同口音、语言和噪声条件下的WER,以及TTS的自然度、延迟和发音保真度
- 为下一代模型支持塑造架构——预见并支持新兴模型范式,如音频原生LLM、基于编解码器的架构和端到端语音到语音系统
- 担任模型合作伙伴集成的技术DRI——领导与Cartesia、Deepgram和Rime等合作伙伴的深度协作,负责从集成到优化再到持续性能问责的完整生命周期
- 诊断并解决堆栈中最棘手的性能问题——进行系统性的性能分析和根本原因分析,从GPU内核行为到框架级瓶颈
- 影响整个组织的平台架构——与平台工程领导层合作,确保服务层满足实时语音API的延迟和可靠性需求
- 定义并扩展语音微调能力——领导技术方向,使客户能够在Together的基础设施上微调STT和TTS模型
任职要求
- 拥有机器学习、计算机科学或相关领域的硕士或博士学位
- 在机器学习工程方面拥有丰富的经验,特别是在模型推理优化方面
- 精通推理引擎,如TRT-LLM、SGLang或类似技术
- 对语音AI模型(如Whisper、Parakeet、Orpheus、Kokoro)有深入理解
- 具备GPU性能分析和优化经验(如H100、H200、B200)
- 有设计和实现流式音频处理管道的经验
- 熟悉语音评估指标,如WER、延迟和自然度
- 具备出色的编程能力,熟练掌握Python和C++
- 有与外部合作伙伴进行技术协作的经验
- 能够在一个小型、快节奏的团队中独立工作并产生重大影响
福利待遇
- 有竞争力的薪资和股权
- 在旧金山办公室工作,提供灵活的工作安排
- 有机会与最先进的GPU加速器(H100、H200、B200)合作
- 加入一个高影响力的早期团队,塑造语音AI的未来
- 与行业领先的模型合作伙伴(如Cartesia、Deepgram、Rime)合作
- 参与定义和构建下一代语音推理基础设施
- 提供职业成长和学习机会
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。