返回岗位列表

Together AI

高级平台工程师,语音AI

地点:美国 薪资:$200,000-$260,000 日期:2026-07-20

岗位摘要

构建并强化用于语音转文本和文本转语音的实时WebSocket和HTTP流式API,包括连接生命周期管理、背压处理、错误处理和重连机制,达到生产级语音代理的可靠性标准;设计并实现语音模型端点的自动扩缩容,处理突发实时流量模式,考虑并发连接限制、流状态和严格的延迟上限

岗位职责

  • 构建并强化用于语音转文本和文本转语音的实时WebSocket和HTTP流式API,包括连接生命周期管理、背压处理、错误处理和重连机制,达到生产级语音代理的可靠性标准
  • 设计并实现语音模型端点的自动扩缩容,处理突发实时流量模式,考虑并发连接限制、流状态和严格的延迟上限
  • 实现语音专用API功能:词级对齐、实时说话人分离、音频格式灵活性(用于电话的g711/mulaw、PCM、WebRTC格式)、发音控制以及多上下文WebSocket支持
  • 构建语音专用可观测性系统,包括延迟分解、音频质量信号和仪表板,帮助团队和客户调试问题
  • 负责跨模型合作伙伴(Cartesia、Deepgram、Rime等)的多模型标准化,确保底层供应商不同时API行为一致
  • 与机器学习工程团队协作,优化API层与模型服务栈之间的接口,确保端到端满足延迟和可靠性要求
  • 贡献开发者体验:API设计、文档、集成指南、演示环境,展示如何构建最佳语音代理
  • 为后续多个新产品奠定基础

任职要求

  • 5年以上构建大规模实时分布式系统和API服务的经验
  • 在实时流式基础设施方面有深厚专长:WebSocket服务器架构、服务器推送事件、双向流、连接复用和有状态协议设计
  • 精通TypeScript和Python编程;有Rust经验者优先
  • 扎实的分布式系统基础:负载均衡、自动扩缩容、速率限制和针对延迟敏感工作负载的流量整形
  • 有Kubernetes经验,包括自定义自动扩缩器、资源管理和有状态服务的健康检查
  • 强烈的产品意识:关注API易用性,思考构建语音应用的开发者真正需要什么
  • 适应小型早期团队,能身兼多职并快速行动
  • 有音频或媒体协议(WebRTC、g711、PCM编码)经验者优先
  • 熟悉机器学习模型服务基础设施

福利待遇

  • 加入高影响力的早期团队,参与定义语音AI基础设施的未来
  • 与顶尖工程师合作,解决实时语音处理中的前沿技术挑战
  • 有机会直接影响产品方向和开发者体验
  • 参与快速增长的语音AI领域,从早期客户阶段推动产品成为行业标准
  • 灵活的工作环境,支持远程办公