返回岗位列表

Together AI

LLM推理框架与优化工程师

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

设计和开发用于文本、图像和多模态生成模型的容错、高并发分布式推理引擎;实现和优化分布式推理策略,包括专家混合(MoE)并行、张量并行、流水线并行,以实现高性能服务;应用CUDA图优化、TensorRT/TRT-LLM图优化、基于PyTorch的编译(torch.compile)和推测解码,以提高效…

岗位职责

  • 设计和开发用于文本、图像和多模态生成模型的容错、高并发分布式推理引擎
  • 实现和优化分布式推理策略,包括专家混合(MoE)并行、张量并行、流水线并行,以实现高性能服务
  • 应用CUDA图优化、TensorRT/TRT-LLM图优化、基于PyTorch的编译(torch.compile)和推测解码,以提高效率和可扩展性
  • 与硬件团队合作进行性能瓶颈分析,共同优化GPU、TPU或定制加速器的推理性能
  • 与AI研究人员和基础设施工程师密切合作,开发高效的模型执行计划并优化端到端模型服务流水线

任职要求

  • 3年以上深度学习推理框架、分布式系统或高性能计算经验
  • 具备以下至少一项的背景知识和经验:GPU编程(CUDA/Triton/TensorRT)、编译器、模型量化、GPU集群调度
  • 深入理解KV缓存系统,如Mooncake、PagedAttention或自定义内部变体
  • 精通Python和C++/CUDA,用于高性能深度学习推理
  • 了解推理优化技术,如工作负载调度、CUDA图、编译、高效内核
  • 具备强大的分析问题解决能力和绩效驱动意识