LLM推理框架与优化工程师
岗位摘要
设计和开发用于文本、图像和多模态生成模型的容错、高并发分布式推理引擎;实现和优化分布式推理策略,包括专家混合(MoE)并行、张量并行、流水线并行,以实现高性能服务;应用CUDA图优化、TensorRT/TRT-LLM图优化、基于PyTorch的编译(torch.compile)和推测解码,以提高效…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和开发用于文本、图像和多模态生成模型的容错、高并发分布式推理引擎
- 实现和优化分布式推理策略,包括专家混合(MoE)并行、张量并行、流水线并行,以实现高性能服务
- 应用CUDA图优化、TensorRT/TRT-LLM图优化、基于PyTorch的编译(torch.compile)和推测解码,以提高效率和可扩展性
- 与硬件团队合作进行性能瓶颈分析,共同优化GPU、TPU或定制加速器的推理性能
- 与AI研究人员和基础设施工程师密切合作,开发高效的模型执行计划并优化端到端模型服务流水线
任职要求
- 3年以上深度学习推理框架、分布式系统或高性能计算经验
- 具备以下至少一项的背景知识和经验:GPU编程(CUDA/Triton/TensorRT)、编译器、模型量化、GPU集群调度
- 深入理解KV缓存系统,如Mooncake、PagedAttention或自定义内部变体
- 精通Python和C++/CUDA,用于高性能深度学习推理
- 了解推理优化技术,如工作负载调度、CUDA图、编译、高效内核
- 具备强大的分析问题解决能力和绩效驱动意识
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。