LLM推理优化工程师
岗位摘要
负责分布式训练与推理协同优化;推动Quantized-aware Training (QAT) 和 Quantized Training 的工程化落地,研发W8A8、W4A16等低比特训练方案,实现训练与推理精度-效率的最优平衡
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责分布式训练与推理协同优化
- 推动Quantized-aware Training (QAT) 和 Quantized Training 的工程化落地,研发W8A8、W4A16等低比特训练方案,实现训练与推理精度-效率的最优平衡
- 设计并实现Speculative Decoding(投机解码)及其变体(如EAGLE、DFlash等)的全链路方案,包括Draft模型训练、接受率优化与系统调度策略
- 建立从训练到推理的端到端优化链路,确保相关训练方案在推理侧获得可度量的性能收益
任职要求
- 计算机科学、电子工程或相关专业本科及以上学历,3年以上高性能计算/深度学习系统相关经验
- 扎实的分布式系统功底:深入理解多机并行训练/推理相关技术,具备大规模训练框架(Megatron-LM)及主流推理框架(vLLM、SGLang)的开发能力
- 以下两项至少具备其一:掌握低比特推理与量化技术,熟悉GPTQ、AWQ、SmoothQuant等后量化方案,理解训练感知量化的实现细节与数值稳定性处理,熟悉MXFP4、NVFP4等新兴低比特量化格式;深入理解投机解码原理,掌握Draft模型与Target模型的协同机制,了解EAGLE3、DFlash等当前主流方法的训练、推理实现方法
- 优先考虑:具备LLM算法基础,熟悉大模型训练相关算法与技术;熟悉CUDA编程模型,熟练使用Nsight Systems/Compute进行性能剖析,能够手写高性能CUDA Kernel;在LLM算法/体系结构/系统领域相关顶级会议或期刊上有论文发表
福利待遇
- 薪资范围:25-50K·16薪
- 工作地点:北京海淀区京东科技大厦13层
工作地址
北京海淀区京东科技大厦13层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。