强化学习基础设施工程师
岗位摘要
针对大规模Agentic RL场景,设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享;深度定制vLLM,优化Rollout阶段的KV Cache复用、量化和投机方法,将Token生成延迟压至极限
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 针对大规模Agentic RL场景,设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享
- 深度定制vLLM,优化Rollout阶段的KV Cache复用、量化和投机方法,将Token生成延迟压至极限
- 深入理解硬件,为RL的不同算法负载、不同硬件设施定制最优并行策略,最大化MFU
任职要求
- 精通Megatron-LM分布式并行(TP/PP/CP/EP),能针对RL的多模型场景定制调度策略
- 熟悉vLLM / SGLang核心机制(PageAttention、Prefix Caching、FlashAttention、MTP),具备二次开发能力
- 扎实的CUDA / Triton / Cutlass编程能力,有过算子开发经验,能编写贴合SM调度与内存层次的高性能Kernel
- 熟练使用Nsight工具链进行全链路性能分析,用数据驱动优化
- 深入理解RLHF / RL推理的数据流:Policy采样 → Reward评估 → 优势估计 → 策略更新,能针对每个环节的负载特征做针对性优化
- 熟悉PPO、GRPO、DPO等算法的工程实现细节,理解其稳定性挑战与优化技巧
- 有大规模RL训练(千卡以上)实战经验,处理过训练崩溃、奖励Hack、方差爆炸等典型问题
福利待遇
- 参与前沿AGI技术研发,直接推动Kimi智能跃迁
- 与顶尖算法团队深度协同,探索下一代RL训练框架
- 持续压榨硬件效率上限,实现技术极致追求
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。