返回岗位列表

月之暗面

强化学习基础设施工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

针对大规模Agentic RL场景,设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享;深度定制vLLM,优化Rollout阶段的KV Cache复用、量化和投机方法,将Token生成延迟压至极限

岗位职责

  • 针对大规模Agentic RL场景,设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享
  • 深度定制vLLM,优化Rollout阶段的KV Cache复用、量化和投机方法,将Token生成延迟压至极限
  • 深入理解硬件,为RL的不同算法负载、不同硬件设施定制最优并行策略,最大化MFU

任职要求

  • 精通Megatron-LM分布式并行(TP/PP/CP/EP),能针对RL的多模型场景定制调度策略
  • 熟悉vLLM / SGLang核心机制(PageAttention、Prefix Caching、FlashAttention、MTP),具备二次开发能力
  • 扎实的CUDA / Triton / Cutlass编程能力,有过算子开发经验,能编写贴合SM调度与内存层次的高性能Kernel
  • 熟练使用Nsight工具链进行全链路性能分析,用数据驱动优化
  • 深入理解RLHF / RL推理的数据流:Policy采样 → Reward评估 → 优势估计 → 策略更新,能针对每个环节的负载特征做针对性优化
  • 熟悉PPO、GRPO、DPO等算法的工程实现细节,理解其稳定性挑战与优化技巧
  • 有大规模RL训练(千卡以上)实战经验,处理过训练崩溃、奖励Hack、方差爆炸等典型问题

福利待遇

  • 参与前沿AGI技术研发,直接推动Kimi智能跃迁
  • 与顶尖算法团队深度协同,探索下一代RL训练框架
  • 持续压榨硬件效率上限,实现技术极致追求