返回岗位列表

月之暗面

研究科学家 / 工程师 – Agentic RL/基础设施

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

在Agentic、多智能体RL的算法、环境与基础设施上取得突破性进展;将Kimi K2及后续模型的自主能力推向真实世界;设计和实现大规模训练与低延迟推理系统;参与分布式基础设施的设计与优化

岗位职责

  • 在Agentic、多智能体RL的算法、环境与基础设施上取得突破性进展
  • 将Kimi K2及后续模型的自主能力推向真实世界
  • 设计和实现大规模训练与低延迟推理系统
  • 参与分布式基础设施的设计与优化
  • 与团队合作,推动RL技术在真实场景中的应用

任职要求

  • 精通RL:策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL
  • 具备千卡级训练与低延迟推理的落地经验
  • 系统级编程与分布式架构设计能力(Python / C++ / Rust)
  • 有Agentic RL、工具调用或多智能体系统的发表或上线记录
  • 加分项:代码沙箱、程序合成、仿真器安全相关经验

加分项

  • 代码沙箱、程序合成、仿真器安全相关经验
  • 请附上 GitHub、论文或你最自豪的 RL 项目简介
  • 欢迎在以上某一方面具备SOTA能力的小伙伴加入
  • Research Scientist / Engineer – Agentic RL
  • Locations: Beijing · Shanghai · Shenzhen · Singapore · Silicon Valley
  • Mission
  • Invent the next leaps in agentic, multi-agent RL—algorithms, environments, infrastructure—that will carry Kimi K2 and its successors into real-world autonomy.
  • Core Requirements
  • Deep mastery of RL: policy-gradient, actor-critic, self-play, meta-RL, MARL.
  • Proven delivery of large-scale training & serving stacks (thousands of GPUs, low-latency rollouts).
  • Expert-level systems coding (Python/C++/Rust) and distributed infra design.
  • Track record of shipping or publishing on agentic RL, tool-use agents, or multi-agent systems.
  • Nice-to-have
  • Experience with code-execution sandboxes, program synthesis, or simulator security.
  • Apply with GitHub, papers, or a concise write-up of your coolest RL system.
  • Welcome partners with SOTA capabilities in one of the above aspects to join us.
  • 研究科学家 / 工程师 – Agentic RL
  • Moonshot AI · Kimi K2 及下一代模型
  • 工作地点:北京 · 上海 · 深圳 · 新加坡 · 硅谷
  • 在 Agentic、多智能体 RL 的算法、环境与基础设施上取得突破,把 Kimi K2 及后续模型的自主能力推向真实世界
  • 允许6个月内投递3个职位,请选择适合的职位进行投递

福利待遇

  • 与顶尖团队合作,参与前沿RL技术研发
  • 工作地点灵活:北京、上海、深圳、新加坡、硅谷
  • 有机会在顶级会议或期刊上发表研究成果
  • 参与具有真实世界影响力的项目