研究科学家 / 工程师 – Agentic RL/基础设施
岗位摘要
在Agentic、多智能体RL的算法、环境与基础设施上取得突破性进展;将Kimi K2及后续模型的自主能力推向真实世界;设计和实现大规模训练与低延迟推理系统;参与分布式基础设施的设计与优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 在Agentic、多智能体RL的算法、环境与基础设施上取得突破性进展
- 将Kimi K2及后续模型的自主能力推向真实世界
- 设计和实现大规模训练与低延迟推理系统
- 参与分布式基础设施的设计与优化
- 与团队合作,推动RL技术在真实场景中的应用
任职要求
- 精通RL:策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL
- 具备千卡级训练与低延迟推理的落地经验
- 系统级编程与分布式架构设计能力(Python / C++ / Rust)
- 有Agentic RL、工具调用或多智能体系统的发表或上线记录
- 加分项:代码沙箱、程序合成、仿真器安全相关经验
加分项
- 代码沙箱、程序合成、仿真器安全相关经验
- 请附上 GitHub、论文或你最自豪的 RL 项目简介
- 欢迎在以上某一方面具备SOTA能力的小伙伴加入
- Research Scientist / Engineer – Agentic RL
- Locations: Beijing · Shanghai · Shenzhen · Singapore · Silicon Valley
- Mission
- Invent the next leaps in agentic, multi-agent RL—algorithms, environments, infrastructure—that will carry Kimi K2 and its successors into real-world autonomy.
- Core Requirements
- Deep mastery of RL: policy-gradient, actor-critic, self-play, meta-RL, MARL.
- Proven delivery of large-scale training & serving stacks (thousands of GPUs, low-latency rollouts).
- Expert-level systems coding (Python/C++/Rust) and distributed infra design.
- Track record of shipping or publishing on agentic RL, tool-use agents, or multi-agent systems.
- Nice-to-have
- Experience with code-execution sandboxes, program synthesis, or simulator security.
- Apply with GitHub, papers, or a concise write-up of your coolest RL system.
- Welcome partners with SOTA capabilities in one of the above aspects to join us.
- 研究科学家 / 工程师 – Agentic RL
- Moonshot AI · Kimi K2 及下一代模型
- 工作地点:北京 · 上海 · 深圳 · 新加坡 · 硅谷
- 在 Agentic、多智能体 RL 的算法、环境与基础设施上取得突破,把 Kimi K2 及后续模型的自主能力推向真实世界
- 允许6个月内投递3个职位,请选择适合的职位进行投递
福利待遇
- 与顶尖团队合作,参与前沿RL技术研发
- 工作地点灵活:北京、上海、深圳、新加坡、硅谷
- 有机会在顶级会议或期刊上发表研究成果
- 参与具有真实世界影响力的项目
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。