返回岗位列表

月之暗面

大模型算法研究员 – Agentic RL/强化学习

地点:上海 薪资:50-80K 日期:2026-03-03

岗位摘要

在Agentic、多智能体RL的算法、环境与基础设施上取得研究突破;将Kimi K2及后续模型的自主能力推向真实世界应用场景;负责千卡级大规模训练系统的开发与优化;设计并实现低延迟推理方案

岗位职责

  • 在Agentic、多智能体RL的算法、环境与基础设施上取得研究突破
  • 将Kimi K2及后续模型的自主能力推向真实世界应用场景
  • 负责千卡级大规模训练系统的开发与优化
  • 设计并实现低延迟推理方案
  • 进行系统级编程与分布式架构设计

任职要求

  • 硕士及以上学历,经验不限
  • 精通强化学习:策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL
  • 具备千卡级训练与低延迟推理的落地实践经验
  • 具备系统级编程与分布式架构设计能力(Python/C++/Rust)
  • 有Agentic RL、工具调用或多智能体系统的论文发表或上线记录
  • 有大模型LLM相关领域的论文及期刊发表
  • 领域内知名开源项目的核心代码贡献者优先
  • 具备代码沙箱、程序合成、仿真器安全相关经验者优先
  • 在以上某一方面具备SOTA能力

福利待遇

  • 月薪50-80K,16薪
  • 工作地点可选北京、上海、深圳、杭州

工作地址

杭州西湖区浙江大学(玉泉校区)1