Agentic RL 研究科学家/工程师
岗位摘要
在Agentic、多智能体RL的算法、环境与基础设施上取得技术突破;将Kimi K2后续模型的自主能力推向真实世界应用场景;负责策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL等RL算法的研发与优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 在Agentic、多智能体RL的算法、环境与基础设施上取得技术突破
- 将Kimi K2后续模型的自主能力推向真实世界应用场景
- 负责策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL等RL算法的研发与优化
- 实现千卡级大规模训练与低延迟推理的工程落地
- 进行系统级编程与分布式架构设计
- 推进代码沙箱、程序合成、仿真器安全等相关技术研发
任职要求
- 硕士及以上学历,计算机相关专业
- 有国际期刊/会议论文发表经历
- 精通强化学习:策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL
- 具备千卡级训练与低延迟推理的落地经验
- 具备系统级编程与分布式架构设计能力(Python/C++/Rust)
- 有Agentic RL、工具调用或多智能体系统的发表或上线记录
- 有大模型LLM相关领域的论文及期刊发表
- 领域内知名开源项目的核心代码贡献者优先
- 有代码沙箱、程序合成、仿真器安全相关经验者优先
福利待遇
- 月薪70-100K,16薪
- 参与下一代大模型核心技术研发
- 顶级AI团队工作机会
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。