研究科学家/工程师
岗位摘要
在Agentic、多智能体强化学习的算法、环境与基础设施上取得技术突破;将Kimi K2及后续模型的自主能力推向真实世界应用场景;负责策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL等RL算法的研发与优化
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 在Agentic、多智能体强化学习的算法、环境与基础设施上取得技术突破
- 将Kimi K2及后续模型的自主能力推向真实世界应用场景
- 负责策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL等RL算法的研发与优化
- 实现千卡级大规模模型训练与低延迟推理系统
- 进行系统级编程与分布式架构设计(Python/C++/Rust)
- 推进Agentic RL、工具调用或多智能体系统的研究与落地
任职要求
- 硕士及以上学历,3-5年相关工作经验
- 精通强化学习:策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL
- 具备千卡级训练与低延迟推理的落地实践经验
- 具备系统级编程与分布式架构设计能力,熟练使用Python/C++/Rust
- 有Agentic RL、工具调用或多智能体系统的发表论文或上线产品记录
- 需提供GitHub、论文或个人最自豪的RL项目简介
加分项
- 代码沙箱、程序合成、仿真器安全相关经验
- 请附上 GitHub、论文或你最自豪的 RL 项⽬简介
- 欢迎在以上某一方面具备SOTA能力的小伙伴加入
- 曹先生 刚刚活跃
福利待遇
- 月薪40-70K,16薪制
- 参与前沿大模型核心技术研发
- 与顶尖AI团队共事,接触SOTA技术方向
- 北京海淀区核心办公地点
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。