大模型算法研究员 – Agentic RL/强化学习
岗位摘要
在Agentic、多智能体RL的算法、环境与基础设施上取得研究突破;将Kimi K2及后续模型的自主能力推向真实世界应用场景;负责千卡级大规模训练系统的开发与优化;设计并实现低延迟推理方案
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 在Agentic、多智能体RL的算法、环境与基础设施上取得研究突破
- 将Kimi K2及后续模型的自主能力推向真实世界应用场景
- 负责千卡级大规模训练系统的开发与优化
- 设计并实现低延迟推理方案
- 进行系统级编程与分布式架构设计
任职要求
- 硕士及以上学历,经验不限
- 精通强化学习:策略梯度、Actor-Critic、Self-Play、Meta-RL、MARL
- 具备千卡级训练与低延迟推理的落地实践经验
- 具备系统级编程与分布式架构设计能力(Python/C++/Rust)
- 有Agentic RL、工具调用或多智能体系统的论文发表或上线记录
- 有大模型LLM相关领域的论文及期刊发表
- 领域内知名开源项目的核心代码贡献者优先
- 具备代码沙箱、程序合成、仿真器安全相关经验者优先
- 在以上某一方面具备SOTA能力
福利待遇
- 月薪50-80K,16薪
- 工作地点可选北京、上海、深圳、杭州
工作地址
杭州西湖区浙江大学(玉泉校区)1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。