高级智能体后训练机器学习研究工程师
岗位摘要
训练最先进的模型(包括内部开发和社区模型),并部署给企业客户;研究前沿算法,并将其直接整合到我们的训练栈中;设计解决方案,使复杂的多智能体系统能够直接从过程奖励和结果奖励中学习;在生产环境中拥有5年以上的LLM训练经验
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 训练最先进的模型(包括内部开发和社区模型),并部署给企业客户
- 研究前沿算法,并将其直接整合到我们的训练栈中
- 设计解决方案,使复杂的多智能体系统能够直接从过程奖励和结果奖励中学习
任职要求
- 在生产环境中拥有5年以上的LLM训练经验
- 具备RLHF/RLVR等后训练方法以及PPO/GRPO等相关算法的经验
- 过去两年内在NEURIPS、ICLR或ICML等顶级会议上发表过论文
- 拥有计算机科学或相关领域的博士学位或硕士学位
福利待遇
- 全面的健康、牙科和视力保险
- 学习和发展津贴
- 丰厚的带薪休假
- 可能符合通勤津贴等额外福利
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。