高级强化学习研究员
岗位摘要
完善和优化RLHF/RLAIF算法,基于RLHF/RLAIF等方法提升模型性能;根据业务需求开展研究,包括但不限于:Reward Model泛化性研究、RLHF中的exploitation/exploitation机制研究等
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 完善和优化RLHF/RLAIF算法,基于RLHF/RLAIF等方法提升模型性能
- 根据业务需求开展研究,包括但不限于:Reward Model泛化性研究、RLHF中的exploitation/exploitation机制研究等
- 跟踪和研究学界/业界最新进展,包括Agent技术(工具调用、长短期记忆以及规划能力),基于LLM的多智能体交互以及基于LLM的数学/科学发现等
任职要求
- 熟悉大模型技术栈,在强化学习领域,有解决实际问题的调优经验,NLP领域优先,有大模型的RLHF/RLAIF等经验优先
- 拥有计算机、自动化、电子等相关方向博士学位,具备独立研究能力,能够跟踪学术界最新的研究进展和业界最新应用
- 对数据有感知,具备从业务实际出发分析和解决问题的能力,以及良好的表达和沟通能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。