返回岗位列表

百川智能

高级强化学习研究员

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

完善和优化RLHF/RLAIF算法,基于RLHF/RLAIF等方法提升模型性能;根据业务需求开展研究,包括但不限于:Reward Model泛化性研究、RLHF中的exploitation/exploitation机制研究等

岗位职责

  • 完善和优化RLHF/RLAIF算法,基于RLHF/RLAIF等方法提升模型性能
  • 根据业务需求开展研究,包括但不限于:Reward Model泛化性研究、RLHF中的exploitation/exploitation机制研究等
  • 跟踪和研究学界/业界最新进展,包括Agent技术(工具调用、长短期记忆以及规划能力),基于LLM的多智能体交互以及基于LLM的数学/科学发现等

任职要求

  • 熟悉大模型技术栈,在强化学习领域,有解决实际问题的调优经验,NLP领域优先,有大模型的RLHF/RLAIF等经验优先
  • 拥有计算机、自动化、电子等相关方向博士学位,具备独立研究能力,能够跟踪学术界最新的研究进展和业界最新应用
  • 对数据有感知,具备从业务实际出发分析和解决问题的能力,以及良好的表达和沟通能力