LLM算法工程师(实习)
岗位摘要
参与基础模型中大型语言模型奖励模型系统的研发,包括但不限于:BT Reward Model(价值模型)、Function-based Verifier(基于函数的验证器)、LLM-as-Judge(大模型裁判)、Rubric-based LLM Evaluation(基于量规的LLM评估)
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与基础模型中大型语言模型奖励模型系统的研发,包括但不限于:BT Reward Model(价值模型)、Function-based Verifier(基于函数的验证器)、LLM-as-Judge(大模型裁判)、Rubric-based LLM Evaluation(基于量规的LLM评估)
- 探索RLHF/RLAIF等对齐技术的奖励模型训练范式,设计方法发现并解决奖励破解(Reward Hacking)问题
- 构建行业领先的LLM奖励模型系统,使LLM在权威评测基准中保持性能领先地位
任职要求
- 计算机、数学、人工智能、NLP等相关专业硕士及以上学历(优秀本科生可放宽)
- 具备LLM奖励模型/对齐技术相关论文和项目经验者优先
- 扎实的编程基础,精通Python及PyTorch/TensorFlow等深度学习框架
- NOI/ACM-ICPC等编程竞赛获奖经历为加分项
- 优秀的跨团队协作与沟通能力,能高效推动技术项目落地
- 实习时间优先六个月及以上
加分项
- NOI/ACM
- ICPC等编程竞赛获奖经历
- 软技能:优秀的跨团队协作与沟通能力,能高效推动技术项目落地
- 实习时间:优先六个月及以上
- 高淳 刚刚活跃
- 上海阶跃星辰智能科技 · 校招HR
福利待遇
- 日薪300-500元
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。