Code大模型算法研究员/工程师
岗位摘要
负责代码数据的合成、清洗、权重分配与来源扩充,持续提高代码数据质量;探究Post Training中有效提升模型代码能力的方法,覆盖代码竞赛、SWE等场景;探索RL技术在代码场景的有效应用,实现数据飞轮与RL技术的深度结合
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责代码数据的合成、清洗、权重分配与来源扩充,持续提高代码数据质量
- 探究Post Training中有效提升模型代码能力的方法,覆盖代码竞赛、SWE等场景
- 探索RL技术在代码场景的有效应用,实现数据飞轮与RL技术的深度结合
- 专注于代码强化学习中奖励模型(Reward Model)的优化与创新
- 负责合成数据训练代码奖励模型,组织代码及SWE场景数据的标注与校验
- 负责前沿技术探究,强化学习过程中可执行代码与单元测试的质量过滤与扩充
任职要求
- 预计毕业时间为2025年9月至2026年8月的计算机、物理、数学等相关专业博士或优秀硕士研究生
- 具备扎实的计算机科学功底和编程能力,熟悉常见算法与数据结构,编程习惯良好
- 熟悉语言模型基本技术与模型结构,掌握Post Training全流程,对AI未来有坚定信仰和工作热情
加分项
- 有NOI、ACM/ICPC金牌获奖经历优先
- 有高水平论文发表者优先,如ICLR, ICML, NeurIPS等会议
- 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识
- 高淳 刚刚活跃
- 上海阶跃星辰智能科技 · 校招HR
福利待遇
- 具有竞争力的薪酬体系:30-35K×16薪,年薪可达48-56万元
- 位于北京海淀区的现代化办公环境
- 参与前沿代码大模型研究,有机会接触顶级学术会议发表成果
- 扁平化的技术团队文化,鼓励创新与探索
- 针对NOI、ACM金牌及顶会论文发表者提供优先录用通道
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。