代码预训练与强化学习数据工程师
岗位摘要
负责代码预训练数据的合成、清洗、权重分配与来源扩充,持续提升数据质量;研究预训练小领域数据配比与最终模型效果之间的关系;开发数据合成链路,解决代码模型中的关键问题;探究深度推理技术,研究Test-time Compute与模型效果的Scaling laws
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责代码预训练数据的合成、清洗、权重分配与来源扩充,持续提升数据质量
- 研究预训练小领域数据配比与最终模型效果之间的关系
- 开发数据合成链路,解决代码模型中的关键问题
- 探究深度推理技术,研究Test-time Compute与模型效果的Scaling laws
- 参与后训练奖励模型、强化学习算法的优化流程
- 探究线上代码补全数据到强化学习过程的数据飞轮
- 专注于代码强化学习中奖励模型的优化与创新
- 与SFT阶段配合,解决判别能力较差的场景
- 探究使用合成数据进行代码奖励模型的预训练
- 组织标注人员进行代码奖励模型的标注
- 进行Critic模型的前沿探究
- 负责强化学习过程中可执行代码与单元测试的质量过滤和扩充
任职要求
- 本科及以上学历,计算机、物理、数学、神经科学或相关专业
- 具备扎实的计算机科学功底和编程能力
- 熟悉常见算法和数据结构
- 具有良好的编程习惯
- 工作认真细致,计划性强
- 具有刨根问底的探究精神
- 对研发工作有很强的实事求是的落地信念
- 追求最终效果而非盲目追求新颖方法
- 对工作内容有较强责任感
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。