返回岗位列表

阶跃星辰

代码预训练与强化学习数据工程师

地点:北京 薪资:薪资未公开 日期:2026-01-20

岗位摘要

负责代码预训练数据的合成、清洗、权重分配与来源扩充,持续提升数据质量;研究预训练小领域数据配比与最终模型效果之间的关系;开发数据合成链路,解决代码模型中的关键问题;探究深度推理技术,研究Test-time Compute与模型效果的Scaling laws

岗位职责

  • 负责代码预训练数据的合成、清洗、权重分配与来源扩充,持续提升数据质量
  • 研究预训练小领域数据配比与最终模型效果之间的关系
  • 开发数据合成链路,解决代码模型中的关键问题
  • 探究深度推理技术,研究Test-time Compute与模型效果的Scaling laws
  • 参与后训练奖励模型、强化学习算法的优化流程
  • 探究线上代码补全数据到强化学习过程的数据飞轮
  • 专注于代码强化学习中奖励模型的优化与创新
  • 与SFT阶段配合,解决判别能力较差的场景
  • 探究使用合成数据进行代码奖励模型的预训练
  • 组织标注人员进行代码奖励模型的标注
  • 进行Critic模型的前沿探究
  • 负责强化学习过程中可执行代码与单元测试的质量过滤和扩充

任职要求

  • 本科及以上学历,计算机、物理、数学、神经科学或相关专业
  • 具备扎实的计算机科学功底和编程能力
  • 熟悉常见算法和数据结构
  • 具有良好的编程习惯
  • 工作认真细致,计划性强
  • 具有刨根问底的探究精神
  • 对研发工作有很强的实事求是的落地信念
  • 追求最终效果而非盲目追求新颖方法
  • 对工作内容有较强责任感