返回岗位列表

阶跃星辰

Post Train算法研究员

地点:北京 薪资:50-80K 日期:2026-05-22

岗位摘要

参与通用推理大模型对齐(Alignment)方向的研发工作,涵盖数据循环体系的构建;在监督微调(SFT)与强化学习(RL)阶段中对数据使用策略进行系统性探究;深入探索对齐阶段的数据与算法在大规模训练中的可扩展性与优化路径

岗位职责

  • 参与通用推理大模型对齐(Alignment)方向的研发工作,涵盖数据循环体系的构建
  • 在监督微调(SFT)与强化学习(RL)阶段中对数据使用策略进行系统性探究
  • 深入探索对齐阶段的数据与算法在大规模训练中的可扩展性与优化路径
  • 参与构建世界领先的高性能通用推理大模型,保持多项客观评测指标行业领先

任职要求

  • 预计毕业时间在2025年9月至2026年8月之间的国内外计算机、数学、人工智能等相关专业博士或优秀硕士
  • 对数据敏感,熟知开源社区各数据渠道,有数据处理的经验和认知
  • 对大模型前沿进展比较熟悉,如Reasoning RL、Agent RL等,具有大模型研发经验者优先
  • 有一定的相关研究经历,发表过顶级会议论文者优先(如ICLR、NeurIPS、ICML等)
  • 具备扎实的编程基础和优秀的工程能力,具有NOI、ACM/ICPC等编程竞赛金牌获奖者优先
  • 具备良好的团队协作能力和沟通能力

福利待遇

  • 具有竞争力的薪酬待遇:50-80K·16薪
  • 参与世界领先的高性能通用推理大模型研发项目
  • 前沿技术探索机会,紧跟大模型对齐领域最新研究进展
  • 良好的团队协作环境和沟通氛围
  • 位于北京海淀区中关村核心地段的办公地点

工作地址

北京海淀区大恒科技大厦-南座中关村大恒科技大厦南座12F