返回岗位列表

阶跃星辰

大模型Post Train算法工程师/研究员

地点:北京 薪资:100-200K 日期:2026-05-22

岗位摘要

负责大模型对齐方向研发,涵盖SFT、RL全阶段的数据策略与算法优化;负责后训练及Mid-training数据筛选、合成与配比,建立数据-模型正向飞轮;探索通用Agent/Agent RL等前沿训练范式,提升模型任务规划与多步推理能力

岗位职责

  • 负责大模型对齐方向研发,涵盖SFT、RL全阶段的数据策略与算法优化
  • 负责后训练及Mid-training数据筛选、合成与配比,建立数据-模型正向飞轮
  • 探索通用Agent/Agent RL等前沿训练范式,提升模型任务规划与多步推理能力
  • 设计开发Agent基建与训练基建,端到端提升模型研发效率

任职要求

  • 计算机/数学/AI相关专业博士或优秀硕士
  • 数据敏感,熟悉开源数据生态,工程能力强
  • 熟悉Reasoning RL、Agent RL、Mid-training等前沿方向,有大模型研发经验
  • 顶会论文(ICLR/NeurIPS/ICML)、NOI/ACM-ICPC金牌获奖者优先

福利待遇

  • 具有竞争力的薪酬体系:100-200K·16薪
  • 博士学历优先,优质职业发展平台
  • 前沿技术探索机会,紧跟大模型与Agent领域最新进展

工作地址

北京海淀区大恒科技大厦00