大模型后训练算法工程师
岗位摘要
持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力;跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent等核心场景的表现
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力
- 跨部门团队紧密协作,构建高质量、高多样性的后训练数据集
- 设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent等核心场景的表现
- 建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与Agent场景,精准定位模型短板并驱动针对性优化
任职要求
- 对大模型后训练有深入理解,熟悉RLHF/RLVR/PPO/GRPO等主流强化学习框架与范式,具备从算法设计到工程落地的完整经验
- 具备扎实的数据直觉与工程能力,能够从复杂、多源的数据中提炼信号,并将数据清洗、筛选与合成流程系统化、自动化
- 对模型评测有方法论层面的思考,不满足于刷benchmark,而是能设计出真正反映模型能力边界与短板的评测方案
福利待遇
- 实习或全职岗位,灵活选择
- 参与前沿AI模型研发,与顶尖团队合作
- 推动技术落地,直接贡献于产品核心能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。