返回岗位列表

阶跃星辰

大模型算法实习生(推理/强化学习方向)

地点:北京 薪资:300-350元/天 日期:2026-03-03

岗位摘要

参与大模型Post-training阶段的算法研究与实践,围绕SFT、RL、Self-Improvement等方法系统性提升模型的推理、泛化与对齐能力;开展在线学习、持续学习、自适应数据采样与模型自我进化机制等前沿算法研究

岗位职责

  • 参与大模型Post-training阶段的算法研究与实践,围绕SFT、RL、Self-Improvement等方法系统性提升模型的推理、泛化与对齐能力
  • 开展在线学习、持续学习、自适应数据采样与模型自我进化机制等前沿算法研究
  • 参与可扩展强化学习算法与训练框架的设计与实现,支持大规模并行训练、长上下文与高效rollout
  • 设计并实施系统化实验,分析模型在复杂推理、泛化任务与真实场景中的表现

任职要求

  • 国内外高校研究生在读,人工智能、计算机、自动化、数学相关专业优先
  • 优秀的代码能力、数据结构和基础算法功底,熟练掌握Python
  • 出色的问题分析和解决能力,能深入解决大模型训练和应用存在的问题
  • 有责任心和良好的沟通协作能力,能和团队一起探索新技术
  • 扎实的机器学习基础,熟悉NLP、RL领域的技术
  • NeurIPS/ICML/ICLR等顶级会议上发表论文者优先,参与NOI/NOIP/ACM相关竞赛者优先
  • 能够长期实习6个月及以上,每周出勤不少于4天

福利待遇

  • 顶尖GPU集群算力支持,快速迭代实验有影响力idea
  • 实习期间表现优秀者可直接获得转正名额
  • 日薪300-350元

工作地址

北京海淀区大恒科技大厦南座9层