Post-train算法实习生(Agent方向)
岗位摘要
参与大模型Post-training阶段算法研究与实践,围绕SFT、RL、Self-Improvement等方法系统性提升模型推理、泛化与对齐能力;探索高效构建通用智能模型的训练范式
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大模型Post-training阶段算法研究与实践,围绕SFT、RL、Self-Improvement等方法系统性提升模型推理、泛化与对齐能力
- 探索高效构建通用智能模型的训练范式
- 开展在线学习、持续学习、自适应数据采样与模型自我进化机制等前沿算法研究
- 参与Scalable RL相关算法与训练框架的设计与实现,支持大规模并行训练与高效rollout
- 设计并实施系统化实验,分析模型在复杂推理、泛化任务与真实场景中的表现
- 推动算法从研究原型走向可复现、可扩展的训练流程
任职要求
- 国内外高校研究生在读,人工智能、计算机、自动化、数学相关专业优先
- 具备优秀的代码能力、扎实的数据结构和基础算法功底,熟练掌握Python
- 具备出色的数据分析与问题解决能力,能深入解决大模型训练和应用中的问题
- 有责任心和良好的沟通协作能力,能与团队共同探索新技术
- 具备扎实的机器学习基础,熟悉NLP与RL领域技术,在NeurIPS/ICML/ICLR等顶级会议发表论文者优先
- 能够长期实习(6个月及以上),每周出勤不少于4天
福利待遇
- 顶尖GPU集群算力支持,快速迭代实验有影响力的idea
- 实习期间表现优秀者可直接获得转正名额
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。