大语言模型Post-train研究员
岗位摘要
研发大规模、高质量的Agent数据合成管线,提升模型在Code、Search及General Tool Use等场景下的能力;探索多智能体协作、长时记忆系统及交互环境的构建,提升模型解决复杂任务能力
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 研发大规模、高质量的Agent数据合成管线,提升模型在Code、Search及General Tool Use等场景下的能力
- 探索多智能体协作、长时记忆系统及交互环境的构建,提升模型解决复杂任务能力
- 探索高效、稳定的强化学习算法,增强模型在数学、代码与逻辑等复杂任务中的推理能力
- 持续提升模型的指令遵循度、有用性与诚实性,进行模型对齐与RLHF研究
- 为大模型构建可靠、可信的行为准则,提升AI安全性
任职要求
- 拥有大语言模型Post-train(如SFT, RLHF, RLVR, Agent)相关的研究或项目实践经验
- 具备扎实的Data Sense和Evaluation Sense,能够以问题为导向,通过严谨的实验设计和数据分析驱动模型迭代
- 具备出色的编程与工程能力,熟练掌握PyTorch等深度学习框架
- 对Verl、Megatron等分布式训练方法有深入理解
- 熟悉SGLang、vLLM等高性能推理引擎
加分项
- 作为主要贡献者主导或参与过有影响力的开源项目
- 在 NeurIPS、ICML、ICLR、ACL、EMNLP 等人工智能顶级会议或学术期刊上发表过高质量论文
- 在 IMO/CMO、IOI/NOI、ACM-ICPC 等国内外知名竞赛中取得过优异成绩
福利待遇
- 作为主要贡献者主导或参与过有影响力的开源项目
- 在NeurIPS、ICML、ICLR、ACL、EMNLP等人工智能顶级会议或学术期刊上发表过高质量论文
- 在IMO/CMO、IOI/NOI、ACM-ICPC等国内外知名竞赛中取得过优异成绩
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。