返回岗位列表

小米

大语言模型Post-train研究员

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

研发大规模、高质量的Agent数据合成管线,提升模型在Code、Search及General Tool Use等场景下的能力;探索多智能体协作、长时记忆系统及交互环境的构建,提升模型解决复杂任务能力

岗位职责

  • 研发大规模、高质量的Agent数据合成管线,提升模型在Code、Search及General Tool Use等场景下的能力
  • 探索多智能体协作、长时记忆系统及交互环境的构建,提升模型解决复杂任务能力
  • 探索高效、稳定的强化学习算法,增强模型在数学、代码与逻辑等复杂任务中的推理能力
  • 持续提升模型的指令遵循度、有用性与诚实性,进行模型对齐与RLHF研究
  • 为大模型构建可靠、可信的行为准则,提升AI安全性

任职要求

  • 拥有大语言模型Post-train(如SFT, RLHF, RLVR, Agent)相关的研究或项目实践经验
  • 具备扎实的Data Sense和Evaluation Sense,能够以问题为导向,通过严谨的实验设计和数据分析驱动模型迭代
  • 具备出色的编程与工程能力,熟练掌握PyTorch等深度学习框架
  • 对Verl、Megatron等分布式训练方法有深入理解
  • 熟悉SGLang、vLLM等高性能推理引擎

加分项

  • 作为主要贡献者主导或参与过有影响力的开源项目
  • 在 NeurIPS、ICML、ICLR、ACL、EMNLP 等人工智能顶级会议或学术期刊上发表过高质量论文
  • 在 IMO/CMO、IOI/NOI、ACM-ICPC 等国内外知名竞赛中取得过优异成绩

福利待遇

  • 作为主要贡献者主导或参与过有影响力的开源项目
  • 在NeurIPS、ICML、ICLR、ACL、EMNLP等人工智能顶级会议或学术期刊上发表过高质量论文
  • 在IMO/CMO、IOI/NOI、ACM-ICPC等国内外知名竞赛中取得过优异成绩