通义实验室-大模型评估系统算法工程师-通义千问
岗位摘要
挖掘大模型弱点,持续快速构建覆盖各项模型能力的评测数据集,探索可靠、具有可扩展性的评测方案;Judge 方案构建,训练 LLM Judge / Reward Model,建模人类偏好并提升长尾任务的评价准确性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 挖掘大模型弱点,持续快速构建覆盖各项模型能力的评测数据集,探索可靠、具有可扩展性的评测方案
- Judge 方案构建,训练 LLM Judge / Reward Model,建模人类偏好并提升长尾任务的评价准确性
- 参与 Reward System 构建,设计 Reward Signal、合成对应数据,并通过 RL提升模型的能力上限
- 参与开发 Evaluation、Reward System 所需工程框架,简化各类测试任务和模型集成流程,帮助提高团队效率
任职要求
- 学历与计算机、机器学习等方向相关,博士及硕士优先
- 了解 LLM Evaluation(评测方案与评测数据构建)或具有 Post
- training(SFT、RL等)训练和数据合成经验
- 精通 Python 以及 Pytorch 等深度学习框架
- 熟悉 Transformer 架构以及大语言模型基础知识
- 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于 NeurIPS、ICLR、ICML、ACL等
- 拥有知名开源项目,在开源社区具有较好的影响力
加分项
- 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于 NeurIPS、ICLR、ICML、ACL等
- 拥有知名开源项目,在开源社区具有较好的影响力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。