大语言模型算法研究员(数据方向)
岗位摘要
根据特定场景(包括但不限于数学代码、长文本、科学领域等),进行有效预训练数据的筛选,并开展数据合成工作;根据需求进行模型对齐训练(包括SFT与RLHF),验证模型效果;实现准确的数据质量评估,建立完善的数据质量评估体系
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 根据特定场景(包括但不限于数学代码、长文本、科学领域等),进行有效预训练数据的筛选,并开展数据合成工作
- 根据需求进行模型对齐训练(包括SFT与RLHF),验证模型效果
- 实现准确的数据质量评估,建立完善的数据质量评估体系
- 参与前沿算法与应用的研究
任职要求
- 自然语言处理、机器学习及相关专业,3年以上相关工作经验
- 较强的算法开发能力,熟悉C++、Python、Shell、CUDA等一种或多种编程语言
- 掌握传统NLP、深度学习NLP相关算法,并具有相关实战经验
- 熟练使用PyTorch深度学习框架
- 对深度学习、Transformer、预训练有一定深度的理解和经验,能根据论文复现相关算法,有大规模预训练模型研发和训练经验者优先
- 高质量相关论文ACL、EMNLP、COLING、NAACL作者优先
工作地址
北京海淀区科建大厦北京市海淀区科建大厦
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。