大模型数据算法工程师
岗位摘要
基于开源及采集数据进行清洗,包括内容抽取、启发式过滤、去重、模型过滤低质数据等,优化清洗pipeline以提升预训练数据质量;建立数据标签体系,针对不同标签数据进行质量提升和数据合成
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于开源及采集数据进行清洗,包括内容抽取、启发式过滤、去重、模型过滤低质数据等,优化清洗pipeline以提升预训练数据质量
- 建立数据标签体系,针对不同标签数据进行质量提升和数据合成
- 探索不同数据配比方式,进一步提升模型能力
- 建立预训练数据级别合成pipeline以及SFT数据合成pipeline
- 探索数据选择pipeline,进行数据压缩,使模型更高效地学习
任职要求
- 计算机、电子、数学、自动化等相关专业,硕士及以上学历优先
- 有NLP方向工作经验,有大模型数据清洗、预训练、指令微调实战经历者优先
- 精通Python、Linux,熟悉Spark、Hadoop等大数据工具,熟悉Megatron-LM、Deepspeed等机器学习框架优先
- 具备良好的沟通技巧和团队合作精神
- 善于学习新事物,渴望用技术改变未来
工作地址
北京海淀区科建大厦6层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。