大模型数据工程师
岗位摘要
参与大模型训练数据的构建,包括数据采集、数据清洗、数据增强,搭建高效的分布式数据pipeline;参与大语言模型的数据质量提升,包括数据风控策略、异常数据检测、数据修复、特定领域数据扩充
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大模型训练数据的构建,包括数据采集、数据清洗、数据增强,搭建高效的分布式数据pipeline
- 参与大语言模型的数据质量提升,包括数据风控策略、异常数据检测、数据修复、特定领域数据扩充
- 参与模型训练数据标签体系的建设,建设数据自动打标服务,完成海量数据打标
- 参与模型数据的全生命周期调优工作,实现数据自动处理,提高数据处理效率,缩减数据交付周期
任职要求
- 本科以上学历,计算机相关专业,三年以上算法(推荐算法、CV、NLP)经验或大数据平台开发经验
- 精通Python语言,熟悉Spark、Ray等分布式框架,具备丰富的大规模数据处理实践经验
- 以下方向有实践经验或兴趣浓厚者优先:大规模文本数据质量提升、多模态数据处理、文本数据清洗、语音数据处理
福利待遇
- 15薪薪酬结构
- 非外包岗位,正式员工待遇
工作地址
西安雁塔区元征大厦1102
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。