大模型数据工程师
岗位摘要
参与大模型训练数据的构建,包括数据采集、数据清洗、数据增强,搭建高效的分布式数据pipeline;参与大语言模型的数据质量提升,包括数据风控策略、异常数据检测、数据修复、特定领域数据扩充
岗位职责
- 参与大模型训练数据的构建,包括数据采集、数据清洗、数据增强,搭建高效的分布式数据pipeline
- 参与大语言模型的数据质量提升,包括数据风控策略、异常数据检测、数据修复、特定领域数据扩充
- 参与模型训练数据标签体系的建设,建设数据自动打标服务,完成海量数据打标
- 参与模型数据的全生命周期调优工作,实现数据自动处理,提高数据处理效率,缩减数据交付周期
任职要求
- 本科以上学历,计算机相关专业,三年以上算法(推荐算法、CV、NLP)经验或大数据平台开发经验
- 精通Python语言,熟悉Spark、Ray等分布式框架,具备丰富的大规模数据处理实践经验
- 以下方向有实践经验或兴趣浓厚者优先:大规模文本数据质量提升、多模态数据处理、文本数据清洗、语音数据处理
福利待遇
- 15薪薪酬结构
- 非外包岗位,正式员工待遇
工作地址
西安雁塔区元征大厦1102