大模型数据处理工程师
岗位摘要
执行大规模训练数据的清洗与预处理工作;开发和维护数据过滤规则体系,设计基于规则的过滤器,开发启发式算法,检测数据异常和质量问题;指导数据标注团队,提供明确的指导和培训;实施数据正确性校验与质量保证,建立数据质量指标和评估机制
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 执行大规模训练数据的清洗与预处理工作
- 开发和维护数据过滤规则体系,设计基于规则的过滤器,开发启发式算法,检测数据异常和质量问题
- 指导数据标注团队,提供明确的指导和培训
- 实施数据正确性校验与质量保证,建立数据质量指标和评估机制
任职要求
- 统招硕士及以上学历,计算机科学、数据科学或相关专业
- 一年以上数据处理、数据清洗或数据工程相关经验
- 精通Python和数据处理库(pandas,numpy等),熟悉大规模数据处理框架(Spark, Dask等),具备设计和实现数据质量控制流程的经验
- 具备良好的问题解决能力和注重细节的工作态度
- 大语言模型或AI系统数据准备的实际经验
- 具备数据可视化和探索性数据分析能力
- 熟悉CommonCrawl、C4等大规模数据集的处理经验
- 参与过开源大模型数据处理项目
加分项
- 大语言模型或AI系统数据准备的实际经验
- 具备数据可视化和探索性数据分析能力
- 熟悉CommonCrawl、C4等大规模数据集的处理经验
- 参与过开源大模型数据处理项目
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。