大模型预训练数据算法工程师
岗位摘要
面向网页、代码、PDF/文档、多语言等不同类型的数据,研究数据构造、提取、解析、清洗、去重、质量评估、过滤和数据选择等方法;分析不同数据源的数据特征和质量问题,通过统计分析、数据抽样、错误案例及必要的实验评估处理效果
岗位职责
- 面向网页、代码、PDF/文档、多语言等不同类型的数据,研究数据构造、提取、解析、清洗、去重、质量评估、过滤和数据选择等方法
- 分析不同数据源的数据特征和质量问题,通过统计分析、数据抽样、错误案例及必要的实验评估处理效果
- 结合预训练模型的训练与评测结果,理解不同数据处理方式对模型效果的影响,并持续迭代数据方案
- 设计、开发和优化大规模预训练数据处理管线,关注数据正确性、处理效率、资源成本、稳定性和可复现性
- 根据实际问题持续完善相关的数据算法、处理工具和工程能力,并将有效方案沉淀为可复用的数据处理流程
- 与预训练算法、数据基础设施及其他相关团队协作,推动数据方案在实际训练任务中的应用
任职要求
- 具备扎实的编程基础,熟练使用 Python,能够完成数据分析、算法实现和工程开发
- 在数据算法或大规模数据工程至少一个方向有扎实积累,并具备跨越两个方向解决实际问题的能力
- 具备大规模数据处理经验,能够开发、运行和调试数据处理任务,分析性能、稳定性及数据正确性问题
- 对数据质量有基本理解,能够通过统计、抽样和错误案例发现问题,并提出可验证的处理方法
- 对机器学习和大语言模型预训练有基本理解,能够理解数据对照、控制变量和模型评测结果
- 具备良好的分析、沟通和协作能力,能够清晰说明方案依据、实验结果及其适用范围
- 加分项:参与过大语言模型预训练、继续预训练或训练数据构建
- 加分项:处理过网页、代码、PDF、学术文档或多语言语料
- 加分项:有数据提取、质量评分、分类过滤、去重、数据选择或数据混合相关经验
- 加分项:有分布式数据处理、数据基础设施或大规模任务优化经验
- 加分项:参与过模型训练或数据实验,能够设计和分析数据相关的对照实验
- 加分项:曾推动复杂数据处理工作从问题分析、方案设计和工程实现走向实际应用
- 加分项:有相关论文、开源项目或生产实践经验
加分项
- 参与过大语言模型预训练、继续预训练或训练数据构建
- 处理过网页、代码、PDF、学术文档或多语言语料
- 有数据提取、质量评分、分类过滤、去重、数据选择或数据混合相关经验
- 有分布式数据处理、数据基础设施或大规模任务优化经验
- 参与过模型训练或数据实验,能够设计和分析数据相关的对照实验
- 曾推动复杂数据处理工作从问题分析、方案设计和工程实现走向实际应用
- 有相关论文、开源项目或生产实践经验
- 陈笑涵 刚刚活跃
福利待遇
- 薪酬为60-90K·16薪
工作地址
北京海淀区蓟门壹号8f