大模型预训练数据工程师
岗位摘要
负责大模型预训练数据的全流程构建,包括数据收集、清洗、去重、标注、配比优化等环节;基于海量数据(PB 级)进行深度分析与实验,挖掘影响模型效果的关键数据信号,持续优化数据质量;与算法团队紧密协作,设计数据驱动的模型优化方案,提升模型在核心指标上的表现
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型预训练数据的全流程构建,包括数据收集、清洗、去重、标注、配比优化等环节
- 基于海量数据(PB 级)进行深度分析与实验,挖掘影响模型效果的关键数据信号,持续优化数据质量
- 与算法团队紧密协作,设计数据驱动的模型优化方案,提升模型在核心指标上的表现
- 探索前沿数据技术(如主动学习、课程学习等),构建更高效的数据处理 pipeline
任职要求
- 计算机、数学、数据科学等相关专业,本科及以上学历,CS/Coding 功底扎实
- 熟练掌握 Python,熟悉 Spark / Ray / PyTorch 等分布式计算与深度学习框架,具备 PB 级大规模数据处理与分析经验
- 具备出色的数据 sense,对数据高度敏感,能从大规模数据分析与实验中识别影响模型表现的关键信号
- (加分项)有过参与公开的开源/闭源 LLM 预训练数据经验者(如参与过其数据配比、构建流程等)优先
加分项
- )有过参与公开的开源/闭源 LLM 预训练数据经验者(如参与过其数据配比、构建流程等)优先
福利待遇
- 六险一金全额缴纳,补充商业医疗保险
- 弹性工作制,不打卡,每周可远程办公2天
- 年度健康体检 + 带薪年假15天起
- 技术书籍/课程报销 + 顶级设备支持
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。