返回岗位列表

阶跃星辰

大模型预训练数据工程师

地点:北京 薪资:30-60K 日期:2026-01-20

岗位摘要

负责大模型预训练数据的全流程构建,包括数据收集、清洗、去重、标注、配比优化等环节;基于海量数据(PB 级)进行深度分析与实验,挖掘影响模型效果的关键数据信号,持续优化数据质量;与算法团队紧密协作,设计数据驱动的模型优化方案,提升模型在核心指标上的表现

岗位职责

  • 负责大模型预训练数据的全流程构建,包括数据收集、清洗、去重、标注、配比优化等环节
  • 基于海量数据(PB 级)进行深度分析与实验,挖掘影响模型效果的关键数据信号,持续优化数据质量
  • 与算法团队紧密协作,设计数据驱动的模型优化方案,提升模型在核心指标上的表现
  • 探索前沿数据技术(如主动学习、课程学习等),构建更高效的数据处理 pipeline

任职要求

  • 计算机、数学、数据科学等相关专业,本科及以上学历,CS/Coding 功底扎实
  • 熟练掌握 Python,熟悉 Spark / Ray / PyTorch 等分布式计算与深度学习框架,具备 PB 级大规模数据处理与分析经验
  • 具备出色的数据 sense,对数据高度敏感,能从大规模数据分析与实验中识别影响模型表现的关键信号
  • (加分项)有过参与公开的开源/闭源 LLM 预训练数据经验者(如参与过其数据配比、构建流程等)优先

加分项

  • )有过参与公开的开源/闭源 LLM 预训练数据经验者(如参与过其数据配比、构建流程等)优先

福利待遇

  • 六险一金全额缴纳,补充商业医疗保险
  • 弹性工作制,不打卡,每周可远程办公2天
  • 年度健康体检 + 带薪年假15天起
  • 技术书籍/课程报销 + 顶级设备支持