返回岗位列表

阶跃星辰

预训练数据算法工程师

地点:北京 薪资:40-70K 日期:2026-03-03

岗位摘要

负责从互联网及多源文本中构建高质量语料库,主导大模型预训练数据体系的规划与建设;设计并实现大规模文本数据的采集、清洗、去重与质量评估流程;制定并迭代语料策略,主导数据消融实验,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响

岗位职责

  • 负责从互联网及多源文本中构建高质量语料库,主导大模型预训练数据体系的规划与建设
  • 设计并实现大规模文本数据的采集、清洗、去重与质量评估流程
  • 制定并迭代语料策略,主导数据消融实验,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响
  • 搭建高效可扩展的数据处理管线,支撑PB级语料规模的构建与持续优化

任职要求

  • 计算机、数学、数据科学等相关专业,本科及以上学历,CS/Coding功底扎实
  • 熟练掌握Python,熟悉Spark/Ray/PyTorch等分布式计算与深度学习框架,具备PB级大规模数据处理与分析经验
  • 具备出色的数据sense,对数据高度敏感,能从大规模数据分析与实验中识别影响模型表现的关键信号
  • 具备强烈的好奇心与自驱力,对AI数据体系建设与模型优化充满热情
  • 有参与公开的开源/闭源LLM预训练数据经验者优先(如参与过其数据配比、构建流程等)

加分项

  • )有过参与公开的开源/闭源 LLM 预训练数据经验者(如参与过其数据配比、构建流程等)优先
  • 完整的大模型数据和预训练流水线,能接触工业级的大模型迭代
  • 与顶尖的算法/研究团队紧密合作,在高速迭代的环境中共同推进 SOTA 模型的研发
  • 韩先生 刚刚活跃

福利待遇

  • 完整的大模型数据和预训练流水线,能接触工业级的大模型迭代
  • 与顶尖的算法/研究团队紧密合作,在高速迭代的环境中共同推进SOTA模型的研发

工作地址

北京海淀区大恒科技大厦南座