返回岗位列表

月之暗面

大语言模型预训练数据算法工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责大语言模型预训练数据算法的设计与实现,包括数据选择、质量建模、去重、过滤、数据配比、合成数据与课程学习等方向;将数据算法落地到大规模数据处理流程中,基于Ray、Spark等分布式框架处理海量训练数据

岗位职责

  • 负责大语言模型预训练数据算法的设计与实现,包括数据选择、质量建模、去重、过滤、数据配比、合成数据与课程学习等方向
  • 将数据算法落地到大规模数据处理流程中,基于Ray、Spark等分布式框架处理海量训练数据
  • 设计并执行数据消融实验,评估不同数据源、质量过滤策略、去重策略、配比方案和采样策略对模型能力的影响
  • 建设数据到模型效果的实验闭环,结合训练loss、benchmark、能力维度评测、训练动态和样本分析,定位数据问题并迭代数据策略

任职要求

  • 计算机、人工智能、数学、统计学等相关专业,本科及以上学历
  • 熟悉大语言模型预训练范式,理解预训练数据对模型能力、训练稳定性和扩展行为的影响
  • 具备扎实的机器学习、自然语言处理或大模型算法基础,能够独立完成算法设计、实验设计、结果分析和策略迭代
  • 熟练使用Python,熟悉PyTorch、TensorFlow、JAX等至少一种深度学习框架
  • 熟悉大规模数据处理,有Ray、Spark等分布式计算框架使用经验
  • 具备良好的工程实现能力,能够将数据算法实现为稳定、高效、可复用的大规模处理流水线
  • 具备较强的数据分析能力,能从损失曲线、评测结果、数据分布和样本案例中定位问题
  • 具备良好的论文阅读、问题拆解和跨团队协作能力
  • 加分项:有LLM预训练/中期训练数据实验经验,或参与过基础模型训练项目
  • 加分项:有数据消融、数据配比、数据选择、质量建模、合成数据、课程学习相关经验
  • 加分项:熟悉MinHash、SimHash、LSH、基于嵌入的过滤、基于分类器的过滤、困惑度过滤等方法
  • 加分项:有基准污染/泄露检测、评测集去污染经验
  • 加分项:有代码、数学、多语、多模态等专项数据算法经验
  • 加分项:有PB级文本数据处理经验,或熟悉云上/K8s/集群计算环境
  • 加分项:在自然语言处理、机器学习、数据挖掘、大模型训练等方向有论文、竞赛、开源或工业落地成果

加分项

  • 有 LLM pretrain / midtrain 数据实验经验,或参与过基础模型训练项目
  • 有数据消融、数据配比、数据选择、质量建模、合成数据、课程学习相关经验
  • 熟悉 MinHash、SimHash、LSH、embedding
  • based filtering、classifier
  • based filtering、perplexity filtering 等方法
  • 有 benchmark contamination / leakage 检测、评测集去污染经验
  • 有代码、数学、多语、多模态等专项数据算法经验
  • 有 PB 级文本数据处理经验,或熟悉云上/K8s/集群计算环境
  • 在 NLP、机器学习、数据挖掘、大模型训练等方向有论文、竞赛、开源或工业落地成果
  • 熟悉 MinHash、SimHash、LSH、embedding-based filtering、classifier-based filtering、perplexity filtering 等方法
  • 允许6个月内投递3个职位,请选择适合的职位进行投递