返回岗位列表

阶跃星辰

多模态预训练数据研究员

地点:北京 薪资:45-75K 日期:2026-06-26

岗位摘要

主导多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级;以data-centric方法量化数据与模型能力的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论

岗位职责

  • 主导多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级
  • 以data-centric方法量化数据与模型能力的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论
  • 探索agentic data construction,由模型自主完成数据生成、清洗、质检与配比决策,将数据构建升级为模型驱动的agent系统
  • 攻坚领域多模态数据(工程图、CAD、文档、学科题等)的合成与对齐,构建通用语料难以覆盖的高价值数据

任职要求

  • 从根本上认可数据的价值,相信做好数据本身就是一等公民的研究工作,而非模型训练的附属环节
  • 熟悉大规模数据处理技术栈,有TB至PB级数据pipeline的实战经验,能独立完成数据处理、合成与质控
  • 具备数据科学性的认知,习惯用对照实验和量化指标判断数据价值,对数据到模型效果有可验证的因果认知
  • 计算机或人工智能等相关专业,1年以上大规模数据或多模态预训练相关经验
  • 加分项:具备agentic data construction、model-in-the-loop、可验证数据自动生成等方向的实战经验
  • 加分项:具备领域数据(工程图、CAD、文档、学科题)的合成与对齐经验
  • 加分项:主导或深度参与过有影响力的开源数据集或benchmark

加分项

  • 具备 agentic data construction、model
  • loop、可验证数据自动生成等方向的实战经验
  • 具备领域数据(工程图 / CAD / 文档 / 学科题)的合成与对齐经验
  • 主导或深度参与过有影响力的开源数据集 / benchmark

福利待遇

  • 具有竞争力的薪资范围45-75K
  • 参与定义下一代模型认知世界的前沿工作
  • 真实的数据、算力和问题资源
  • 与顶尖团队合作的机会

工作地址

北京海淀区大恒科技大厦南座