返回岗位列表

阶跃星辰

多模态预训练数据研究员

地点:北京 薪资:500-1000元/天 日期:2026-06-26

岗位摘要

主导阶跃多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级,质控体系的设计本身即为核心交付;以data-centric方法量化“数据→模型能力”的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论,而非依赖经验判断

岗位职责

  • 主导阶跃多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级,质控体系的设计本身即为核心交付
  • 以data-centric方法量化“数据→模型能力”的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论,而非依赖经验判断
  • 探索agentic data construction,由模型自主完成数据的生成、清洗、质检与配比决策,将数据构建从人工流程升级为模型驱动的agent系统,使数据生产能随模型能力同步进化
  • 攻坚领域多模态数据(工程图/CAD/文档/学科题等)的合成与对齐,构建通用语料难以覆盖且可验证的高价值数据

任职要求

  • 从根本上认可数据的价值,相信“做好数据”本身就是一等公民的研究工作,而非模型训练的附属环节
  • 熟悉大规模数据处理技术栈,有TB~PB级数据pipeline的实战经验,能独立完成数据的处理、合成与质控
  • 具备数据科学性的认知:习惯用对照实验和量化指标判断数据价值,对“数据→模型效果”有可验证的因果认知,而非凭直觉与经验
  • 计算机/人工智能等相关专业,1年以上大规模数据或多模态预训练相关经验
  • 加分项:具备agentic data construction、model-in-the-loop、可验证数据自动生成等方向的实战经验
  • 加分项:具备领域数据(工程图/CAD/文档/学科题)的合成与对齐经验
  • 加分项:主导或深度参与过有影响力的开源数据集/benchmark

加分项

  • 具备 agentic data construction、model
  • loop、可验证数据自动生成等方向的实战经验
  • 具备领域数据(工程图 / CAD / 文档 / 学科题)的合成与对齐经验
  • 主导或深度参与过有影响力的开源数据集 / benchmark

福利待遇

  • 日薪500-1000元
  • 每周4天,实习3个月
  • 工作地点在北京海淀区大恒科技大厦
  • 有机会亲手定义下一代模型认知世界的方式
  • 接触真实的数据、算力和问题

工作地址

北京海淀区大恒科技大厦12F