多模态预训练数据研究员
岗位摘要
主导阶跃多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级,质控体系的设计本身即为核心交付;以data-centric方法量化“数据→模型能力”的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论,而非依赖经验判断
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 主导阶跃多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级,质控体系的设计本身即为核心交付
- 以data-centric方法量化“数据→模型能力”的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论,而非依赖经验判断
- 探索agentic data construction,由模型自主完成数据的生成、清洗、质检与配比决策,将数据构建从人工流程升级为模型驱动的agent系统,使数据生产能随模型能力同步进化
- 攻坚领域多模态数据(工程图/CAD/文档/学科题等)的合成与对齐,构建通用语料难以覆盖且可验证的高价值数据
任职要求
- 从根本上认可数据的价值,相信“做好数据”本身就是一等公民的研究工作,而非模型训练的附属环节
- 熟悉大规模数据处理技术栈,有TB~PB级数据pipeline的实战经验,能独立完成数据的处理、合成与质控
- 具备数据科学性的认知:习惯用对照实验和量化指标判断数据价值,对“数据→模型效果”有可验证的因果认知,而非凭直觉与经验
- 计算机/人工智能等相关专业,1年以上大规模数据或多模态预训练相关经验
- 加分项:具备agentic data construction、model-in-the-loop、可验证数据自动生成等方向的实战经验
- 加分项:具备领域数据(工程图/CAD/文档/学科题)的合成与对齐经验
- 加分项:主导或深度参与过有影响力的开源数据集/benchmark
加分项
- 具备 agentic data construction、model
- loop、可验证数据自动生成等方向的实战经验
- 具备领域数据(工程图 / CAD / 文档 / 学科题)的合成与对齐经验
- 主导或深度参与过有影响力的开源数据集 / benchmark
福利待遇
- 日薪500-1000元
- 每周4天,实习3个月
- 工作地点在北京海淀区大恒科技大厦
- 有机会亲手定义下一代模型认知世界的方式
- 接触真实的数据、算力和问题
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。