多模态预训练数据研究员
岗位摘要
主导多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级;以data-centric方法量化数据与模型能力的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 主导多模态大模型预训练数据的生产与质控体系建设,覆盖采集、解析、合成、清洗、配比全链路,规模达万亿token量级
- 以data-centric方法量化数据与模型能力的因果关系,设计配比与采样策略,通过对照实验沉淀可复现结论
- 探索agentic data construction,由模型自主完成数据生成、清洗、质检与配比决策,将数据构建升级为模型驱动的agent系统
- 攻坚领域多模态数据(工程图、CAD、文档、学科题等)的合成与对齐,构建通用语料难以覆盖的高价值数据
任职要求
- 从根本上认可数据的价值,相信做好数据本身就是一等公民的研究工作,而非模型训练的附属环节
- 熟悉大规模数据处理技术栈,有TB至PB级数据pipeline的实战经验,能独立完成数据处理、合成与质控
- 具备数据科学性的认知,习惯用对照实验和量化指标判断数据价值,对数据到模型效果有可验证的因果认知
- 计算机或人工智能等相关专业,1年以上大规模数据或多模态预训练相关经验
- 加分项:具备agentic data construction、model-in-the-loop、可验证数据自动生成等方向的实战经验
- 加分项:具备领域数据(工程图、CAD、文档、学科题)的合成与对齐经验
- 加分项:主导或深度参与过有影响力的开源数据集或benchmark
加分项
- 具备 agentic data construction、model
- loop、可验证数据自动生成等方向的实战经验
- 具备领域数据(工程图 / CAD / 文档 / 学科题)的合成与对齐经验
- 主导或深度参与过有影响力的开源数据集 / benchmark
福利待遇
- 具有竞争力的薪资范围45-75K
- 参与定义下一代模型认知世界的前沿工作
- 真实的数据、算力和问题资源
- 与顶尖团队合作的机会
工作地址
北京海淀区大恒科技大厦南座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。