世界模型训练数据专家
岗位摘要
负责世界模型训练数据体系建设,规划并落地视频/多模态数据体系,包括数据来源、数据结构、清洗标准、标注规范、质量评估和版本管理;主导训练数据 sourcing,建立高质量视频数据获取策略,覆盖公开视频、版权数据、合作数据、合成数据、具身采集数据等来源,评估不同来源数据对模型训练的价值、成本和风险
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责世界模型训练数据体系建设,规划并落地视频/多模态数据体系,包括数据来源、数据结构、清洗标准、标注规范、质量评估和版本管理
- 主导训练数据 sourcing,建立高质量视频数据获取策略,覆盖公开视频、版权数据、合作数据、合成数据、具身采集数据等来源,评估不同来源数据对模型训练的价值、成本和风险
- 设计数据清洗与过滤链路,负责视频数据的全链路处理方案,包括去重、切分、画质筛选、镜头/运动分析、字幕/OCR/水印过滤、真实度筛选、物理合理性过滤、低质样本剔除等
- 设计标注体系与数据语义结构,建立适合世界模型训练的标注规范,包括视频 caption、时间戳描述、动作与状态变化、物体关系、场景变化、因果事件、失败/异常行为等
- 建立数据-模型反馈闭环,与训练、评测团队紧密协作,通过消融实验、数据配比实验和模型表现分析,持续优化数据质量、数据分布和训练 curriculum
- 探索面向真实物理世界的数据策略,针对世界模型对真实物理规律、动作连续性、状态变化和时序因果的要求,设计区别于传统视频生成模型的数据筛选和处理方法
任职要求
- 有视频生成模型数据经验,优先考虑在一线视频生成模型团队中深度参与过训练数据建设的候选人,包括但不限于 Wan、Seedance、可灵、海螺、Longcat-Video、HunyuanVideo、爱诗、生数科技等相关团队
- 理解视频生成数据全链路,熟悉视频训练数据从 sourcing、下载、清洗、切分、过滤、标注、配比到版本管理的完整流程,并理解每个环节背后的目标和取舍
- 熟悉数据清洗与标注算子,对常见视频数据处理算子有实践经验,如去重、质量评分、运动强度分析、镜头切分、OCR/字幕/水印检测、美学评分、caption 生成与校验、多模态过滤等
- 具备数据驱动的模型迭代意识,能根据训练效果、评测结果和失败案例反推数据问题,设计数据消融实验,推动数据策略持续迭代
- 有强 ownership 和跨团队协作能力,能在开放问题中定义目标、拆解任务、推动落地,并与算法、工程、标注、采集和业务团队高效协作
- 加分项:参与过视频生成模型 Technical Report、论文或核心数据建设工作;熟悉大规模视频数据平台、数据质量评估系统或自动化标注系统;对具身智能、世界模型、机器人数据、EGO 视频、多模态基础模型有兴趣或经验;有从零搭建数据 pipeline 或数据团队的经验
加分项
- 参与过视频生成模型 Technical Report、论文或核心数据建设工作
- 熟悉大规模视频数据平台、数据质量评估系统或自动化标注系统
- 对具身智能、世界模型、机器人数据、EGO 视频、多模态基础模型有兴趣或经验
- 有从零搭建数据 pipeline 或数据团队的经验
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。