多模态数据处理实习生
岗位摘要
参与构建面向视频生成大模型训练的高质量多模态数据集,覆盖视频、图像、音频、文本等模态;使用开源模型(CLIP、Whisper、Qwen-VL、DOVER、Diarization 等)对原始数据进行智能清洗、质量打分与标注
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与构建面向视频生成大模型训练的高质量多模态数据集,覆盖视频、图像、音频、文本等模态
- 使用开源模型(CLIP、Whisper、Qwen-VL、DOVER、Diarization 等)对原始数据进行智能清洗、质量打分与标注
- 开发高效的数据处理算子与流水线(基于 Python/PyTorch),参与实际生产系统的迭代
- 与算法工程师协作,针对模型训练中暴露的数据问题(噪声、偏差、模态对齐缺失等)设计工程化解决方案
- 探索数据与模型协同优化的新方法——你处理的数据将直接进入视频生成模型的训练
任职要求
- 计算机、人工智能、软件工程或相关专业在读(本科高年级 / 硕士优先)
- 熟练使用 Python,有 PyTorch 实际使用经验
- 对视频/音频/图像等多模态数据处理有兴趣,动手能力强
- 以下经验加分:使用过 FFmpeg、OpenCV、HuggingFace Transformers/Datasets
- 有视频理解、音频处理(如说话人分离、语音识别)相关项目经验
- 了解 WebDataset/tar 格式数据集、分布式数据处理(Ray/多进程)
- 有参与过开源项目或有 GitHub 项目记录优先
- 熟练使用 Code Agent 工具的优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。