多模态智能体实习生
岗位摘要
熟悉并跑通现有端到端管线,收集并构建包含非专业视角的视频数据集(如冗余镜头较多的二创视频、Vlog);利用VLM工具进行批量标注,定位低质量或冗余镜头;设计预告片多版本对照实验,通过对比官方不同剪辑版本提取决策标签
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 熟悉并跑通现有端到端管线,收集并构建包含非专业视角的视频数据集(如冗余镜头较多的二创视频、Vlog)
- 利用VLM工具进行批量标注,定位低质量或冗余镜头
- 设计预告片多版本对照实验,通过对比官方不同剪辑版本提取决策标签
- 维护并迭代VLM Caption,提升标注字段的准确性并产出高质量对比数据集
- 独立负责一个子方向的探索,包括引入SOTA模型进行生成式剪辑对比研究或迁移至其他领域
- 完成后端到端Demo的工程化封装或技术输出(如技术文章、可视化交互页面)
任职要求
- 理工科或交叉学科背景
- 具备扎实的Python编程能力,能够独立阅读并理解中等复杂度的机器学习开源项目
- 喜欢看视频/电影/短视频,具备敏锐的分析能力,能清晰阐述令人印象深刻的剪辑选择及其背后的逻辑
- 具备极强的自驱力与目标管理能力,能够在导师不在时主动规划并推进本周工作
- 具备良好的书面表达能力(中文或英文),能让非专业人士看懂技术文档
- 了解图论、图神经网络或阅读过相关前沿文献
- 有MiniCPM-V、Qwen-VL、Gemini Vision等视觉语言模型(VLM)的实际项目经验
- 熟悉并产出过基于SD、Flux、Sora、KLING、Runway等生成式AI工具的高质量作品
- 熟练使用PySceneDetect、FFmpeg或Premiere、DaVinci、FCPX、剪映等视频编辑软件
- 具备B站、抖音、小红书等内容平台的账号运营或UP主经验
- 在GitHub上有活跃的开源贡献或个人项目
加分项
- (满足其一即可)
- 了解图论(Graph)、图神经网络(GNN)或阅读过相关前沿文献
- 有 MiniCPM
- VL、Gemini Vision 等视觉语言模型(VLM)的实际项目经验
- 熟悉并产出过基于 SD、Flux、Sora、KLING、Runway 等生成式 AI 工具的高质量作品
- 熟练使用 PySceneDetect、FFmpeg 或主流软件(Premiere, DaVinci, FCPX, 剪映等)
- 具备 B 站、抖音、小红书等内容平台的账号运营或 UP 主经验
- 在 GitHub 上有活跃的开源贡献或个人项目(不限方向)
- 王雅薇 刚刚活跃
福利待遇
- 日薪250-350元
- 每周工作4天,实习期3个月
- 工作地点位于北京海淀区科建大厦
- 深度参与核心业务项目,获得实战经验
- 可根据个人兴趣探索创新课题
工作地址
北京海淀区科建大厦4层401
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。