返回岗位列表

面壁智能

多模态智能体实习生

地点:北京 薪资:250-350元/天 日期:2026-05-22

岗位摘要

熟悉并跑通现有端到端管线,收集并构建包含非专业视角的视频数据集(如冗余镜头较多的二创视频、Vlog);利用VLM工具进行批量标注,定位低质量或冗余镜头;设计预告片多版本对照实验,通过对比官方不同剪辑版本提取决策标签

岗位职责

  • 熟悉并跑通现有端到端管线,收集并构建包含非专业视角的视频数据集(如冗余镜头较多的二创视频、Vlog)
  • 利用VLM工具进行批量标注,定位低质量或冗余镜头
  • 设计预告片多版本对照实验,通过对比官方不同剪辑版本提取决策标签
  • 维护并迭代VLM Caption,提升标注字段的准确性并产出高质量对比数据集
  • 独立负责一个子方向的探索,包括引入SOTA模型进行生成式剪辑对比研究或迁移至其他领域
  • 完成后端到端Demo的工程化封装或技术输出(如技术文章、可视化交互页面)

任职要求

  • 理工科或交叉学科背景
  • 具备扎实的Python编程能力,能够独立阅读并理解中等复杂度的机器学习开源项目
  • 喜欢看视频/电影/短视频,具备敏锐的分析能力,能清晰阐述令人印象深刻的剪辑选择及其背后的逻辑
  • 具备极强的自驱力与目标管理能力,能够在导师不在时主动规划并推进本周工作
  • 具备良好的书面表达能力(中文或英文),能让非专业人士看懂技术文档
  • 了解图论、图神经网络或阅读过相关前沿文献
  • 有MiniCPM-V、Qwen-VL、Gemini Vision等视觉语言模型(VLM)的实际项目经验
  • 熟悉并产出过基于SD、Flux、Sora、KLING、Runway等生成式AI工具的高质量作品
  • 熟练使用PySceneDetect、FFmpeg或Premiere、DaVinci、FCPX、剪映等视频编辑软件
  • 具备B站、抖音、小红书等内容平台的账号运营或UP主经验
  • 在GitHub上有活跃的开源贡献或个人项目

加分项

  • (满足其一即可)
  • 了解图论(Graph)、图神经网络(GNN)或阅读过相关前沿文献
  • 有 MiniCPM
  • VL、Gemini Vision 等视觉语言模型(VLM)的实际项目经验
  • 熟悉并产出过基于 SD、Flux、Sora、KLING、Runway 等生成式 AI 工具的高质量作品
  • 熟练使用 PySceneDetect、FFmpeg 或主流软件(Premiere, DaVinci, FCPX, 剪映等)
  • 具备 B 站、抖音、小红书等内容平台的账号运营或 UP 主经验
  • 在 GitHub 上有活跃的开源贡献或个人项目(不限方向)
  • 王雅薇 刚刚活跃

福利待遇

  • 日薪250-350元
  • 每周工作4天,实习期3个月
  • 工作地点位于北京海淀区科建大厦
  • 深度参与核心业务项目,获得实战经验
  • 可根据个人兴趣探索创新课题

工作地址

北京海淀区科建大厦4层401