返回岗位列表

DeepSeek

多模态理解基座模型研究员/工程师

地点:北京 薪资:薪资未公开 日期:2026-06-27

岗位摘要

负责多模态基座模型的迭代,探索视觉编码器和VLM的结构、训练策略和评测方式,持续验证和迭代预训练与后训练算法;负责多模态理解数据体系构建,定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线

岗位职责

  • 负责多模态基座模型的迭代,探索视觉编码器和VLM的结构、训练策略和评测方式,持续验证和迭代预训练与后训练算法
  • 负责多模态理解数据体系构建,定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线
  • 针对通用问答、文档/图表解析、多模态推理等基础场景,进行针对性的数据收集、模型训练和精细化调优
  • 推动GUI、白领办公、多模态搜索等场景的多模态Agent核心能力建设与落地
  • 搭建面向用户真实体验的多维度多模态评测体系,从定义评测维度、收集真实数据、数据标注到模型反馈,定位模型短板,指引模型迭代

任职要求

  • 深入理解主流视觉编码器(如CLIP、SigLIP等)的模型结构,熟悉其训练与评测方法
  • 熟悉主流多模态模型的架构,具备大规模多模态预训练或后训练(SFT/RL/OPD)实战经验
  • 具备极强的数据直觉,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验,并具备一定的工程代码能力
  • 主导和交付过多模态某个垂直领域(如OCR、Image Caption、空间理解、通用QA、用户意图理解或Agent场景)的模型训练与数据迭代
  • 深入研究过多模态模型评测体系建设,不满足于依赖公开榜单,有独立设计人工评测或自动评测流程的经历
  • 即使没有上述特定经验,只要基础扎实、代码能力极强、对多模态有极致渴望,也欢迎申请

加分项

  • 有行业影响力的高引论文或知名项目贡献
  • 对模型自身真实能力的提升有极致追求,反感且不愿意通过“刷榜”来换取指标的虚假繁荣
  • 对多模态模型的技术发展趋势和应用场景有深刻洞察
  • AGI 绝不会止步于文本,迈向 AGI 的关键一环,在于让模型拥有理解物理世界的能力。我们的使命,是为 AI 注入“看懂并理解世界”的多模态灵魂,让模型在面对复杂的真实世界时,依然能展现出精准的感知与推理能力。在这里,你将会挑战多模态领域的本质难题:处理海量且充满噪声的多模态数据,设计底层的高效原生模型架构,探索大规模训练策略,建立反映真实需求的评测基准。跨越数据、架构、训练与评测的全链路,让多模态成为解决现实挑战的核心生产力
  • 【岗位类别】:实习/全职
  • 覆盖多模态理解基座模型全链路,包含:视觉编码器优化 / 多模态预训练 / 多模态后训练 / 评测体系建设(候选人可选其中1个或多个方向)

福利待遇

  • 有行业影响力的高引论文或知名项目贡献者优先
  • 对模型自身真实能力提升有极致追求,反感刷榜虚假繁荣者优先
  • 对多模态模型技术发展趋势和应用场景有深刻洞察者优先