多模态理解基座模型研究员/工程师
岗位摘要
负责多模态基座模型的迭代,探索视觉编码器和VLM的结构、训练策略和评测方式,持续验证和迭代预训练与后训练算法;负责多模态理解数据体系构建,定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责多模态基座模型的迭代,探索视觉编码器和VLM的结构、训练策略和评测方式,持续验证和迭代预训练与后训练算法
- 负责多模态理解数据体系构建,定义图文/视频数据集的采集方式、质量标准和筛选方法,多部门协作建设大规模自动化清洗、质量筛选与数据合成管线
- 针对通用问答、文档/图表解析、多模态推理等基础场景,进行针对性的数据收集、模型训练和精细化调优
- 推动GUI、白领办公、多模态搜索等场景的多模态Agent核心能力建设与落地
- 搭建面向用户真实体验的多维度多模态评测体系,从定义评测维度、收集真实数据、数据标注到模型反馈,定位模型短板,指引模型迭代
任职要求
- 深入理解主流视觉编码器(如CLIP、SigLIP等)的模型结构,熟悉其训练与评测方法
- 熟悉主流多模态模型的架构,具备大规模多模态预训练或后训练(SFT/RL/OPD)实战经验
- 具备极强的数据直觉,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验,并具备一定的工程代码能力
- 主导和交付过多模态某个垂直领域(如OCR、Image Caption、空间理解、通用QA、用户意图理解或Agent场景)的模型训练与数据迭代
- 深入研究过多模态模型评测体系建设,不满足于依赖公开榜单,有独立设计人工评测或自动评测流程的经历
- 即使没有上述特定经验,只要基础扎实、代码能力极强、对多模态有极致渴望,也欢迎申请
加分项
- 有行业影响力的高引论文或知名项目贡献
- 对模型自身真实能力的提升有极致追求,反感且不愿意通过“刷榜”来换取指标的虚假繁荣
- 对多模态模型的技术发展趋势和应用场景有深刻洞察
- AGI 绝不会止步于文本,迈向 AGI 的关键一环,在于让模型拥有理解物理世界的能力。我们的使命,是为 AI 注入“看懂并理解世界”的多模态灵魂,让模型在面对复杂的真实世界时,依然能展现出精准的感知与推理能力。在这里,你将会挑战多模态领域的本质难题:处理海量且充满噪声的多模态数据,设计底层的高效原生模型架构,探索大规模训练策略,建立反映真实需求的评测基准。跨越数据、架构、训练与评测的全链路,让多模态成为解决现实挑战的核心生产力
- 【岗位类别】:实习/全职
- 覆盖多模态理解基座模型全链路,包含:视觉编码器优化 / 多模态预训练 / 多模态后训练 / 评测体系建设(候选人可选其中1个或多个方向)
福利待遇
- 有行业影响力的高引论文或知名项目贡献者优先
- 对模型自身真实能力提升有极致追求,反感刷榜虚假繁荣者优先
- 对多模态模型技术发展趋势和应用场景有深刻洞察者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。