返回岗位列表

阶跃星辰

多模态大模型数据理解工程师

地点:上海 薪资:40-60K 日期:2026-03-05

岗位摘要

设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化Spark作业性能和稳定性,解决调度延迟/OOM等问题,提高任务执行效率,减少人工介入成本

岗位职责

  • 设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据
  • 优化Spark作业性能和稳定性,解决调度延迟/OOM等问题,提高任务执行效率,减少人工介入成本
  • 基于互联网发现和挖掘高质量文本/多媒体数据,并对原始语料进行分析/过滤/重写
  • 为多模态大模型训练及业务场景提供坚实的数据基础
  • 与算法研究员协作,设计数据实验,探索分析不同数据策略对于VLM模型能力/训练效率的影响
  • 支持更高效的VLM模型训练
  • 跟进业界最新的VLM数据相关工作成果,并探索将其应用/改进的落地可能

任职要求

  • 计算机、大数据相关专业,本科及以上学历
  • 具备扎实的代码能力,熟悉Python,熟悉多线程编程、分布式计算、网络通信、内存管理
  • 熟悉Linux环境,能编写Shell/Python脚本自动化日常任务
  • 熟练掌握如Spark、Hive、Hadoop等大数据处理工具/框架,有VLM数据管理/处理基建开发与设计经验
  • 了解深度学习基础原理,以及多模态大模型基础原理
  • 有丰富的多模态数据处理/挖掘经验者优先
  • 有大规模数据处理基建Pipeline的设计开发经验者优先
  • 有深度学习CV/NLP、多模态大模型训练经验者优先

加分项

  • 有丰富的多模态数据处理/挖掘经验者 优先
  • 有大规模数据处理基建Pipeline 的 设计开发经验者 优先
  • 有深度学习CV/NLP、多模态大模型训练经验者 优先

福利待遇

  • 16薪薪酬结构
  • 非外包类正式岗位
  • 社招全职机会

工作地址

上海徐汇区阶跃星辰公司