返回岗位列表

阶跃星辰

大数据开发工程师(多模态方向)

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据;优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本

岗位职责

  • 设计、开发和维护基于Spark Core/Spark SQL的大规模自动化ETL Pipeline,处理PB级多模态图文数据
  • 优化Spark作业性能和稳定性,解决调度延迟、OOM等问题,提高任务执行效率,减少人工介入成本
  • 基于互联网发现和挖掘高质量的文本/多媒体数据,并对原始语料进行分析、过滤、重写,为多模态大模型训练及业务场景提供数据基础
  • 与算法研究员协作,设计数据实验,探索分析不同数据策略对VLM模型能力及训练效率的影响,支持更高效的VLM模型训练
  • 跟进业界最新的VLM数据相关工作成果,并探索将其应用或改进的落地可能性

任职要求

  • 计算机、大数据相关专业,本科及以上学历
  • 具备扎实的代码能力,熟悉Python,熟悉多线程编程、分布式计算、网络通信、内存管理
  • 熟悉Linux环境,能编写Shell/Python脚本自动化日常任务
  • 熟练掌握如Spark、Hive、Hadoop等大数据处理工具/框架,有VLM数据管理/处理基建开发与设计经验
  • 了解深度学习基础原理,以及多模态大模型基础原理