返回岗位列表

阶跃星辰

语音大模型数据工程师

地点:北京 薪资:40-70K 日期:2026-03-03

岗位摘要

设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据;构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性

岗位职责

  • 设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据
  • 构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性
  • 与算法紧密合作,理解模型训练需求,将模型问题转化为可执行的数据生产与优化方案
  • 推动数据生产流程的工程化与平台化,提高数据处理效率与数据复用能力
  • 跟踪语音大模型及多模态方向的最新数据构建方法,将有效的数据策略快速落地到实际训练中

任职要求

  • 本科及以上学历,计算机、人工智能、电子信息或相关专业
  • 熟练掌握 Python / Java / Go / C++ 中至少一门语言,具备独立编写数据处理脚本和构建工具的能力
  • 熟悉常见数据处理与分析工具,如 SQL / Pandas / Spark / Hadoop 等,有大规模数据处理经验者优先
  • 对语音相关任务有比较深入的认知,了解大模型训练流程,对数据在模型效果中的作用有清晰理解
  • 具备良好的工程意识、问题拆解能力和跨团队沟通协作能力

工作地址

北京海淀区大恒科技大厦南座