语音大模型数据工程师
岗位摘要
设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据;构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据
- 构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性
- 与算法紧密合作,理解模型训练需求,将模型问题转化为可执行的数据生产与优化方案
- 推动数据生产流程的工程化与平台化,提高数据处理效率与数据复用能力
- 跟踪语音大模型及多模态方向的最新数据构建方法,将有效的数据策略快速落地到实际训练中
任职要求
- 本科及以上学历,计算机、人工智能、电子信息或相关专业
- 熟练掌握 Python / Java / Go / C++ 中至少一门语言,具备独立编写数据处理脚本和构建工具的能力
- 熟悉常见数据处理与分析工具,如 SQL / Pandas / Spark / Hadoop 等,有大规模数据处理经验者优先
- 对语音相关任务有比较深入的认知,了解大模型训练流程,对数据在模型效果中的作用有清晰理解
- 具备良好的工程意识、问题拆解能力和跨团队沟通协作能力
工作地址
北京海淀区大恒科技大厦南座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。