多模态数据工程师
岗位摘要
负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作;开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力;参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责多模态数据pipeline建设、数据版本管理、数据处理、数据算子开发集成等工作
- 开发自动化数据处理工具与脚本,优化数据清洗、标注及质量评估的效率和规模化能力
- 参与多模态大模型训练数据的构建与管理,参与数据筛选、标注及质量评估工作
- 分析和挖掘现有数据资源,设计有效的数据分布策略,支持模型持续迭代
- 与算法团队紧密协作,根据模型训练需求定制数据策略,提升训练效果
- 参与模型推理与部署、模型蒸馏、推理服务服务化,支持tagging及服务优化工作
任职要求
- 熟练掌握数据处理工具(SQL/maxcompute/spark/UDF等),有数据标注、清洗、评估等实战经验
- 熟悉数据仓库架构,数据仓库建模和ETL流程,在数据治理上有一定实战经验
- 掌握Python及主流数据处理工具库,理解数据清洗技术;熟悉数据质量评估指标及统计分析工具
- 具备agentic架构下,优化数据闭环提升模型性能者优先
- 对语音生成等多模态生成技术有深入理解者优先
- 对生成式AI领域有浓厚兴趣,关注行业动态并能提出创新性建议者优先
- 对搜索架构工程化有经验者可额外考虑
加分项
- 对语音生成等多模态生成技术有深入理解
- 对生成式 AI 领域有浓厚兴趣,关注行业动态并能提出创新性建议
- 对搜索架构工程化有经验者可额外考虑
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。