返回岗位列表

阿里巴巴

大模型数据算法工程师(通义千问团队)

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

快速理解模型预训练需求,灵活调整数据方案以适应高频迭代;开发工具完成数据收集、清洗、格式转换(如HTML2Text、PDF2Text、ASR等),构建验证与测试集以量化性能指标;构建自动化、高效率的数据处理管线,优化组件性能,确保稳定性和可扩展性

岗位职责

  • 快速理解模型预训练需求,灵活调整数据方案以适应高频迭代
  • 开发工具完成数据收集、清洗、格式转换(如HTML2Text、PDF2Text、ASR等),构建验证与测试集以量化性能指标
  • 构建自动化、高效率的数据处理管线,优化组件性能,确保稳定性和可扩展性
  • 与平台团队合作共建数据平台,分析使用痛点,提出改进建议并跟进落实
  • 追踪业界技术进展,为预训练团队提供数据支持,探索新技术以提升数据价值和模型效果

任职要求

  • 计算机科学、人工智能、数学、物理或相关领域博士或顶尖硕士毕业生
  • 熟练掌握Python,熟悉SQL及数据库操作
  • 熟悉分布式计算框架(如Spark、Hadoop、Ray)
  • 熟悉常见分类模型及深度学习训练、微调与推理框架(如Transformer、BERT、GPT、PyTorch、vLLM、SGLang)
  • 具备大规模数据处理经验,能够高效完成数据清洗与转换任务
  • 学习能力强,动手能力突出,能快速上手新工具和技术
  • 具备跨域视野与协作意识,能够与其他团队紧密合作实现数据平台共建
  • 有大模型相关数据收集处理清洗经验,有处理千亿级以上数据的经验者优先
  • 有阿里云服务使用经验(如MaxCompute、Function Compute、OSS等)者优先
  • 掌握HTML2Text、PDF2Text、OCR、ASR等技术者优先
  • 掌握ChatGPT、Claude、Gemini模型提示词工程者优先

加分项

  • 有大模型相关数据收集处理清洗经验,有处理千亿级以上数据的经验
  • 有阿里云服务使用经验,如MaxCompute、Function Compute、OSS等
  • 掌握HTML2Text、PDF2Text、OCR、ASR等技术
  • 掌握chatgpt claude gemini模型提示词工程