大模型数据算法工程师(通义千问团队)
岗位摘要
快速理解模型预训练需求,灵活调整数据方案以适应高频迭代;开发工具完成数据收集、清洗、格式转换(如HTML2Text、PDF2Text、ASR等),构建验证与测试集以量化性能指标;构建自动化、高效率的数据处理管线,优化组件性能,确保稳定性和可扩展性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 快速理解模型预训练需求,灵活调整数据方案以适应高频迭代
- 开发工具完成数据收集、清洗、格式转换(如HTML2Text、PDF2Text、ASR等),构建验证与测试集以量化性能指标
- 构建自动化、高效率的数据处理管线,优化组件性能,确保稳定性和可扩展性
- 与平台团队合作共建数据平台,分析使用痛点,提出改进建议并跟进落实
- 追踪业界技术进展,为预训练团队提供数据支持,探索新技术以提升数据价值和模型效果
任职要求
- 计算机科学、人工智能、数学、物理或相关领域博士或顶尖硕士毕业生
- 熟练掌握Python,熟悉SQL及数据库操作
- 熟悉分布式计算框架(如Spark、Hadoop、Ray)
- 熟悉常见分类模型及深度学习训练、微调与推理框架(如Transformer、BERT、GPT、PyTorch、vLLM、SGLang)
- 具备大规模数据处理经验,能够高效完成数据清洗与转换任务
- 学习能力强,动手能力突出,能快速上手新工具和技术
- 具备跨域视野与协作意识,能够与其他团队紧密合作实现数据平台共建
- 有大模型相关数据收集处理清洗经验,有处理千亿级以上数据的经验者优先
- 有阿里云服务使用经验(如MaxCompute、Function Compute、OSS等)者优先
- 掌握HTML2Text、PDF2Text、OCR、ASR等技术者优先
- 掌握ChatGPT、Claude、Gemini模型提示词工程者优先
加分项
- 有大模型相关数据收集处理清洗经验,有处理千亿级以上数据的经验
- 有阿里云服务使用经验,如MaxCompute、Function Compute、OSS等
- 掌握HTML2Text、PDF2Text、OCR、ASR等技术
- 掌握chatgpt claude gemini模型提示词工程
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。