通义实验室-大模型数据处理与优化算法工程师-通义千问
岗位摘要
需求对接与迭代: 快速理解模型预训练需求,灵活调整数据方案以适应高频迭代;数据处理与优化: 开发工具完成数据收集、清洗、格式转换(如HTML;Text、ASR等),构建验证与测试集以量化性能指标,优化流程以应对超大规模数据挑战
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 需求对接与迭代: 快速理解模型预训练需求,灵活调整数据方案以适应高频迭代
- 数据处理与优化: 开发工具完成数据收集、清洗、格式转换(如HTML
- Text、ASR等),构建验证与测试集以量化性能指标,优化流程以应对超大规模数据挑战
- 管线搭建与扩展: 构建自动化、高效率的数据处理管线,优化组件性能,确保稳定性和可扩展性
- 协助数据平台建设:与平台团队合作共建数据平台,分析使用痛点,提出建议意见以改进易用性,并跟进落实
- 技术支持与创新: 追踪业界技术进展,为预训练团队提供数据支持,探索新技术以提升数据价值和模型效果
任职要求
- 计算机科学、人工智能、数学、物理或相关领域博士/顶尖硕士毕业生
- 熟练掌握Python,熟悉SQL及数据库操作;熟悉分布式计算框架(如Spark、Hadoop、Ray);熟悉常见分类模型及深度学习训练 微调 与推理框架(如transformer bert gpt, pytorch , vllm sglang)
- 具备大规模数据处理经验,能够高效完成数据清洗与转换任务
- 学习能力强,动手能力突出,能快速上手新工具和技术
- 具备跨域视野与协作意识,能够与其他团队紧密合作,实现数据平台共建
- 有大模型相关数据收集处理清洗经验,有处理千亿级以上数据的经验
加分项
- 有大模型相关数据收集处理清洗经验,有处理千亿级以上数据的经验
- 有阿里云服务使用经验,如MaxCompute、Function Compute、OSS等
- 掌握HTML2Text、PDF2Text、OCR、ASR等技术
- 掌握chatgpt claude gemini模型提示词工程
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。