AI大模型测试开发工程师
岗位摘要
负责大规模分布式训练稳定性策略的开发及调试工作;负责大规模分布式训练可观测体系的开发及优化;负责大模型训练的接入及开发工作;提供远程或现场的技术支持,解决客户在大规模分布式训练中遇到的技术问题
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大规模分布式训练稳定性策略的开发及调试工作
- 负责大规模分布式训练可观测体系的开发及优化
- 负责大模型训练的接入及开发工作
- 提供远程或现场的技术支持,解决客户在大规模分布式训练中遇到的技术问题
- 编写和维护技术文档,包括故障排除指南、用户手册和最佳实践
- 调研业界最新的分布式训练技术及方案
- 深度参与研发产品特性开发,为研发产品支持新特性
任职要求
- 计算机科学、软件工程、电子工程或相关领域的本科及以上学历
- 良好的逻辑思维能力,精通计算机数据结构和算法,熟悉软件测试理论
- 熟悉至少一种编程语言,如GoLang、Python等
- 了解云原生体系,对Kubernetes、Docker有一定的了解
- 了解大模型训练,对当前最新大模型如Llama、Qwen、ChatGLM等有一定的了解或接触
- 接触过机器学习框架(有使用经验更优),如PyTorch、Megatron-LM、DeepSpeed、Colossal-AI等
- 对大规模分布式训练和模型推理感兴趣,期待做有挑战性的事情;有owner意识,具备团队合作的能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。