大语言模型基础设施工程师
岗位摘要
负责大语言模型训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理流水线;负责大规模训练数据格式与存储方案设计,优化数据输入输出和分布式训练场景下的数据吞吐能力;负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大语言模型训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理流水线
- 负责大规模训练数据格式与存储方案设计,优化数据输入输出和分布式训练场景下的数据吞吐能力
- 负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移
- 参与大模型训练系统开发与优化,支持预训练、监督微调、基于人类反馈的强化学习等不同训练流程,提高训练效率和GPU利用率
- 参与大模型推理基础设施开发,建设高性能推理平台,支持在线推理服务
- 跟踪大模型训练与推理领域的前沿技术,持续推动系统能力升级
任职要求
- 计算机科学、人工智能、软件工程或相关专业,硕士及以上学历,2年以上AI基础设施相关工作经验
- 精通Python、Go、C++中至少两门语言,能编写高质量代码
- 有良好的算法和数理基础,熟悉常用算法
- 熟练掌握深度学习框架PyTorch、分布式训练技术及Megatron-LM框架,有实际模型训练经验,对数据加载器、检查点等模块有深入研究
- 熟练使用分布式计算系统如Ray、Spark,有实际使用和应用调优经验
- 擅长性能优化,对性能和稳定性有极致追求,能在压力下快速定位性能瓶颈并落地优化方案
- 具备良好的问题分析与解决能力、团队合作精神和沟通能力,能编写高质量文档
- 加分项:在国内外知名会议发表过相关领域高质量论文;在ACM、PAC等编程竞赛中取得较好成绩;知名开源项目的核心贡献者或维护者
加分项
- 在国内外知名会议发表过相关领域的高质量论文
- 在ACM、PAC等编程竞赛中取得过较好成绩
- 知名开源项目的core contributor或maintainer
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。