大模型系统工具链研发工程师
岗位摘要
负责公司大模型的系统工具链相关功能研发;支持公司级大规模GPU集群运行和调优通用大模型;针对大模型训练或推理过程中的问题,协同基础软件以及硬件联动设计;负责超大规模机器学习系统架构的设计开发,解决包括训练系统稳定性以及性能问题
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责公司大模型的系统工具链相关功能研发
- 支持公司级大规模GPU集群运行和调优通用大模型
- 针对大模型训练或推理过程中的问题,协同基础软件以及硬件联动设计
- 负责超大规模机器学习系统架构的设计开发,解决包括训练系统稳定性以及性能问题
- 攻克大模型推理系统高并发、高可靠性、高可扩展性等技术难关
- 覆盖机器学习系统多个子方向领域的工作,包括:资源调度、模型训练、模型推理、数据管理、工作流编排等
- 与算法部门深度合作,进行算法与系统的联合优化
任职要求
- 优秀的代码能力、数据结构和基础算法功底,熟练Golang,C/C++或Python
- 熟悉至少一种主流的机器学习框架(TensorFlow / PyTorch)
- 掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
- 良好的沟通协作能力,能和团队一起探索新技术,推进技术进步
加分项
- 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先
- 有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co-Design,Distributed Storage
- 在大模型领域,参与过大影响力的项目或论文者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。