AI推理工程师
岗位摘要
负责公司大模型系统工具链相关功能研发;支持公司级大规模GPU集群运行和调优通用大模型;针对大模型训练或推理过程中的问题,协同基础软件及硬件联动设计;负责超大规模机器学习系统架构设计开发,解决训练系统稳定性及性能问题
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责公司大模型系统工具链相关功能研发
- 支持公司级大规模GPU集群运行和调优通用大模型
- 针对大模型训练或推理过程中的问题,协同基础软件及硬件联动设计
- 负责超大规模机器学习系统架构设计开发,解决训练系统稳定性及性能问题
- 攻克大模型推理系统高并发、高可靠性、高可扩展性技术难关
- 覆盖资源调度、模型训练、模型推理、数据管理、工作流编排等子方向
- 与算法部门深度合作,进行算法与系统联合优化
任职要求
- 优秀的代码能力、数据结构和基础算法功底,熟练Golang、C/C++或Python
- 熟悉至少一种主流机器学习框架(TensorFlow/PyTorch)
- 掌握分布式系统原理,参与过大规模分布式系统设计、开发和维护
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力
- 良好的沟通协作能力,能和团队一起探索新技术,推进技术进步
- 熟悉NLP、CV相关算法和技术,熟悉大模型训练、RL算法者优先
- 有CUDA、RDMA、AI Infrastructure、HW/SW Co-Design、Distributed Storage经验者优先
- 在大模型领域参与过大影响力项目或论文者优先
加分项
- 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先
- 有以下某一方向领域的经验:CUDA,RDMA,AI Infrastructure,HW/SW Co
- Design,Distributed Storage
- 在大模型领域,参与过大影响力的项目或论文者优先
- 常先生 刚刚活跃
福利待遇
- 15薪,年薪25-50K,具有竞争力的薪酬体系
- 上海核心地段办公环境,长泰广场B座
- 参与前沿大模型与GPU集群核心技术,技术成长空间大
- 与顶尖算法与系统团队深度合作,快速积累分布式AI实战经验
工作地址
上海浦东新区长泰广场B座1
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。