AI基础设施工程师
岗位摘要
深入GPU/NPU硬件与软件栈交互底层,通过内核优化、通信库调优与自定义算子榨干硬件算力;主导或深度参与大规模分布式训练框架与高性能推理引擎的研发、定制与问题攻坚;设计和优化基于RDMA的高性能网络架构,解决超大规模集群下的通信瓶颈
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 深入GPU/NPU硬件与软件栈交互底层,通过内核优化、通信库调优与自定义算子榨干硬件算力
- 主导或深度参与大规模分布式训练框架与高性能推理引擎的研发、定制与问题攻坚
- 设计和优化基于RDMA的高性能网络架构,解决超大规模集群下的通信瓶颈
- 构建高可靠、自动化的MLOps平台与资源调度系统,确保海量计算任务高效稳定流转
- 为全团队提供顺滑的开发体验,打造"活"的机器学习平台
任职要求
- 拥有扎实的计算机基础,能将精妙的设计转化为稳定、优雅的代码,对代码质量有近乎本能的执着
- 是HPC、RDMA网络、训推框架、算子优化、机器学习平台或SRE某一技术领域的深度实践者
- 具备从问题定位、技术方案设计到最终落地的全链路能力
- 对技术有强烈的好奇心与驱动力,不满足于黑盒,享受抽丝剥茧、直达问题本质的过程
- 拥有极强的技术Owner意识,能主动承担责任,并乐于与团队共享知识、共同成长
- 硕士及以上学历,经验不限
加分项
- 具备千卡级以上大模型训练或高并发推理服务的实战经验
- 有通信库(NCCL)或核心框架等底层基础设施的贡献经验
- 在相关领域发表过高水平学术论文或拥有专利
- 刘若云 刚刚活跃
福利待遇
- 月薪45-75K,16薪
- 参与大模型时代前沿AI基础设施建设
- 万卡级超大规模集群的技术挑战与实践机会
- 与顶尖技术团队共同成长的开放氛围
工作地址
北京海淀区大恒科技大厦9
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。