多元化芯片训推引擎研发工程师
岗位摘要
负责大模型训练/推理框架从英伟达生态向国产AI芯片环境的迁移与适配;深入底层解决国产芯片运行效率低、稳定性差的问题,通过算子优化、显存优化等手段极致提升硬件利用率;针对LLM核心计算逻辑,基于国产芯片指令集或SDK进行高性能算子的手写与调优
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型训练/推理框架从英伟达生态向国产AI芯片环境的迁移与适配
- 深入底层解决国产芯片运行效率低、稳定性差的问题,通过算子优化、显存优化等手段极致提升硬件利用率
- 针对LLM核心计算逻辑,基于国产芯片指令集或SDK进行高性能算子的手写与调优
- 解决国产算力集群在千卡/万卡互联时的通信瓶颈,优化集合通信库,确保分布式训练高效稳定
任职要求
- 计算机、电子工程或相关专业本科及以上学历,有高性能计算或AI底层系统开发经验者优先
- 精通C/C++和Python,具有极强的代码构建能力,熟悉计算机体系结构者优先
- 深入理解主流AI框架(PyTorch/TensorFlow)的底层实现机制,有自定义算子开发或框架源码修改经验者优先
- 具有以下任意一种芯片开发经验者优先:华为昇腾、壁仞/沐曦/天数/摩尔线程、寒武纪/昆仑芯/平头哥
- CUDA优化专家愿意转型攻克国产算力难题者同样欢迎
加分项
- ): 高度优先考虑具有以下任意一种芯片开发经验的候选人: 华为昇腾、壁仞/沐曦/天数/摩尔线程、寒武纪/昆仑芯/平头哥
- CUDA背景: 如果你是CUDA优化的大牛,愿意转型攻克国产算力难题,我们也极其欢迎
- 许先生 刚刚活跃
工作地址
北京海淀区大恒科技大厦南座F9层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。