大模型推理优化与GPU算子开发工程师
岗位摘要
负责大模型推理引擎核心研发与性能优化,降低延迟并提升吞吐量;对主流大模型进行算子级深度优化,实现高性能GPU内核;基于CUDA/C++开发定制化算子,结合自研GPU硬件特性调优;研发PD分离、Continuous Batching、PagedAttention等前沿推理调度机制
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型推理引擎核心研发与性能优化,降低延迟并提升吞吐量
- 对主流大模型进行算子级深度优化,实现高性能GPU内核
- 基于CUDA/C++开发定制化算子,结合自研GPU硬件特性调优
- 研发PD分离、Continuous Batching、PagedAttention等前沿推理调度机制
- 深入主流推理框架并结合业务场景进行框架级优化与扩展
- 与训练、部署、硬件团队协作,实现多硬件平台高效适配与协同优化
任职要求
- 计算机、人工智能、电子工程等相关专业本科及以上学历,系统编程与算法基础扎实
- 熟练掌握C/C++和Python,具备良好的代码风格与系统调试能力
- 至少一年GPU/NPU/CPU算子开发优化或AI基础设施研发经验
- 熟悉GPU体系结构及并行编程模型,精通CUDA及cuBLAS/cuDNN/Cutlass等加速库
- 深入理解Transformer架构及大模型推理流程,熟悉KV Cache、Attention优化、内存管理
- 熟悉vLLM、SGLang、TensorRT-LLM等主流推理框架并有实际部署或优化经验
- 熟练使用Nsight Systems、nvprof、perf等工具进行性能分析与瓶颈定位
- 了解分布式推理、模型并行、流水线并行及通信优化、显存管理
- 在OSDI、SOSP、ASPLOS、MLSys、SC等顶会发表过相关论文或参与vLLM/SGLang开源贡献
- 具备国产AI芯片适配优化经验或大规模模型高并发推理服务开发经验
加分项
- 熟悉GPU体系结构及并行编程模型,精通CUDA编程,有使用cuBLAS、cuDNN、Cutlass等加速库的经验者优先
- 深入理解Transformer架构及大模型推理流程,熟悉KV Cache、Attention优化、内存管理等关键技术
- 熟悉至少一种主流大模型推理框架(如vLLM、SGLang、TensorRT
- LLM等),有实际部署或优化经验
- 具备性能分析与调优能力,熟练使用Nsight Systems、nvprof、perf等工具进行瓶颈定位与优化
- 了解分布式推理、模型并行、流水线并行等技术,对通信优化、显存管理有实践经验者优先
- 在OSDI、SOSP、ASPLOS、MLSys、SC等系统或AI顶会发表过相关论文
- 参与过vLLM、SGLang等开源项目并有代码贡献
- 具备国产AI芯片(如昇腾、寒武纪、昆仑芯等)适配与优化经验
- 有大规模模型线上部署或高并发推理服务开发经验
- 极具竞争力的薪酬与期权激励,对标P6/P7级岗位
- 与顶尖AI与系统工程师共事的机会,浓厚的技术氛围与持续成长空间
- 参与核心基础设施建设,技术成果可落地于亿级用户场景
- 加入我们,共同打造下一代高性能大模型推理算子软件库!
- 龚辰 2月内活跃
- 壁仞科技 · 深度学习库经理
福利待遇
- 对标P6/P7极具竞争力的薪酬与期权激励
- 与顶尖AI与系统工程师共事,浓厚技术氛围与持续成长空间
- 核心基础设施建设机会,技术成果落地亿级用户场景
工作地址
杭州滨江区海威天地T3-28
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。