返回岗位列表

壁仞科技

大模型推理优化与GPU算子开发工程师

地点:杭州 薪资:20-40K 日期:2026-03-03

岗位摘要

负责大模型推理引擎核心研发与性能优化,降低延迟并提升吞吐量;对主流大模型进行算子级深度优化,实现高性能GPU内核;基于CUDA/C++开发定制化算子,结合自研GPU硬件特性调优;研发PD分离、Continuous Batching、PagedAttention等前沿推理调度机制

岗位职责

  • 负责大模型推理引擎核心研发与性能优化,降低延迟并提升吞吐量
  • 对主流大模型进行算子级深度优化,实现高性能GPU内核
  • 基于CUDA/C++开发定制化算子,结合自研GPU硬件特性调优
  • 研发PD分离、Continuous Batching、PagedAttention等前沿推理调度机制
  • 深入主流推理框架并结合业务场景进行框架级优化与扩展
  • 与训练、部署、硬件团队协作,实现多硬件平台高效适配与协同优化

任职要求

  • 计算机、人工智能、电子工程等相关专业本科及以上学历,系统编程与算法基础扎实
  • 熟练掌握C/C++和Python,具备良好的代码风格与系统调试能力
  • 至少一年GPU/NPU/CPU算子开发优化或AI基础设施研发经验
  • 熟悉GPU体系结构及并行编程模型,精通CUDA及cuBLAS/cuDNN/Cutlass等加速库
  • 深入理解Transformer架构及大模型推理流程,熟悉KV Cache、Attention优化、内存管理
  • 熟悉vLLM、SGLang、TensorRT-LLM等主流推理框架并有实际部署或优化经验
  • 熟练使用Nsight Systems、nvprof、perf等工具进行性能分析与瓶颈定位
  • 了解分布式推理、模型并行、流水线并行及通信优化、显存管理
  • 在OSDI、SOSP、ASPLOS、MLSys、SC等顶会发表过相关论文或参与vLLM/SGLang开源贡献
  • 具备国产AI芯片适配优化经验或大规模模型高并发推理服务开发经验

加分项

  • 熟悉GPU体系结构及并行编程模型,精通CUDA编程,有使用cuBLAS、cuDNN、Cutlass等加速库的经验者优先
  • 深入理解Transformer架构及大模型推理流程,熟悉KV Cache、Attention优化、内存管理等关键技术
  • 熟悉至少一种主流大模型推理框架(如vLLM、SGLang、TensorRT
  • LLM等),有实际部署或优化经验
  • 具备性能分析与调优能力,熟练使用Nsight Systems、nvprof、perf等工具进行瓶颈定位与优化
  • 了解分布式推理、模型并行、流水线并行等技术,对通信优化、显存管理有实践经验者优先
  • 在OSDI、SOSP、ASPLOS、MLSys、SC等系统或AI顶会发表过相关论文
  • 参与过vLLM、SGLang等开源项目并有代码贡献
  • 具备国产AI芯片(如昇腾、寒武纪、昆仑芯等)适配与优化经验
  • 有大规模模型线上部署或高并发推理服务开发经验
  • 极具竞争力的薪酬与期权激励,对标P6/P7级岗位
  • 与顶尖AI与系统工程师共事的机会,浓厚的技术氛围与持续成长空间
  • 参与核心基础设施建设,技术成果可落地于亿级用户场景
  • 加入我们,共同打造下一代高性能大模型推理算子软件库!
  • 龚辰 2月内活跃
  • 壁仞科技 · 深度学习库经理

福利待遇

  • 对标P6/P7极具竞争力的薪酬与期权激励
  • 与顶尖AI与系统工程师共事,浓厚技术氛围与持续成长空间
  • 核心基础设施建设机会,技术成果落地亿级用户场景

工作地址

杭州滨江区海威天地T3-28