大模型高性能推理优化工程师
岗位摘要
深度优化基于NVIDIA GPU的大模型推理性能,包括MoE架构、Long Context(长文本)等前沿场景;参与vLLM、SGLang、TensorRT-LLM等主流引擎的源码级开发与性能压榨
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 深度优化基于NVIDIA GPU的大模型推理性能,包括MoE架构、Long Context(长文本)等前沿场景
- 参与vLLM、SGLang、TensorRT-LLM等主流引擎的源码级开发与性能压榨
- 负责High-performance Kernel开发,利用Triton、CUTLASS或原生CUDA优化关键算子(如Attention、Quantization)
- 研究并落地投机采样(Speculative Decoding)、PD分离、KV Cache管理等前沿系统优化技术
任职要求
- 计算机相关专业,有大厂核心Infra经验者优先
- 精通C++/Python,对GPU体系结构(显存层级、指令集、通信带宽)有深刻理解
- 在CUDA/Triton开发方面有深厚积淀,有能力手写算子并复现SOTA性能
- 熟悉分布式推理通信优化(NCCL、RDMA),有大规模集群推理部署经验
- 加分项:在OSDI等顶会发表过系统方向论文者优先
加分项
- 在 OSDI 等顶会发表过系统方向论文者优先
- 许先生 刚刚活跃
工作地址
北京海淀区大恒科技大厦南座F9层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。