返回岗位列表

面壁智能

大模型推理与部署优化工程师

地点:北京 薪资:35-65K 日期:2026-05-08

岗位摘要

负责大语言模型、多模态模型的推理引擎搭建、优化与线上落地,支撑高并发、低延迟的模型服务;基于vLLM、TensorRT-LLM、SGLang、LightLLM等主流推理框架进行性能调优,并探索推测性解码、前缀缓存等前沿加速技术

岗位职责

  • 负责大语言模型、多模态模型的推理引擎搭建、优化与线上落地,支撑高并发、低延迟的模型服务
  • 基于vLLM、TensorRT-LLM、SGLang、LightLLM等主流推理框架进行性能调优,并探索推测性解码、前缀缓存等前沿加速技术
  • 负责大模型在NVIDIA A/H系列、昇腾等国产加速卡上的适配与算子优化,解决兼容性与性能瓶颈
  • 设计与实现高性能模型Serving架构,包括Prefill-Decode分离架构、连续批处理、负载均衡、流式输出等
  • 基于Docker、Kubernetes实现模型服务容器化编排、弹性扩缩容与运维稳定性保障
  • 定位并解决线上服务瓶颈:如显存碎片化、OOM、推理崩溃、时延抖动、多卡并行异常等
  • 与算法团队协作,将训练好的模型权重标准化、工程化,实现快速上线与迭代

任职要求

  • 本科及以上学历,计算机相关专业,2年及以上大模型部署或推理优化相关经验
  • 熟悉多种主流大模型推理框架(如vLLM、SGLang、TensorRT-LLM),深入理解其PagedAttention、KV Cache管理等核心机制
  • 熟悉CUDA或昇腾CANN开发,有算子级优化经验者优先
  • 具备模型服务化与高并发架构设计经验,熟悉流式推理、流量管控等策略
  • 熟练使用Nsight Systems、PyTorch Profiler等性能分析工具进行瓶颈分析
  • 熟悉Linux环境,具备较强的问题排查能力,能独立定位崩溃、性能瓶颈、硬件兼容性问题
  • 有在A100/H100/昇腾910B等硬件上部署优化百亿/千亿参数大模型经验者优先

加分项

  • 有国产硬件(昇腾 / 寒武纪 / 海光等)适配与优化经验
  • 对 SGLang、vLLM 等框架有源码级修改或核心贡献
  • 具备 PD 分离 或 集群算力调度优化 经验
  • 熟悉监控告警、服务可观测性体系
  • 谭女士 刚刚活跃

福利待遇

  • 具有竞争力的薪酬:35-65K·15薪
  • 参与前沿大模型推理优化项目,接触行业领先技术
  • 与算法团队紧密协作,实现技术价值快速转化
  • 接触国产化硬件适配与优化,积累多元化技术经验
  • 扁平化管理,技术氛围浓厚,职业发展空间大

工作地址

北京海淀区科建大厦6层