大模型推理与部署优化工程师
岗位摘要
负责大语言模型、多模态模型的推理引擎搭建、优化与线上落地,支撑高并发、低延迟的模型服务;基于vLLM、TensorRT-LLM、SGLang、LightLLM等主流推理框架进行性能调优,并探索推测性解码、前缀缓存等前沿加速技术
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大语言模型、多模态模型的推理引擎搭建、优化与线上落地,支撑高并发、低延迟的模型服务
- 基于vLLM、TensorRT-LLM、SGLang、LightLLM等主流推理框架进行性能调优,并探索推测性解码、前缀缓存等前沿加速技术
- 负责大模型在NVIDIA A/H系列、昇腾等国产加速卡上的适配与算子优化,解决兼容性与性能瓶颈
- 设计与实现高性能模型Serving架构,包括Prefill-Decode分离架构、连续批处理、负载均衡、流式输出等
- 基于Docker、Kubernetes实现模型服务容器化编排、弹性扩缩容与运维稳定性保障
- 定位并解决线上服务瓶颈:如显存碎片化、OOM、推理崩溃、时延抖动、多卡并行异常等
- 与算法团队协作,将训练好的模型权重标准化、工程化,实现快速上线与迭代
任职要求
- 本科及以上学历,计算机相关专业,2年及以上大模型部署或推理优化相关经验
- 熟悉多种主流大模型推理框架(如vLLM、SGLang、TensorRT-LLM),深入理解其PagedAttention、KV Cache管理等核心机制
- 熟悉CUDA或昇腾CANN开发,有算子级优化经验者优先
- 具备模型服务化与高并发架构设计经验,熟悉流式推理、流量管控等策略
- 熟练使用Nsight Systems、PyTorch Profiler等性能分析工具进行瓶颈分析
- 熟悉Linux环境,具备较强的问题排查能力,能独立定位崩溃、性能瓶颈、硬件兼容性问题
- 有在A100/H100/昇腾910B等硬件上部署优化百亿/千亿参数大模型经验者优先
加分项
- 有国产硬件(昇腾 / 寒武纪 / 海光等)适配与优化经验
- 对 SGLang、vLLM 等框架有源码级修改或核心贡献
- 具备 PD 分离 或 集群算力调度优化 经验
- 熟悉监控告警、服务可观测性体系
- 谭女士 刚刚活跃
福利待遇
- 具有竞争力的薪酬:35-65K·15薪
- 参与前沿大模型推理优化项目,接触行业领先技术
- 与算法团队紧密协作,实现技术价值快速转化
- 接触国产化硬件适配与优化,积累多元化技术经验
- 扁平化管理,技术氛围浓厚,职业发展空间大
工作地址
北京海淀区科建大厦6层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。