推理Infra工程师(2026届校招)
岗位摘要
参与大模型推理框架的设计与开发,协助团队进行支撑大语言模型、图像生成等复杂模型推理的高性能框架研发;推动算法到产品落地的全链路优化,确保推理的高效性、稳定性和低延迟;在资深工程师指导下,参与优化内存管理、计算资源分配与调度策略,提升模型推理速度和资源利用率
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与大模型推理框架的设计与开发,协助团队进行支撑大语言模型、图像生成等复杂模型推理的高性能框架研发
- 推动算法到产品落地的全链路优化,确保推理的高效性、稳定性和低延迟
- 在资深工程师指导下,参与优化内存管理、计算资源分配与调度策略,提升模型推理速度和资源利用率
- 学习并使用性能分析工具(如Nvidia Nsight)进行瓶颈定位和优化
- 学习并应用业界前沿的推理优化技术,包括KV Cache优化、模型量化(Quantization)、剪枝(Pruning)、跨机分布式推理优化等
任职要求
- 熟练掌握C++和Python编程语言,具备扎实的数据结构、算法和操作系统基础
- 熟悉至少一种主流的深度学习框架(如PyTorch、TensorFlow),了解其基本实现原理
- 了解GPU编程(如CUDA)或并行计算,有相关的课程项目或实验经验
- 对Transformer架构及主流大模型(如GPT、Llama、Qwen等)的推理特性有基本理解
- 了解大模型推理的基本流程和常见挑战(如延迟、吞吐、内存占用)
- 有大模型推理框架(如vLLM、TensorRT-LLM、SGLang、llama.cpp等)的使用或初步研究经验者优先
- 对AI编译器技术(如TVM、MLIR、Triton)有初步接触或浓厚兴趣者优先
- 了解大模型推理相关的优化技术,如FlashAttention、PageAttention、量化、LoRA微调等者优先
- 在相关领域的顶会(MLSys, ASPLOS等)或开源项目中有贡献或论文者优先
福利待遇
- 具有竞争力的薪酬:25-50K·16薪
- 北京海淀区搜狐网络大厦办公环境
工作地址
北京海淀区搜狐网络大厦搜狐网络大厦11层
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。