大模型推理优化工程师
岗位摘要
基于壁仞GPU软件栈,开发大模型和多模态大模型推理服务框架;进行模型部署优化;围绕并行策略、GPU通信、算子融合、量化压缩等方面,持续优化大语言模型推理性能;降低模型推理延迟,提升线上模型服务吞吐
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于壁仞GPU软件栈,开发大模型和多模态大模型推理服务框架
- 进行模型部署优化
- 围绕并行策略、GPU通信、算子融合、量化压缩等方面,持续优化大语言模型推理性能
- 降低模型推理延迟,提升线上模型服务吞吐
任职要求
- 硕士及以上学历,计算机、数学、软件工程、自动化、通信、微电子等相关专业
- 两年以上相关工作经历
- 扎实编程能力,熟练使用C/C++或Python进行框架或系统编程
- 有CUDA算子优化或其他端侧芯片算子优化经验者优先
- 熟悉大模型推理技术栈,有vLLM、SGLang、LMDeploy、TensorRT-LLM等推理框架适配开发经验者优先
- 熟悉大模型推理优化常用技术,如PD分离、多卡CP/PP/TP并行、Chunked Prefill调度
- 有常见大模型架构(如Deepseek、Qwen等)优化经验者优先
- 热爱技术、追求卓越,具备良好的学习能力和团队协作能力,自驱力强,逻辑思维强
福利待遇
- 薪资范围:45-50K·15薪
- 工作地点:杭州滨江区
- 团队氛围积极,技术导向
工作地址
杭州滨江区海威天地T3T328
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。