大模型推理框架开发工程师
岗位摘要
基于壁仞GPU软件栈,开发并维护大模型及多模态大模型推理服务框架;设计并实现并行策略、GPU通信、算子融合、量化压缩等核心优化方案;持续降低模型推理延迟,提升线上服务吞吐量与稳定性;与硬件、算法、产品团队协同,推动框架在业务场景快速落地
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 基于壁仞GPU软件栈,开发并维护大模型及多模态大模型推理服务框架
- 设计并实现并行策略、GPU通信、算子融合、量化压缩等核心优化方案
- 持续降低模型推理延迟,提升线上服务吞吐量与稳定性
- 与硬件、算法、产品团队协同,推动框架在业务场景快速落地
- 跟踪前沿推理技术,定期输出技术分享与优化报告
任职要求
- 硕士及以上学历,计算机、数学、软件工程、自动化、通信、微电子等相关专业
- 3年以上高性能计算或AI推理系统开发经验
- 精通C/C++或Python,具备扎实编程功底与系统调优能力
- 熟悉大模型推理技术栈,有vLLM、SGLang、LMDeploy、TensorRT-LLM等框架适配经验者优先
- 具备CUDA编程与GPU性能优化经验者优先
- 热爱技术,逻辑清晰,自驱力强,具备良好团队协作与沟通能力
福利待遇
- 15薪,30-50K月薪,绩效奖金与年度调薪
- 弹性工作制、补充商业保险、年度体检
- GPU前沿技术实践机会,参与国家级大模型项目
- 技术大咖1对1导师制,快速晋升通道
- 杭州滨江核心地段,地铁直达,免费下午茶与加班餐
工作地址
杭州滨江区海威天地T3座28楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。