大规模预训练模型推理系统工程师
岗位摘要
负责大规模预训练模型(如GPT、BERT、LLM等)的推理系统设计、优化与落地,实现模型在多平台(GPU、CPU、NPU等)上的高效推理;针对模型推理场景,深入分析性能瓶颈,主导模型量化、剪枝、蒸馏、结构重参数化等前沿推理加速技术的研究与应用
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大规模预训练模型(如GPT、BERT、LLM等)的推理系统设计、优化与落地,实现模型在多平台(GPU、CPU、NPU等)上的高效推理
- 针对模型推理场景,深入分析性能瓶颈,主导模型量化、剪枝、蒸馏、结构重参数化等前沿推理加速技术的研究与应用
- 参与大模型推理框架(如TensorRT、ONNX Runtime、OpenVINO、MindSpore等)的开发与优化,提升推理效率与系统稳定性
- 跟踪业界和学术界大模型推理相关前沿技术,推动创新方案在业务中的应用落地
- 与算法、系统、硬件等团队紧密协作,制定端到端的推理优化方案,支撑业务高并发、低延迟的需求
- 负责推理平台的技术难点攻关,解决模型部署、兼容性、资源调度等实际问题
- 围绕公司内主流应用模型进行模型压缩和加速方面的算法和工程探索,面向高效推理场景进行模型结构设计和改造
- 构建高性能、多硬件的统一NTP推理框架,支持自研模型和优秀开源模型的推理,支撑公司内大模型应用的低成本探索
任职要求
- 计算机科学、人工智能或相关专业的本科及以上学历,具备扎实的计算机基础理论知识
- 熟悉深度学习框架(如PyTorch、TensorFlow)和主流推理引擎(如TensorRT、ONNX Runtime、OpenVINO等),具备相关开发经验
- 掌握模型优化技术,包括量化、剪枝、蒸馏、结构重参数化等,具备大规模预训练模型(如GPT、BERT、LLM)推理加速的实践经验
- 精通C++或Python编程语言,熟悉GPU(CUDA)、CPU或NPU等硬件架构及性能优化方法
- 具备大模型推理框架开发或优化经验,能够解决模型部署、兼容性、资源调度等技术难题
- 具有良好的团队协作能力,能够与算法、系统、硬件等跨职能团队紧密配合,推动技术方案落地
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。