AI推理工程师
岗位摘要
负责大模型在摩尔线程GPU上的推理适配、性能优化与部署落地;基于vLLM/TensorRT-LLM/SGLang等引擎,做分布式推理、量化与KV缓存优化,提升吞吐并降低延迟;解决高并发、长文本、多轮对话等场景下的稳定性与性能瓶颈
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型在摩尔线程GPU上的推理适配、性能优化与部署落地
- 基于vLLM/TensorRT-LLM/SGLang等引擎,做分布式推理、量化与KV缓存优化,提升吞吐并降低延迟
- 解决高并发、长文本、多轮对话等场景下的稳定性与性能瓶颈
- 与算法、硬件、客户团队协作,对接需求并输出推理解决方案
- 跟踪大模型推理前沿技术,优化工具链与推理框架
任职要求
- 计算机/电子/AI相关专业,本科及以上学历,2年以上大模型推理工程经验
- 熟练掌握C++/Python,熟悉Linux与GPU编程,了解CUDA优先
- 熟悉Transformer与主流大模型(Llama/Qwen/DeepSeek等),有vLLM/TensorRT-LLM等框架实战经验
- 掌握量化(INT4/8/FP8)、算子优化、分布式推理等技术优先
- 具备高并发服务部署、问题排查与性能调优能力,良好的跨团队沟通与协作能力
福利待遇
- 有竞争力的薪酬:40-70K·16薪
- 技术驱动型团队,接触业界前沿AI推理技术
- 与算法、硬件团队深度协作,提升全栈技术能力
- 创新型AI芯片企业,职业发展前景广阔
- 完善的员工福利与培训体系
工作地址
上海浦东新区长泰国际商业广场C座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。