AI推理工程师
岗位摘要
负责大模型在摩尔线程GPU上的推理适配、性能优化与部署落地;基于vLLM/TensorRT-LLM/SGLang等引擎,做分布式推理、量化、KV缓存优化,提升吞吐并降低延迟;解决高并发、长文本、多轮对话等场景的稳定性与性能瓶颈
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责大模型在摩尔线程GPU上的推理适配、性能优化与部署落地
- 基于vLLM/TensorRT-LLM/SGLang等引擎,做分布式推理、量化、KV缓存优化,提升吞吐并降低延迟
- 解决高并发、长文本、多轮对话等场景的稳定性与性能瓶颈
- 与算法、硬件、客户团队协作,对接需求并输出推理解决方案
- 跟踪大模型推理前沿技术,优化工具链与推理框架
任职要求
- 计算机/电子/AI相关专业,本科及以上学历,2年以上大模型推理工程经验
- 熟练C++/Python,熟悉Linux与GPU编程,了解CUDA优先
- 熟悉Transformer与主流大模型(Llama/Qwen/DeepSeek等),有vLLM/TensorRT-LLM等框架实战经验
- 掌握量化(INT4/8/FP8)、算子优化、分布式推理等技术优先
- 具备高并发服务部署、问题排查、性能调优能力,良好的跨团队沟通与协作能力者优先
福利待遇
- 薪资范围:40-70K·16薪
- 工作地点:北京朝阳区望京国际研发园
- 经验不限,本科及以上学历
工作地址
北京朝阳区望京国际研发园
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。