大模型和分布式推理优化实习生
岗位摘要
参与分布式推理系统建设,为LLM/多模态模型提供行业领先的解决方案;针对大语言模型等场景,开展端到端推理性能优化,降低推理延迟并提升吞吐量;针对大语言模型等场景,开展端到端推理精度分析,提升模型精度
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与分布式推理系统建设,为LLM/多模态模型提供行业领先的解决方案
- 针对大语言模型等场景,开展端到端推理性能优化,降低推理延迟并提升吞吐量
- 针对大语言模型等场景,开展端到端推理精度分析,提升模型精度
- 开发和维护大语言模型量化工具等
任职要求
- 计算机、电子工程、自动化、数学等相关专业在读硕士,优先考虑
- 精通Python/C++开发
- 深入理解LLM或视觉生成模型框架和原理
- 深入理解量化、kvcache、多机多卡并行等加速技术
- 实习时间不少于6个月,每周出勤至少4天
- 有GPU/加速卡调优实践经验者优先
- 有开源仓库贡献经验者优先
- 参与过LLM或视觉生成端到端推理优化项目并实际落地者优先
- 有集群部署经验者优先
- 了解torch.compile/CUDAGraph/Triton等优化技术者优先
- 了解vllm、sglang、megatron、verl等框架者优先
加分项
- 参与过LLM或者视觉生成端到端推理优化项目,并实际落地
- 了解torch.
- compile/CUDAGraph/Triton
- 了解vllm, sglang, megatron, verl等
福利待遇
- 参与行业领先的大模型推理优化项目,积累前沿AI技术实战经验
- 深入接触vllm、sglang、megatron、verl等主流开源推理框架
- 技术驱动的团队氛围,适合技术钻研与快速成长
- 接触GPU/加速卡调优等底层优化技术,提升系统级工程能力
工作地址
北京海淀区致真大厦D1601
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。