大模型压缩加速算法研究员
岗位摘要
深度参与LLM大模型压缩加速方案的研究与设计;研究投机采样技术,适配LLM模型架构,探索Prefill/RL等场景下的优化加速方案;研究稀疏化技术,包括Sparse Attention、KV-Cache压缩、模型结构剪枝,协同框架定制化稀疏方案以提升推理性能
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 深度参与LLM大模型压缩加速方案的研究与设计
- 研究投机采样技术,适配LLM模型架构,探索Prefill/RL等场景下的优化加速方案
- 研究稀疏化技术,包括Sparse Attention、KV-Cache压缩、模型结构剪枝,协同框架定制化稀疏方案以提升推理性能
- 研究量化技术,优化Transformer中Linear/KV-Cache/Attention的量化算法,适配FP8/INT8/NVFP4等方案及不同硬件后端
- 探索极低比特量化训练方案,深度协同硬件进行联合优化,实现模型体积极致压缩和性能突破,并推动业务落地
- 聚焦长上下文、多轮对话优化等压缩加速新技术的研究
- 设计可落地的大模型压缩算法及成本优化方案,助力模型性能加速,涉及模型结构及软硬协同优化
- 分析业务性能瓶颈和模型特点,定制化开发大模型压缩优化工具,实现一站式模型压缩-部署的高速推理方案
- 参与前沿的模型压缩加速算法研究,追踪领域最新进展,撰写并发表顶会论文
任职要求
- 计算机科学、人工智能或相关专业硕士及以上学历
- 具备大语言模型、深度学习或模型压缩相关研究或工作经验
- 熟练掌握PyTorch、TensorFlow等深度学习框架以及CUDA编程技术
- 熟悉模型量化、剪枝、稀疏注意力等模型压缩与推理加速算法
- 具备Transformer架构优化及LLM推理性能调优的实践经验
- 了解GPU等AI加速硬件架构及FP8/INT8/NVFP4等低精度量化方案
- 具备顶级会议论文发表经验或前沿算法研究能力
- 精通Python和C++编程语言,具备良好的工程实现能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。