返回岗位列表

腾讯

大模型压缩加速算法研究员

地点:深圳 薪资:薪资未公开 日期:2026-01-29

岗位摘要

深度参与LLM大模型压缩加速方案的研究与设计;研究投机采样技术,适配LLM模型架构,探索Prefill/RL等场景下的优化加速方案;研究稀疏化技术,包括Sparse Attention、KV-Cache压缩、模型结构剪枝,协同框架定制化稀疏方案以提升推理性能

岗位职责

  • 深度参与LLM大模型压缩加速方案的研究与设计
  • 研究投机采样技术,适配LLM模型架构,探索Prefill/RL等场景下的优化加速方案
  • 研究稀疏化技术,包括Sparse Attention、KV-Cache压缩、模型结构剪枝,协同框架定制化稀疏方案以提升推理性能
  • 研究量化技术,优化Transformer中Linear/KV-Cache/Attention的量化算法,适配FP8/INT8/NVFP4等方案及不同硬件后端
  • 探索极低比特量化训练方案,深度协同硬件进行联合优化,实现模型体积极致压缩和性能突破,并推动业务落地
  • 聚焦长上下文、多轮对话优化等压缩加速新技术的研究
  • 设计可落地的大模型压缩算法及成本优化方案,助力模型性能加速,涉及模型结构及软硬协同优化
  • 分析业务性能瓶颈和模型特点,定制化开发大模型压缩优化工具,实现一站式模型压缩-部署的高速推理方案
  • 参与前沿的模型压缩加速算法研究,追踪领域最新进展,撰写并发表顶会论文

任职要求

  • 计算机科学、人工智能或相关专业硕士及以上学历
  • 具备大语言模型、深度学习或模型压缩相关研究或工作经验
  • 熟练掌握PyTorch、TensorFlow等深度学习框架以及CUDA编程技术
  • 熟悉模型量化、剪枝、稀疏注意力等模型压缩与推理加速算法
  • 具备Transformer架构优化及LLM推理性能调优的实践经验
  • 了解GPU等AI加速硬件架构及FP8/INT8/NVFP4等低精度量化方案
  • 具备顶级会议论文发表经验或前沿算法研究能力
  • 精通Python和C++编程语言,具备良好的工程实现能力