返回岗位列表

MiniMax

AGI 推理引擎—KVCache 存储与缓存加速工程师

地点:北京 薪资:30-60K 日期:2026-09-18

岗位摘要

设计并实现 KVCache 多级缓存系统(HBM → DRAM → SSD → 分布式存储),构建高命中率、低延迟的缓存管理与驱逐机制;打造 KVCache 的高速数据通路,落地 RDMA、GPU Direct Storage(GDS)、零拷贝等技术,实现 SSD-GPU 的高吞吐、低延迟传输

岗位职责

  • 设计并实现 KVCache 多级缓存系统(HBM → DRAM → SSD → 分布式存储),构建高命中率、低延迟的缓存管理与驱逐机制
  • 打造 KVCache 的高速数据通路,落地 RDMA、GPU Direct Storage(GDS)、零拷贝等技术,实现 SSD-GPU 的高吞吐、低延迟传输
  • 设计 KVCache 调度与前缀复用能力(前缀匹配、滑窗匹配、跨请求/跨实例缓存共享),系统性提升缓存命中率,降低 TTFT
  • 与 vLLM、SGLang、TensorRT-LLM 等推理引擎深度集成,参与 PD 分离(Prefill/Decode)架构下的 KVCache 池化与全局管理
  • 在千亿 token/天的真实负载下持续优化系统吞吐、显存占用、命中率与稳定性,并将能力沉淀为可靠的工程平台

任职要求

  • 熟练掌握 C++、Go、Rust 中至少一门系统级语言(或具备扎实的 Python 工程能力),有 2 年以上系统软件/基础设施开发经验与良好的工程素养
  • 具备扎实的操作系统、存储与网络基础,理解内存层级、文件系统与 I/O 路径,对高并发、大规模数据处理有真实实践
  • 熟悉 NVMe/SSD、RDMA、分布式存储、缓存系统等至少一类高性能存储或通信技术
  • 具备较强的性能分析与问题排查能力,能独立承担核心模块的设计与实现,并对延迟、吞吐、命中率等指标有量化意识
  • 加分项:有 KVCache 相关方向的实践或方案经验,了解或参与过 Mooncake、3FS、FlexKV、Tair KVCache、LMCache 等业界方案
  • 加分项:熟悉 LLM 推理流程与显存管理,理解 KVCache、PagedAttention、前缀缓存、PD 分离等机制
  • 加分项:有 GPU Direct Storage、RDMA、零拷贝或异构存储统一接入的工程经验
  • 加分项:熟悉主流推理引擎(vLLM、SGLang、TensorRT-LLM、NVIDIA Dynamo),或有源码级理解与社区贡献
  • 加分项:对 AI/大模型基础设施有浓厚兴趣,关注社区进展并有个人项目或开源贡献

加分项

  • 有 KVCache 相关方向的实践或方案经验,了解或参与过 Mooncake、3FS、FlexKV、Tair KVCache、LMCache 等业界方案者优先
  • 熟悉 LLM 推理流程与显存管理,理解 KVCache、PagedAttention、前缀缓存、PD 分离等机制
  • 有 GPU Direct Storage、RDMA、零拷贝或异构存储统一接入的工程经验
  • 熟悉主流推理引擎(vLLM / SGLang / TensorRT
  • LLM / NVIDIA KVCache、LMCache 等业界方案者优先
  • LLM / NVIDIA Dynamo)或对其有源码级理解、社区贡献
  • 对 AI / 大模型基础设施有浓厚兴趣,关注社区进展并有个人项目或开源贡献
  • 李明基 刚刚活跃

福利待遇

  • 薪资 30-60K·16薪,回报与核心业务价值直接挂钩
  • 离 GPU 最近的工程:每一行代码都直接换算成显存、吞吐和成本,价值看得见、摸得着
  • AI First 文化:用 AI 重新定义开发范式,鼓励工程师把 AI 工具用到极致,也用 AI 加速自己的系统研发
  • 真实的大规模场景:千卡集群、千亿 token/天的在线推理,长上下文、高并发下的存储与调度挑战
  • 扁平高效的团队:与推理引擎、算法、存储团队并肩作战,方案当天讨论、当天落地

工作地址

北京海淀区蓟门壹号8楼