AGI 推理引擎—KVCache 存储与缓存加速工程师
岗位摘要
设计并实现 KVCache 多级缓存系统(HBM → DRAM → SSD → 分布式存储),构建高命中率、低延迟的缓存管理与驱逐机制;打造 KVCache 的高速数据通路,落地 RDMA、GPU Direct Storage(GDS)、零拷贝等技术,实现 SSD-GPU 的高吞吐、低延迟传输
岗位职责
- 设计并实现 KVCache 多级缓存系统(HBM → DRAM → SSD → 分布式存储),构建高命中率、低延迟的缓存管理与驱逐机制
- 打造 KVCache 的高速数据通路,落地 RDMA、GPU Direct Storage(GDS)、零拷贝等技术,实现 SSD-GPU 的高吞吐、低延迟传输
- 设计 KVCache 调度与前缀复用能力(前缀匹配、滑窗匹配、跨请求/跨实例缓存共享),系统性提升缓存命中率,降低 TTFT
- 与 vLLM、SGLang、TensorRT-LLM 等推理引擎深度集成,参与 PD 分离(Prefill/Decode)架构下的 KVCache 池化与全局管理
- 在千亿 token/天的真实负载下持续优化系统吞吐、显存占用、命中率与稳定性,并将能力沉淀为可靠的工程平台
任职要求
- 熟练掌握 C++、Go、Rust 中至少一门系统级语言(或具备扎实的 Python 工程能力),有 2 年以上系统软件/基础设施开发经验与良好的工程素养
- 具备扎实的操作系统、存储与网络基础,理解内存层级、文件系统与 I/O 路径,对高并发、大规模数据处理有真实实践
- 熟悉 NVMe/SSD、RDMA、分布式存储、缓存系统等至少一类高性能存储或通信技术
- 具备较强的性能分析与问题排查能力,能独立承担核心模块的设计与实现,并对延迟、吞吐、命中率等指标有量化意识
- 加分项:有 KVCache 相关方向的实践或方案经验,了解或参与过 Mooncake、3FS、FlexKV、Tair KVCache、LMCache 等业界方案
- 加分项:熟悉 LLM 推理流程与显存管理,理解 KVCache、PagedAttention、前缀缓存、PD 分离等机制
- 加分项:有 GPU Direct Storage、RDMA、零拷贝或异构存储统一接入的工程经验
- 加分项:熟悉主流推理引擎(vLLM、SGLang、TensorRT-LLM、NVIDIA Dynamo),或有源码级理解与社区贡献
- 加分项:对 AI/大模型基础设施有浓厚兴趣,关注社区进展并有个人项目或开源贡献
加分项
- 有 KVCache 相关方向的实践或方案经验,了解或参与过 Mooncake、3FS、FlexKV、Tair KVCache、LMCache 等业界方案者优先
- 熟悉 LLM 推理流程与显存管理,理解 KVCache、PagedAttention、前缀缓存、PD 分离等机制
- 有 GPU Direct Storage、RDMA、零拷贝或异构存储统一接入的工程经验
- 熟悉主流推理引擎(vLLM / SGLang / TensorRT
- LLM / NVIDIA KVCache、LMCache 等业界方案者优先
- LLM / NVIDIA Dynamo)或对其有源码级理解、社区贡献
- 对 AI / 大模型基础设施有浓厚兴趣,关注社区进展并有个人项目或开源贡献
- 李明基 刚刚活跃
福利待遇
- 薪资 30-60K·16薪,回报与核心业务价值直接挂钩
- 离 GPU 最近的工程:每一行代码都直接换算成显存、吞吐和成本,价值看得见、摸得着
- AI First 文化:用 AI 重新定义开发范式,鼓励工程师把 AI 工具用到极致,也用 AI 加速自己的系统研发
- 真实的大规模场景:千卡集群、千亿 token/天的在线推理,长上下文、高并发下的存储与调度挑战
- 扁平高效的团队:与推理引擎、算法、存储团队并肩作战,方案当天讨论、当天落地
工作地址
北京海淀区蓟门壹号8楼