软件工程师,模型运行时
岗位摘要
为运行在定制芯片上的前沿模型设计和实现LLM推理运行时;构建调度、连续批处理、内存管理、KV缓存管理和高性能推理的执行编排;开发跨芯片、主机和机架的分布式执行策略,包括模型划分、通信与同步
岗位职责
- 为运行在定制芯片上的前沿模型设计和实现LLM推理运行时
- 构建调度、连续批处理、内存管理、KV缓存管理和高性能推理的执行编排
- 开发跨芯片、主机和机架的分布式执行策略,包括模型划分、通信与同步
- 优化不同模型架构和服务负载下的端到端延迟、吞吐量、内存效率与硬件利用率
- 与内核、编译器、架构和芯片团队合作,共同设计接口并消除全栈性能瓶颈
- 在可靠的生产运行时中支持新模型特性、执行模式、数值格式和硬件能力
- 创建性能分析、可观测性、基准测试和性能建模工具,使运行时行为可度量、可操作
- 调试跨模型代码、运行时软件、通信层和硬件的复杂正确性、性能与可靠性问题
- 将工作负载洞察转化为对下一代芯片和系统架构的明确需求
任职要求
- 具备C++、Rust、Python或类似性能导向环境的强大系统编程经验
- 构建或优化过运行时、分布式系统、编译器、内核、模型服务基础设施或相关系统软件
- 理解现代LLM推理,包括预填充和解码行为、批处理、KV缓存权衡和模型并行
- 能够定量分析延迟、吞吐量、计算强度、内存带宽、通信和利用率
- 熟悉跨硬件-软件栈多层的性能分析和调试
- 能设计清晰抽象,同时保留从专用硬件提取性能所需的低层控制
- 能与模型、系统、编译器、内核和硬件团队有效协作,推动模糊技术问题落地
- 重视生产质量,包括正确性、可观测性、可靠性、可维护性和大规模下的优雅行为
- 可能需要满足美国出口管制法律法规规定的某些法律身份要求