返回岗位列表

OpenAI

软件工程师,模型运行时

地点:美国 薪资:薪资未公开 日期:2026-09-19

岗位摘要

为运行在定制芯片上的前沿模型设计和实现LLM推理运行时;构建调度、连续批处理、内存管理、KV缓存管理和高性能推理的执行编排;开发跨芯片、主机和机架的分布式执行策略,包括模型划分、通信与同步

岗位职责

  • 为运行在定制芯片上的前沿模型设计和实现LLM推理运行时
  • 构建调度、连续批处理、内存管理、KV缓存管理和高性能推理的执行编排
  • 开发跨芯片、主机和机架的分布式执行策略,包括模型划分、通信与同步
  • 优化不同模型架构和服务负载下的端到端延迟、吞吐量、内存效率与硬件利用率
  • 与内核、编译器、架构和芯片团队合作,共同设计接口并消除全栈性能瓶颈
  • 在可靠的生产运行时中支持新模型特性、执行模式、数值格式和硬件能力
  • 创建性能分析、可观测性、基准测试和性能建模工具,使运行时行为可度量、可操作
  • 调试跨模型代码、运行时软件、通信层和硬件的复杂正确性、性能与可靠性问题
  • 将工作负载洞察转化为对下一代芯片和系统架构的明确需求

任职要求

  • 具备C++、Rust、Python或类似性能导向环境的强大系统编程经验
  • 构建或优化过运行时、分布式系统、编译器、内核、模型服务基础设施或相关系统软件
  • 理解现代LLM推理,包括预填充和解码行为、批处理、KV缓存权衡和模型并行
  • 能够定量分析延迟、吞吐量、计算强度、内存带宽、通信和利用率
  • 熟悉跨硬件-软件栈多层的性能分析和调试
  • 能设计清晰抽象,同时保留从专用硬件提取性能所需的低层控制
  • 能与模型、系统、编译器、内核和硬件团队有效协作,推动模糊技术问题落地
  • 重视生产质量,包括正确性、可观测性、可靠性、可维护性和大规模下的优雅行为
  • 可能需要满足美国出口管制法律法规规定的某些法律身份要求