返回岗位列表

Anthropic

GPU性能工程师

地点:远程 薪资:$315,000-$560,000 日期:2026-01-29

岗位摘要

设计和实施为Claude提供动力的基础系统;在空前规模上最大化GPU利用率和性能;开发尖端优化技术,直接赋能新模型能力并显著提升推理效率;在硬件与软件的交汇处工作,实施从自定义内核开发到分布式系统架构的最新技术

岗位职责

  • 设计和实施为Claude提供动力的基础系统
  • 在空前规模上最大化GPU利用率和性能
  • 开发尖端优化技术,直接赋能新模型能力并显著提升推理效率
  • 在硬件与软件的交汇处工作,实施从自定义内核开发到分布式系统架构的最新技术
  • 工作涵盖整个技术栈,从低层张量核心优化到协调数千个GPU的完美同步
  • 共同设计面向下一代硬件架构的注意力机制和算法
  • 为新兴量化格式和混合精度技术开发自定义内核
  • 为多节点GPU集群设计分布式通信策略
  • 优化前沿语言模型的端到端训练和推理流程
  • 构建性能建模框架以预测和优化GPU利用率
  • 实施内核融合策略以最小化内存带宽瓶颈
  • 为行星级分布式训练基础设施构建弹性系统
  • 分析并消除生产服务基础设施中的性能瓶颈
  • 与硬件供应商合作,影响未来加速器能力和软件栈

任职要求

  • 拥有大规模GPU编程和优化的深厚经验
  • 以影响力为导向,热衷于实现可衡量的性能突破
  • 能够驾驭从硬件接口到高级机器学习框架的复杂系统
  • 享受协作解决问题和结对编程
  • 希望在有现实影响力的最先进语言模型上工作
  • 关心工作的社会影响
  • 在需要自行定义前进道路的模糊环境中茁壮成长
  • 熟悉ML编译器和框架(如PyTorch/JAX内部原理、torch.compile、XLA、自定义算子)
  • 具备性能工程经验(如内核融合、内存带宽优化、使用Nsight进行分析)
  • 熟悉分布式系统(如NCCL、NVLink、集体通信、模型并行)
  • 了解低精度技术(如INT8/FP8量化、混合精度技术)
  • 有生产系统经验(如大规模训练基础设施、容错、集群编排)