GPU性能工程师
岗位摘要
设计和实施为Claude提供动力的基础系统;在空前规模上最大化GPU利用率和性能;开发尖端优化技术,直接赋能新模型能力并显著提升推理效率;在硬件与软件的交汇处工作,实施从自定义内核开发到分布式系统架构的最新技术
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实施为Claude提供动力的基础系统
- 在空前规模上最大化GPU利用率和性能
- 开发尖端优化技术,直接赋能新模型能力并显著提升推理效率
- 在硬件与软件的交汇处工作,实施从自定义内核开发到分布式系统架构的最新技术
- 工作涵盖整个技术栈,从低层张量核心优化到协调数千个GPU的完美同步
- 共同设计面向下一代硬件架构的注意力机制和算法
- 为新兴量化格式和混合精度技术开发自定义内核
- 为多节点GPU集群设计分布式通信策略
- 优化前沿语言模型的端到端训练和推理流程
- 构建性能建模框架以预测和优化GPU利用率
- 实施内核融合策略以最小化内存带宽瓶颈
- 为行星级分布式训练基础设施构建弹性系统
- 分析并消除生产服务基础设施中的性能瓶颈
- 与硬件供应商合作,影响未来加速器能力和软件栈
任职要求
- 拥有大规模GPU编程和优化的深厚经验
- 以影响力为导向,热衷于实现可衡量的性能突破
- 能够驾驭从硬件接口到高级机器学习框架的复杂系统
- 享受协作解决问题和结对编程
- 希望在有现实影响力的最先进语言模型上工作
- 关心工作的社会影响
- 在需要自行定义前进道路的模糊环境中茁壮成长
- 熟悉ML编译器和框架(如PyTorch/JAX内部原理、torch.compile、XLA、自定义算子)
- 具备性能工程经验(如内核融合、内存带宽优化、使用Nsight进行分析)
- 熟悉分布式系统(如NCCL、NVLink、集体通信、模型并行)
- 了解低精度技术(如INT8/FP8量化、混合精度技术)
- 有生产系统经验(如大规模训练基础设施、容错、集群编排)
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。