返回岗位列表

Cohere

高级工程师 - 大规模语言模型训练框架

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

构建并负责用于大规模LLM训练的训练框架;设计分布式训练抽象(数据/张量/流水线并行,FSDP/ZeRO策略,内存管理,检查点);在多节点集群(例如GB200/300,AMD,H200/100)上提高训练吞吐量和稳定性

岗位职责

  • 构建并负责用于大规模LLM训练的训练框架
  • 设计分布式训练抽象(数据/张量/流水线并行,FSDP/ZeRO策略,内存管理,检查点)
  • 在多节点集群(例如GB200/300,AMD,H200/100)上提高训练吞吐量和稳定性
  • 开发和维护用于监控、日志记录、调试和开发者工效学的工具
  • 与基础设施团队紧密合作,确保Slurm设置、容器环境和硬件配置支持高性能训练
  • 调查并解决整个ML系统堆栈中的性能瓶颈
  • 构建健壮的系统,确保大规模运行的可重复性和可调试性

任职要求

  • 在大规模分布式训练或HPC系统方面拥有丰富的工程经验
  • 深入了解JAX内部原理、分布式训练库或自定义内核/融合操作
  • 具有多节点集群编排经验(Slurm、Ray、Kubernetes或类似工具)
  • 能够熟练调试CUDA/NCCL、网络、IO和数据管道中的性能问题
  • 拥有为ML团队构建提高开发效率工具的良好记录
  • 在权衡取舍方面具备出色的判断力:性能与复杂性、研究速度与可维护性
  • 具备强大的协作能力——将与基础设施、研究和部署团队紧密合作