返回岗位列表

Anthropic

研究工程师 - ML性能与扩展

地点:美国 薪资:$350,000-$850,000 日期:2026-01-29

岗位摘要

负责生产预训练流水线的关键方面,包括模型操作、性能优化、可观测性和可靠性;调试并解决全栈复杂问题,涵盖硬件错误、网络、训练动态和评估基础设施;设计并运行实验以提高训练效率、减少单步时间、增加正常运行时间并提升模型性能

岗位职责

  • 负责生产预训练流水线的关键方面,包括模型操作、性能优化、可观测性和可靠性
  • 调试并解决全栈复杂问题,涵盖硬件错误、网络、训练动态和评估基础设施
  • 设计并运行实验以提高训练效率、减少单步时间、增加正常运行时间并提升模型性能
  • 在模型发布期间响应待命事件,快速诊断问题并协调跨团队解决方案
  • 构建和维护生产日志记录、监控仪表板和评估基础设施
  • 为训练代码库添加新功能,例如长上下文支持或新颖架构
  • 与旧金山和伦敦的团队成员以及Tokens、架构和系统团队紧密合作
  • 通过记录系统、调试方法和经验教训,为团队的机构知识做出贡献

任职要求

  • 拥有训练大型语言模型的实践经验,或对JAX、TPU、PyTorch或大规模分布式系统有深入了解
  • 真正享受研究和工程工作,理想的工作分配比例大致为50/50,而非严重偏向一方
  • 对生产系统待命、在发布期间长时间工作以及在压力下解决难题感到兴奋
  • 在从事最具影响力的工作时表现出色,即使这根据生产模型的需求每天变化
  • 擅长调试跨多个堆栈层的复杂、模糊问题
  • 沟通清晰,协作有效,尤其是在跨时区协调或处理高压事件期间
  • 对工作本身充满热情,并希望精进作为研究工程师的技能
  • 关心AI的社会影响和负责任扩展
  • 有训练LLM或广泛使用JAX/TPU、PyTorch或其他大规模ML框架的经验
  • 发表过关于模型训练、扩展定律或ML系统的研究
  • 拥有生产ML系统、可观测性工具或评估基础设施的经验
  • 具有系统工程师、量化分析师或其他需要技术深度和卓越运营能力的角色背景