研究工程师 - ML性能与扩展
岗位摘要
负责生产预训练流水线的关键方面,包括模型操作、性能优化、可观测性和可靠性;调试并解决全栈复杂问题,涵盖硬件错误、网络、训练动态和评估基础设施;设计并运行实验以提高训练效率、减少单步时间、增加正常运行时间并提升模型性能
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责生产预训练流水线的关键方面,包括模型操作、性能优化、可观测性和可靠性
- 调试并解决全栈复杂问题,涵盖硬件错误、网络、训练动态和评估基础设施
- 设计并运行实验以提高训练效率、减少单步时间、增加正常运行时间并提升模型性能
- 在模型发布期间响应待命事件,快速诊断问题并协调跨团队解决方案
- 构建和维护生产日志记录、监控仪表板和评估基础设施
- 为训练代码库添加新功能,例如长上下文支持或新颖架构
- 与旧金山和伦敦的团队成员以及Tokens、架构和系统团队紧密合作
- 通过记录系统、调试方法和经验教训,为团队的机构知识做出贡献
任职要求
- 拥有训练大型语言模型的实践经验,或对JAX、TPU、PyTorch或大规模分布式系统有深入了解
- 真正享受研究和工程工作,理想的工作分配比例大致为50/50,而非严重偏向一方
- 对生产系统待命、在发布期间长时间工作以及在压力下解决难题感到兴奋
- 在从事最具影响力的工作时表现出色,即使这根据生产模型的需求每天变化
- 擅长调试跨多个堆栈层的复杂、模糊问题
- 沟通清晰,协作有效,尤其是在跨时区协调或处理高压事件期间
- 对工作本身充满热情,并希望精进作为研究工程师的技能
- 关心AI的社会影响和负责任扩展
- 有训练LLM或广泛使用JAX/TPU、PyTorch或其他大规模ML框架的经验
- 发表过关于模型训练、扩展定律或ML系统的研究
- 拥有生产ML系统、可观测性工具或评估基础设施的经验
- 具有系统工程师、量化分析师或其他需要技术深度和卓越运营能力的角色背景
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。