研究工程师
岗位摘要
设计和实施大规模基础设施系统,以支持AI科学家在分布式环境中的训练、评估和部署;识别并解决阻碍科学能力进展的基础设施瓶颈;开发稳健可靠的评估框架,用于衡量向科学AGI的进展;构建可扩展且高性能的VM/沙盒/容器架构,以安全执行长期AI任务和科学工作流
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实施大规模基础设施系统,以支持AI科学家在分布式环境中的训练、评估和部署
- 识别并解决阻碍科学能力进展的基础设施瓶颈
- 开发稳健可靠的评估框架,用于衡量向科学AGI的进展
- 构建可扩展且高性能的VM/沙盒/容器架构,以安全执行长期AI任务和科学工作流
- 协作将实验需求转化为生产就绪的基础设施
- 开发大规模数据管道,以处理高级语言模型的训练需求
- 优化大规模训练和推理管道,以实现稳定高效的强化学习
任职要求
- 拥有6年以上高度相关的基础设施工程经验,并在大规模分布式系统方面具备公认的专业知识
- 是一名强有力的沟通者,并喜欢协作工作
- 对高性能优化技术和高吞吐量ML工作负载的系统架构有深入了解
- 具有容器化技术(Docker、Kubernetes)和大规模编排的经验
- 拥有构建大规模数据管道和分布式存储系统的良好记录
- 擅长诊断和解决生产环境中的复杂基础设施挑战
- 能够有效地跨整个ML堆栈工作,从数据管道到性能优化
- 具有与其他研究人员合作以扩展实验想法的经验
- 在快节奏环境中茁壮成长,并能快速从实验迭代到生产
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。