性能工程师
岗位摘要
识别在运行大规模机器学习算法时出现的新颖系统问题;开发优化最大规模分布式系统吞吐量和鲁棒性的系统;实施大型语言模型的低延迟、高吞吐量采样;编写GPU内核以使模型适应低精度推理;编写自定义负载均衡算法以优化服务效率
岗位职责
- 识别在运行大规模机器学习算法时出现的新颖系统问题
- 开发优化最大规模分布式系统吞吐量和鲁棒性的系统
- 实施大型语言模型的低延迟、高吞吐量采样
- 编写GPU内核以使模型适应低精度推理
- 编写自定义负载均衡算法以优化服务效率
- 构建系统性能的定量模型
- 设计并实现在复杂网络拓扑中运行的容错分布式系统
- 在容器化环境中调试内核级网络延迟峰值
任职要求
- 拥有丰富的软件工程或机器学习经验,特别是在超级计算规模方面
- 以结果为导向,倾向于灵活性和影响力
- 愿意承担额外工作,即使超出职位描述范围
- 喜欢结对编程
- 希望了解更多关于机器学习研究的知识
- 关心工作的社会影响
- 拥有高性能、大规模机器学习系统的经验
- 了解机器学习框架内部原理
- 了解操作系统内部原理
- 具备使用Transformer进行语言建模的经验
- 至少拥有相关领域的学士学位或同等经验