推理团队工程师
岗位摘要
与机器学习研究员、工程师和产品经理合作,将最新技术投入生产;与研究员合作,通过卓越的工程能力支持前沿研究;引入新技术、工具和架构,以提升模型推理堆栈的性能、延迟、吞吐量和效率;构建工具以识别性能瓶颈和不稳定因素,并设计实施解决方案以解决最高优先级问题
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 与机器学习研究员、工程师和产品经理合作,将最新技术投入生产
- 与研究员合作,通过卓越的工程能力支持前沿研究
- 引入新技术、工具和架构,以提升模型推理堆栈的性能、延迟、吞吐量和效率
- 构建工具以识别性能瓶颈和不稳定因素,并设计实施解决方案以解决最高优先级问题
- 优化代码和Azure虚拟机集群,以充分利用硬件的每单位浮点运算能力和GPU内存
任职要求
- 理解现代机器学习架构,并具备优化其性能(特别是推理性能)的直觉
- 能够端到端地负责问题,并愿意学习任何缺失的知识以完成任务
- 至少拥有5年专业软件工程经验
- 熟悉或能快速掌握PyTorch、NVIDIA GPU及其优化软件栈(如NCCL、CUDA),以及高性能计算技术(如InfiniBand、MPI、NVLink等)
- 具备架构设计、构建、监控和调试生产级分布式系统的经验。有性能关键型分布式系统经验者优先
- 曾因规模快速增长而多次重建或大规模重构生产系统
- 具备自我驱动力,乐于找出最重要的问题进行攻关
- 态度谦逊,乐于帮助同事,并愿意为团队成功付出一切努力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。