技术团队成员,推理方向
岗位摘要
端到端实现模型检查点的生产化:从研究完成到内部测试,再到生产部署和发布后支持;为在多GPU环境中运行的大规模生成模型构建和优化推理系统;为扩散模型和实时扩散工作流设计和实现专门的模型服务基础设施
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 端到端实现模型检查点的生产化:从研究完成到内部测试,再到生产部署和发布后支持
- 为在多GPU环境中运行的大规模生成模型构建和优化推理系统
- 为扩散模型和实时扩散工作流设计和实现专门的模型服务基础设施
- 为新的模型发布添加监控和可观测性——跟踪错误、吞吐量、GPU利用率和延迟
- 嵌入研究团队,收集训练数据,运行预处理脚本,并支持模型开发过程
- 探索并集成GPU推理服务提供商(如Modal、E2E、Baseten等)
任职要求
- 4年以上在生产环境中大规模运行机器学习模型推理的经验
- 在使用PyTorch进行大型模型的多GPU推理方面有丰富经验
- 有使用Kubernetes处理机器学习工作负载的经验——部署、扩展和调试基于GPU的服务
- 能够熟练地在多个云服务提供商之间工作,并管理GPU驱动兼容性
- 有机器学习系统监控和可观测性经验(错误、吞吐量、GPU利用率)
- 积极主动,能够嵌入研究团队并快速推进工作
- 具备系统思维和对生产可靠性的务实态度
- 谦逊且思想开放;乐于相互学习
- 有构建自定义推理框架或服务系统的经验
- 深刻理解分布式训练和推理模式(如FSDP、数据并行、张量并行)
- 具备调试底层问题的能力:NCCL网络问题、CUDA错误、内存泄漏、性能瓶颈
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。