AI基础设施工程师
岗位摘要
设计和实施用于模型服务的可扩展分布式基础设施,例如负载均衡、自动扩缩容、批处理调度和全局KV缓存系统;通过主动监控、容错设计和严格测试,确保推理服务的可靠性,目标为100%正常运行时间、0%错误率和良好的尾部性能
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和实施用于模型服务的可扩展分布式基础设施,例如负载均衡、自动扩缩容、批处理调度和全局KV缓存系统
- 通过主动监控、容错设计和严格测试,确保推理服务的可靠性,目标为100%正常运行时间、0%错误率和良好的尾部性能
- 创建自定义工具,以跟踪、重放和修复从集群编排到GPU内核的整个堆栈中的问题或崩溃
- 对推理引擎进行基准测试和微调,以在各种生产工作负载下提供最佳性能
- 开发稳健的CI/CD基础设施,以实现无缝端点部署、镜像发布、功能推出和推理引擎更新
任职要求
- 拥有大规模、高并发生产服务的经验
- 拥有推理服务的测试、基准测试和可靠性方面的经验
- 拥有设计和实施CI/CD基础设施的经验
- 熟悉技术栈:Kubernetes、Buildkite/ArgoCD、Prometheus/Grafana/PagerDuty、Pulumi/Terraform、SGLang、自定义调试和跟踪工具
- 具备强大的沟通能力,能够简洁准确地与团队成员分享知识
- 工作积极主动,注重工程卓越,具备强大的工作伦理和优先级排序能力
- 该职位位于湾区(旧金山和帕洛阿尔托),候选人需位于湾区附近或愿意搬迁
福利待遇
- 全面的医疗、视力和牙科保险
- 401(k)退休计划
- 短期和长期残疾保险
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。