返回岗位列表

Scale AI

机器学习基础设施软件工程师

地点:美国 薪资:薪资未公开 日期:2026-01-29

岗位摘要

构建和维护用于大规模服务LLM工作负载的容错、高性能系统;构建内部平台以赋能LLM能力发现;与研究人员和工程师合作,为生产和研究用例集成和优化模型;进行架构和设计评审,以维护系统设计和可扩展性的最佳实践

岗位职责

  • 构建和维护用于大规模服务LLM工作负载的容错、高性能系统
  • 构建内部平台以赋能LLM能力发现
  • 与研究人员和工程师合作,为生产和研究用例集成和优化模型
  • 进行架构和设计评审,以维护系统设计和可扩展性的最佳实践
  • 开发监控和可观测性解决方案,以确保系统健康与性能
  • 在跨职能环境中,端到端领导项目,从需求收集到实施

任职要求

  • 拥有4年以上构建大规模、高性能后端系统的经验
  • 精通一种或多种编程语言(例如Python、Go、Rust、C++)
  • 具备LLM服务和路由基础知识经验(例如速率限制、令牌流式传输、负载均衡、预算等)
  • 具备LLM能力和概念经验,如推理、工具调用、提示模板等
  • 具备容器和编排工具经验(例如Docker、Kubernetes)
  • 熟悉云基础设施(AWS、GCP)和基础设施即代码(例如Terraform)
  • 具备解决复杂问题并在快速变化的环境中独立工作的能力

福利待遇

  • 全面的健康、牙科和视力保险
  • 学习和发展津贴
  • 丰厚的带薪休假(PTO)
  • 可能有资格获得通勤津贴等额外福利