机器学习基础设施软件工程师
岗位摘要
构建和维护用于大规模服务LLM工作负载的容错、高性能系统;构建内部平台以赋能LLM能力发现;与研究人员和工程师合作,为生产和研究用例集成和优化模型;进行架构和设计评审,以维护系统设计和可扩展性的最佳实践
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 构建和维护用于大规模服务LLM工作负载的容错、高性能系统
- 构建内部平台以赋能LLM能力发现
- 与研究人员和工程师合作,为生产和研究用例集成和优化模型
- 进行架构和设计评审,以维护系统设计和可扩展性的最佳实践
- 开发监控和可观测性解决方案,以确保系统健康与性能
- 在跨职能环境中,端到端领导项目,从需求收集到实施
任职要求
- 拥有4年以上构建大规模、高性能后端系统的经验
- 精通一种或多种编程语言(例如Python、Go、Rust、C++)
- 具备LLM服务和路由基础知识经验(例如速率限制、令牌流式传输、负载均衡、预算等)
- 具备LLM能力和概念经验,如推理、工具调用、提示模板等
- 具备容器和编排工具经验(例如Docker、Kubernetes)
- 熟悉云基础设施(AWS、GCP)和基础设施即代码(例如Terraform)
- 具备解决复杂问题并在快速变化的环境中独立工作的能力
福利待遇
- 全面的健康、牙科和视力保险
- 学习和发展津贴
- 丰厚的带薪休假(PTO)
- 可能有资格获得通勤津贴等额外福利
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。