平台工程师(模型定制方向)
岗位摘要
设计并构建 Together 的模型定制系统与基础设施,涵盖面向用户的功能与内部优化;参与平台可靠性改进,加入值班轮换机制,并持续完善事故响应流程;创建并改进用于部署、持续集成与可观测性的内部工具
岗位职责
- 设计并构建 Together 的模型定制系统与基础设施,涵盖面向用户的功能与内部优化
- 参与平台可靠性改进,加入值班轮换机制,并持续完善事故响应流程
- 创建并改进用于部署、持续集成与可观测性的内部工具
- 构建跨多个数据中心、支持高度异构硬件环境的作业编排平台
- 与开发内部服务的团队合作,共同设计这些服务并将其集成到 Together 构建的系统中
任职要求
- 3 年以上基础设施或生产服务后端组件的构建经验
- 具备设计、运维与排障生产级 Linux 环境和基于 Kubernetes 平台的丰富经验
- 扎实的软件工程背景,精通 Python 或 Go
- 熟悉基础设施自动化工具(Terraform、Ansible)、监控与可观测性技术栈(Prometheus、Grafana)以及 CI/CD 流水线(GitHub Actions、ArgoCD)
- 具备云环境(如 AWS、GCP、Azure)管理经验,有裸金属与云混合环境经验者优先
- 出色的沟通能力,愿意记录系统与流程,并能与技术背景各异的同事协作
- 能够胜任从集群运维、基础设施自动化到后端服务开发的全栈工作
- 加分项:具备大规模、高可靠性生产系统的开发经验
- 加分项:熟悉流水线编排框架(如 Kubeflow、Argo Workflows、Flyte)
- 加分项:有在 HPC 集群上管理 GPU 工作负载的经验,最好具备 NVIDIA 网络栈(如 NCCL、Mellanox 固件、GPUDirect RDMA)的实操经验
- 加分项:有 AI 训练或推理服务的部署经验
- 加分项:掌握网络基础知识,包括 TCP/IP、DNS、路由、负载均衡、TLS 及网络调试工具
- 加分项:维护或参与过开源项目