平台工程师,模型塑造
岗位摘要
设计和构建Together AI的模型定制系统与基础设施,包括面向用户的功能和内部改进;参与平台可靠性改进,加入值班轮换并优化事件响应流程;创建并改进部署、持续集成和可观测性的内部工具
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计和构建Together AI的模型定制系统与基础设施,包括面向用户的功能和内部改进
- 参与平台可靠性改进,加入值班轮换并优化事件响应流程
- 创建并改进部署、持续集成和可观测性的内部工具
- 构建跨多个数据中心的作业编排平台,支持高度异构的硬件环境
- 与内部服务开发团队合作,共同设计服务并将其集成到Together AI的系统中
任职要求
- 3年以上构建基础设施或生产服务后端组件的经验
- 丰富的生产Linux环境和基于Kubernetes平台的设计、运维和故障排除经验
- 扎实的Python或Go软件工程背景
- 熟悉基础设施自动化工具(Terraform、Ansible)、监控/可观测性栈(Prometheus、Grafana)和CI/CD流水线(GitHub Actions、ArgoCD)
- 具备云环境(如AWS/GCP/Azure)管理经验,优先考虑混合裸金属/云环境经验
- 良好的沟通能力,愿意记录系统和流程,并与不同技术专长的同事协作
- 能够自如地处理从集群运维和基础设施自动化到后端服务开发的整个技术栈
- 以下经验将让你脱颖而出:开发高可靠性要求的大规模生产系统;流水线编排框架(如Kubeflow、Argo Workflows、Flyte);管理HPC集群上的GPU工作负载,最好有操作NVIDIA网络栈(如NCCL、Mellanox固件、GPUDirect RDMA)的实践经验;部署AI训练或推理服务;网络基础知识,包括TCP/IP、DNS、路由、负载均衡、TLS和网络调试工具;维护或贡献开源项目
福利待遇
- 参与前沿AI研究与开源项目
- 与顶尖工程师和研究人员合作
- 推动开放透明AI系统的发展
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。