软件工程师,AI基础设施
岗位摘要
设计、开发和维护可扩展的GPU基础设施,用于训练和服务最先进的AI模型;架构和优化高吞吐量、低延迟的API,用于AI模型服务和推理;领导跨集群异构GPU资源的编排、调度和高效利用;构建和维护稳健的系统,用于生产环境中的模型部署、监控、扩展和可靠性
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计、开发和维护可扩展的GPU基础设施,用于训练和服务最先进的AI模型
- 架构和优化高吞吐量、低延迟的API,用于AI模型服务和推理
- 领导跨集群异构GPU资源的编排、调度和高效利用
- 构建和维护稳健的系统,用于生产环境中的模型部署、监控、扩展和可靠性
- 与机器学习、后端和平台工程团队协作,交付无缝的AI驱动产品功能
- 推动技术方向、代码审查,并在AI基础设施团队中提供指导
任职要求
- 5年以上系统基础设施软件工程师经验,包括机器学习服务和GPU编排的实践工作
- 深入了解分布式系统、Kubernetes(或类似编排框架)和云原生基础设施(AWS/GCP/Azure)
- 在构建和优化大规模AI模型服务API(如TensorFlow Serving、Triton、TorchServe)方面有成熟经验
- 熟悉高吞吐量、可扩展GPU集群管理、调度和高效模型执行的挑战
- 精通后端语言如Python、Go或C++,并有性能和可靠性优化经验
- 具备主人翁意识,能在模糊、高增长环境中独立解决复杂问题
- 出色的沟通、协作和指导能力
- 有多模态AI模型基础设施经验者优先(如大语言模型、生成模型、视频/图像/语音模型)
- 有构建多租户SaaS、企业AI/ML平台或大规模运营自动化基础设施背景者优先
- 有初创公司经验或在高不确定性环境中领导高影响力项目的经验者优先
- 有竞争性编程或大规模分布式计算环境经验者优先
福利待遇
- AI行业具有竞争力的薪资
- 快速成长团队的股权,塑造AI的未来
- 全面的健康福利、月度津贴和公司团建活动
- 支持性和协作的办公室文化——每个人共同构建、交付和学习
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。