AI基础设施平台运营专家
岗位摘要
负责自研模型路由/网关平台的日常运营,包括模型接入、供应商/内部模型资源协同、调用额度、限流策略、异常处理、服务质量跟踪和用户反馈闭环;面向数据、训练、推理、算力等内部平台,建立资源申请、配额管理、容量评估、SLA/SLO、告警响应、问题复盘等运营机制,提升平台稳定性和使用体验
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责自研模型路由/网关平台的日常运营,包括模型接入、供应商/内部模型资源协同、调用额度、限流策略、异常处理、服务质量跟踪和用户反馈闭环
- 面向数据、训练、推理、算力等内部平台,建立资源申请、配额管理、容量评估、SLA/SLO、告警响应、问题复盘等运营机制,提升平台稳定性和使用体验
- 负责模型调用、算力资源、训练任务、推理服务等场景的用量统计、计量口径、成本归因和异常分析,推动资源成本透明化和使用效率优化
- 对接算法、研发、产品及业务团队,理解不同团队在模型调用、数据生产、训练推理、算力使用等方面的需求,推动平台能力改进和跨团队问题闭环
- 沉淀平台运营规范、资源治理流程、数据看板、自动化巡检和问题追踪机制,提升基础设施平台的运营效率和可持续管理能力
任职要求
- 本科及以上学历,计算机、软件工程、数据科学、信息管理、数学、统计等相关专业优先
- 有AI平台、云计算平台、模型服务平台、数据平台、MLOps平台、GPU/算力资源运营或技术产品运营经验者优先
- 理解大模型API、模型路由、模型网关、训练/推理资源、GPU/云资源、限流、配额、SLA、计量计费等基础概念
- 具备较强的数据分析能力,能够通过用量、成本、性能、稳定性、用户反馈等数据发现问题,并推动改进
- 具备强Owner意识、跨团队协作能力和复杂问题推进能力,能在研发、算法、业务、采购、财务及外部厂商之间推动问题闭环
- 熟悉SQL、BI、脚本、自动化工具或AI Native效率工具者优先;有平台型产品运营、FinOps、DevOps、MLOps或SRE协作经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。