算力集群交付与管理工程师
岗位摘要
设计并开发算力集群标准化交付流程引擎,支持机柜规划、网络配置、集群部署等关键阶段;实现集群交付里程碑管理,包括硬件验收、集群调优、性能测试等关键节点;开发集群交付进度可视化看板,实时展示硬件上架、网络连通性、集群就绪状态
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计并开发算力集群标准化交付流程引擎,支持机柜规划、网络配置、集群部署等关键阶段
- 实现集群交付里程碑管理,包括硬件验收、集群调优、性能测试等关键节点
- 开发集群交付进度可视化看板,实时展示硬件上架、网络连通性、集群就绪状态
- 构建交付质量验证体系,自动执行基准测试和健康检查
- 开发算力设备资产管理系统,跟踪GPU服务器、高速网络设备等关键设备状态
- 实现设备拓扑管理,可视化展示机柜布局、网络连接关系
- 建立设备维护历史档案,记录硬件故障、部件更换、固件升级等操作
- 开发设备健康度监控,预测硬件故障风险并生成维护计划
- 构建集群配置库,统一管理硬件配置、网络规划、系统参数等关键信息
- 实现配置版本控制,支持集群环境的快速重建和复制
- 开发部署物料管理,包括系统镜像、驱动版本、部署脚本等
- 建立配置合规检查,确保交付环境符合客户要求
- 设计试运行期专业工单流程,支持性能问题、硬件故障、配置调整等工单类型
- 开发工单与监控系统联动,自动生成性能优化工单和故障处理工单
- 实现工单SLA管理,定义不同优先级问题的响应和处理时限
- 构建知识积累机制,将解决方案沉淀为标准化处理流程
- 开发客户专属门户,提供集群状态监控、资源使用分析、工单管理等功能
- 实现多租户隔离,确保不同客户数据的安全性和隐私性
- 开发报表系统,自动生成集群性能报告和资源使用账单
- 构建通知中心,及时向客户推送集群状态变更和重要事件
任职要求
- 计算机或相关专业本科以上学历
- 3年以上大型系统平台开发经验
- 精通Go/Java/Python等至少一门后端开发语言
- 熟悉分布式系统原理,有大规模集群管理相关开发经验
- 具备设备管理系统或IT资产管理平台开发经验
- 熟悉工作流引擎,有复杂业务流程平台开发经验
- 精通MySQL/PostgreSQL等数据库设计和优化
- 具备良好的系统架构设计和性能优化能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。