高级网络工程师
岗位摘要
负责公司跨云、云到IDC、IDC到IDC的专线与互联网络规划、建设、运维与优化;管理复杂的网络拓扑、路由策略与访问边界,保障生产、大数据、训练/推理流量在多环境间稳定运行;设计并持续优化网络高可用方案,包括链路冗余、故障切换、路由收敛、容量规划与变更风险控制
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责公司跨云、云到IDC、IDC到IDC的专线与互联网络规划、建设、运维与优化
- 管理复杂的网络拓扑、路由策略与访问边界,保障生产、大数据、训练/推理流量在多环境间稳定运行
- 设计并持续优化网络高可用方案,包括链路冗余、故障切换、路由收敛、容量规划与变更风险控制
- 建立网络架构文档、拓扑管理、链路台账与标准化变更流程
- 针对不同类型流量设计并落地分级QoS策略,保障关键生产流量的低延迟与高稳定性
- 建立网络容量评估、带宽水位监控、拥塞分析与流量调度机制
- 在跨云、跨IDC、大规模数据传输场景下持续优化成本、性能与稳定性平衡
- 负责训练与推理集群网络建设与排障,包括RDMA、RoCE、CNI、Kubernetes Service/Pod网络
- 深入参与GPU集群网络性能优化,定位并解决丢包、拥塞、时延抖动、吞吐不足、RDMA通信异常等问题
- 与基础设施、平台、训练框架团队协作,优化大规模分布式训练与模型服务场景下的网络性能
- 建立集群网络可观测性体系,使RDMA/RoCE、K8s网络、东西向流量、南北向入口流量具备清晰监控与诊断路径
- 负责各集群及云上DNS、LB、NAT、DDoS防护、安全组、ACL、WAF/高防等基础网络组件的维护与优化
- 建立统一的网络变更规范、故障应急流程与巡检机制
- 推动网络配置自动化与基础设施即代码,减少人工操作风险
- 参与重大业务上线、架构调整、容量扩展与故障复盘,从网络视角提前识别风险并推动改进
任职要求
- 5年以上网络工程、基础设施网络或云网络相关经验,有复杂生产环境网络运维与架构设计经验
- 熟悉TCP/IP、路由协议、各种VPN、VPC、专线、NAT、DNS、LB、防火墙、安全组等网络技术与组件
- 有混合云、多云、IDC互联或大规模专线网络建设经验,能独立完成网络方案设计、容量规划、故障定位与性能优化
- 熟悉Kubernetes网络体系,理解CNI、Service、Ingress、Pod网络、NetworkPolicy等机制,有生产级K8s网络排障经验
- 熟悉RDMA/RoCE网络原理与实践,理解AI训练集群对低延迟、高吞吐、低丢包网络的要求
- 具备复杂QoS、流量分类、带宽保障、拥塞控制、链路调优等实践经验
- 熟悉主流云厂商网络产品与能力,包括VPC、专线、云企业网/转发路由器、负载均衡、DNS、DDoS防护等
- 具备良好的故障处理能力,能在高压场景下快速定位问题、组织协同并推动根因修复
- 具备文档化和标准化意识,能把复杂网络架构沉淀为清晰的拓扑、流程、Runbook与最佳实践
- 有AI训练集群、GPU集群、HPC网络或大规模模型服务基础设施经验(加分项)
- 有跨地域大规模数据传输、对象存储同步、数据湖/大数据平台网络优化经验(加分项)
- 熟悉Prometheus、Grafana、Loki/ELK、NetFlow/sFlow、eBPF等网络可观测性工具(加分项)
- 熟悉自动化运维工具与IaC实践,如Terraform、Ansible、Python/Go脚本、GitOps等(加分项)
- 有从混乱到秩序的网络体系建设经验,如主导过网络拓扑治理、专线改造、QoS体系建设、云网络重构或重大故障治理(加分项)
加分项
- 有 AI 训练集群、GPU 集群、HPC 网络或大规模模型服务基础设施经验
- 有跨地域大规模数据传输、对象存储同步、数据湖/大数据平台网络优化经验
- 熟悉 Prometheus、Grafana、Loki/ELK、NetFlow/sFlow、eBPF 等网络可观测性工具
- 熟悉自动化运维工具与 IaC 实践,如 Terraform、Ansible、Python/Go 脚本、GitOps 等
- 有从混乱到秩序的网络体系建设经验,例如主导过网络拓扑治理、专线改造、QoS 体系建设、云网络重构或重大故障治理
- 我们能提供什么直接的业务影响力:你的工作会直接影响模型训练效率、推理服务稳定性与核心业务连续性
- 足够复杂的技术场景:多云、多 IDC、专线互联、RDMA/RoCE、Kubernetes 网络、生产与大数据流量治理都会是真实问题
- 建设而非单纯维护:我们处于快速成长期,你需要建立网络标准、治理体系和自动化能力,而不是只执行既有流程
- 与优秀的工程团队协作:你将与基础设施、平台、模型训练、推理服务和应用工程团队紧密合作,共同构建 AI 公司的底层技术能力
- 为什么我们需要你
- 我们需要一位 Senior Network Engineer 来负责公司下一阶段 AI 基础设施的网络底座建设。我们的业务同时覆盖 AI 模型训练、开放平台与 Kimi,网络不再只是“连通性问题”,而是直接决定训练效率、推理稳定性、跨云协同能力与线上服务质量的核心基础设施
- 这是一个复杂度很高、影响面很大的角色。你将负责公司所有网络相关部分的管理、运维、优化与方案制定:从云到云、云到 IDC、IDC 到 IDC 的专线与互联架构,到训练推理集群中的 RDMA/RoCE 网络、Kubernetes Service/Pod 网络,再到 DNS、LB、DDoS 防护等基础组件。成功意味着你能把复杂网络从“能跑”推进到“可观测、可治理、可预测、可持续优化”
- 你将负责什么
- 混合云与多 IDC 网络架构建设
- 负责公司跨云、云到 IDC、IDC 到 IDC 的专线与互联网络规划、建设、运维与优化
- 管理复杂的网络拓扑、路由策略与访问边界,保障生产流量、大数据传输流量、训练/推理流量在多环境间稳定运行
- 设计并持续优化网络高可用方案,包括链路冗余、故障切换、路由收敛、容量规划与变更风险控制
- 建立网络架构文档、拓扑管理、链路台账与标准化变更流程,让复杂网络长期保持可理解、可维护
- 复杂 QoS 与流量治理
- 针对生产服务、大数据同步、模型训练、模型分发、推理请求等不同类型流量,设计并落地分级 QoS 策略
- 保障关键生产流量的低延迟与高稳定性,同时提升大带宽传输场景下的整体链路利用率
- 建立网络容量评估、带宽水位监控、拥塞分析与流量调度机制,提前识别瓶颈并推动优化
- 在跨云、跨 IDC、大规模数据传输场景下,持续优化成本、性能与稳定性之间的平衡
- AI 训练与推理集群网络
- 负责训练与推理集群相关网络能力的建设与排障,包括 RDMA、RoCE、CNI、Kubernetes Service/Pod 网络等
- 深入参与 GPU 集群网络性能优化,定位并解决丢包、拥塞、时延抖动、吞吐不足、RDMA 通信异常等问题
- 与基础设施、平台、训练框架团队协作,优化大规模分布式训练与模型服务场景下的网络性能
- 建立集群网络可观测性体系,让 RDMA/RoCE、K8s 网络、东西向流量、南北向入口流量具备清晰的监控与诊断路径
- 云上与基础网络组件维护
- 负责各集群及云上 DNS、LB、NAT、DDoS 防护、安全组、ACL、WAF/高防等基础网络组件的维护与优化
- 建立统一的网络变更规范、故障应急流程与巡检机制,降低网络变更对生产系统的影响
- 推动网络配置自动化与基础设施即代码,减少人工操作风险,提升网络交付与排障效率
- 参与重大业务上线、架构调整、容量扩展与故障复盘,从网络视角提前识别风险并推动改进落地
- 我们期待的你
- 我们能提供什么
- 直接的业务影响力:你的工作会直接影响模型训练效率、推理服务稳定性与核心业务连续性
- 允许6个月内投递3个职位,请选择适合的职位进行投递
福利待遇
- 直接的业务影响力:工作直接影响模型训练效率、推理服务稳定性与核心业务连续性
- 足够复杂的技术场景:多云、多IDC、专线互联、RDMA/RoCE、Kubernetes网络、生产与大数据流量治理等真实问题
- 建设而非单纯维护:处于快速成长期,需建立网络标准、治理体系和自动化能力
- 与优秀的工程团队协作:与基础设施、平台、模型训练、推理服务和应用工程团队紧密合作,共同构建AI公司底层技术能力
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。