返回岗位列表

摩尔线程

深度技术顾问与方案架构

地点:北京 薪资:薪资未公开 日期:2026-01-29

岗位摘要

负责KA客户(大模型厂商、互联网巨头、科研机构)的GPU集群系统架构设计;针对客户的LLM(大语言模型)训练与推理场景,提供从硬件选型、网络拓扑(IB/RoCE)到软件栈的全栈解决方案

岗位职责

  • 负责KA客户(大模型厂商、互联网巨头、科研机构)的GPU集群系统架构设计
  • 针对客户的LLM(大语言模型)训练与推理场景,提供从硬件选型、网络拓扑(IB/RoCE)到软件栈的全栈解决方案
  • 深入理解客户模型(如Llama 3, Mixtral, Qwen等),针对性地设计分布式并行策略(Data/Tensor/Pipeline Parallelism, Sequence Parallelism, MoE等),最大化集群MFU(Model FLOPS Utilization)
  • 解决客户在使用过程中的深层技术瓶颈,包括但不限于驱动兼容性、编译器(Compiler)优化、算子(Operator)开发与融合
  • 利用Profiling工具(如Nsight Systems, PyTorch Profiler)定位性能热点,指导或协助客户进行Custom Kernel优化(CUDA/Triton/Hip)
  • 处理大规模集群下的稳定性问题(Stragglers, ECC errors, NCCL timeout等),保障长周期训练的稳定性
  • 不仅仅是技术支持,需具备商业思维。协助客户进行TCO(Total Cost of Ownership)核算,通过算力利用率提升、训练时间缩短、推理延迟降低等指标,量化方案带来的ROI(投资回报率)
  • 对比竞品方案,从CAPEX(资本性支出)和OPEX(运营支出)维度输出专业的竞争分析报告
  • 将一线客户在驱动、API、编译器、框架适配等方面的痛点转化为高质量的PRD或技术需求,反向推动研发团队改进底层软件栈(SDK/Driver/Firmware)

任职要求

  • 教育背景:计算机科学、电子工程、数学或相关专业本科及以上学历
  • 工作经验:5年以上HPC、AI基础设施或GPU相关领域工作经验,其中至少2年深度参与大模型(LLM)项目
  • QQGPUQ( 记忆等级, 流式多处理器, NVLink/ PCIe 等互联)
  • 熟悉底层软件栈:Driver, CUDA Toolkit, NCCL, HCCL等
  • 具备算子开发或优化经验(CUDA, Triton, TVM, MLIR等)
  • 理解AI编译器原理(XLA, TorchDynamo, TensorRT, vLLM等)者
  • 精通PyTorch及主流分布式训练库(Megatron-LM, DeepSpeed, FSDP)
  • 熟悉大规模集群通信原语(All-reduce, All-gather, Reduce-scatter)及其在不同网络环境下的调优
  • 具备TAM(技术账户经理)的服务意识,能够管理高压下的客户预期,具备极强的技术交流能力