返回岗位列表

壁仞科技

大模型训练框架适配工程师

地点:上海 薪资:薪资未公开 日期:2026-07-20

岗位摘要

负责主流大模型训练框架在壁仞芯片平台上的适配、功能验证、问题排查与性能调优;支撑预训练、微调等核心训练链路建设,落地MoE、多模态、智能驾驶等业务场景;定位并解决精度、显存、通信、算子等训练问题,搭建自动化工程体系

岗位职责

  • 负责主流大模型训练框架在壁仞芯片平台上的适配、功能验证、问题排查与性能调优
  • 支撑预训练、微调等核心训练链路建设,落地MoE、多模态、智能驾驶等业务场景
  • 定位并解决精度、显存、通信、算子等训练问题,搭建自动化工程体系
  • 搭建自动化体系,借助AI Agent赋能适配工作与训练生态

任职要求

  • 熟悉PyTorch核心训练流程与分布式并行策略(DP/TP/PP/ZeRO/FSDP等)
  • 掌握Megatron、DeepSpeed等一种或多种主流训练框架
  • 熟练使用Linux、Python,具备较强的工程调试、问题定位和性能分析能力
  • 加分项:有大模型预训练、全参微调、LoRA或大规模集群训练经验
  • 加分项:熟悉CUDA/算子开发、通信库、编译器优化或AI芯片软件栈
  • 加分项:有国产AI芯片适配、自动化平台建设、AI Agent工具使用经验者优先
  • 加分项:有主流开源社区贡献经验者优先

加分项

  • 有大模型预训练、全参微调、LoRA 或大规模集群训练经验
  • 熟悉 CUDA / 算子开发、通信库、编译器优化或 AI 芯片软件栈
  • 有国产 AI 芯片适配、自动化平台建设、AI Agent 工具使用经验者优先
  • 有主流开源社区贡献经验者优先