大模型训练框架适配工程师
岗位摘要
负责主流大模型训练框架在壁仞芯片平台上的适配、功能验证、问题排查与性能调优;支撑预训练、微调等核心训练链路建设,落地MoE、多模态、智能驾驶等业务场景;定位并解决精度、显存、通信、算子等训练问题,搭建自动化工程体系
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责主流大模型训练框架在壁仞芯片平台上的适配、功能验证、问题排查与性能调优
- 支撑预训练、微调等核心训练链路建设,落地MoE、多模态、智能驾驶等业务场景
- 定位并解决精度、显存、通信、算子等训练问题,搭建自动化工程体系
- 搭建自动化体系,借助AI Agent赋能适配工作与训练生态
任职要求
- 熟悉PyTorch核心训练流程与分布式并行策略(DP/TP/PP/ZeRO/FSDP等)
- 掌握Megatron、DeepSpeed等一种或多种主流训练框架
- 熟练使用Linux、Python,具备较强的工程调试、问题定位和性能分析能力
- 加分项:有大模型预训练、全参微调、LoRA或大规模集群训练经验
- 加分项:熟悉CUDA/算子开发、通信库、编译器优化或AI芯片软件栈
- 加分项:有国产AI芯片适配、自动化平台建设、AI Agent工具使用经验者优先
- 加分项:有主流开源社区贡献经验者优先
加分项
- 有大模型预训练、全参微调、LoRA 或大规模集群训练经验
- 熟悉 CUDA / 算子开发、通信库、编译器优化或 AI 芯片软件栈
- 有国产 AI 芯片适配、自动化平台建设、AI Agent 工具使用经验者优先
- 有主流开源社区贡献经验者优先
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。