返回岗位列表

面壁智能

智能基础设施工程师

地点:北京 薪资:薪资未公开 日期:2026-07-20

岗位摘要

参与模型训练,构造在高性能/基础设施侧专用的模型;构建统一的训练Harness范式,标准化训练、基准测试与评测流程;探索Agentic Infra,将训练系统从人工驱动升级为Agent驱动

岗位职责

  • 参与模型训练,构造在高性能/基础设施侧专用的模型
  • 构建统一的训练Harness范式,标准化训练、基准测试与评测流程
  • 探索Agentic Infra,将训练系统从人工驱动升级为Agent驱动
  • 推动训练系统从工具集合向具备自我优化能力的系统演进

任职要求

  • 具有较强工程能力,能独立完成复杂系统模块的设计与实现
  • 熟练使用Python,具备扎实的代码能力(C++/CUDA为加分项)
  • 熟悉PyTorch,有实际训练/调试经验
  • 理解分布式系统或分布式训练的基本概念
  • 对系统问题有良好的拆解能力,能从复杂现象中定位本质问题
  • 对AI Native/Agent系统有兴趣,认可“用模型解决工程问题”的方向
  • 对数据敏感:能判断指标是否可信、实验是否有效,而不是盲目跑实验

加分项

  • 熟悉 PyTorch,有实际训练 / 调试经验
  • 理解分布式系统或分布式训练的基本概念
  • 对系统问题有良好的拆解能力,能从复杂现象中定位本质问题
  • 对 AI Native / Agent 系统有兴趣,认可“用模型解决工程问题”的方向
  • 对数据敏感:能判断指标是否可信、实验是否有效,而不是盲目跑实验
  • (重要但不硬性)
  • 有算子开发经验(CUDA / Triton / Kernel 优化)
  • 有大模型训练经验(Megatron / DeepSpeed / FSDP 等)
  • 有性能分析经验(Nsight Systems / Nsight Compute / profiler 等)
  • 熟悉训练优化手段(FlashAttention / ZeRO / 混合精度 / checkpointing 等)
  • 对 Agent 有深入理解或实践(tool use / planning / multi-agent 等)
  • 阅读或改过大型训练框架源码
  • 做过 benchmark / profiling / 自动化实验平台相关工作

福利待遇

  • 参与前沿AI基础设施研发,推动技术边界
  • 与顶尖团队合作,快速成长
  • 灵活的工作环境与创新文化