智能基础设施工程师
岗位摘要
参与模型训练,构造在高性能/基础设施侧专用的模型;构建统一的训练Harness范式,标准化训练、基准测试与评测流程;探索Agentic Infra,将训练系统从人工驱动升级为Agent驱动
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与模型训练,构造在高性能/基础设施侧专用的模型
- 构建统一的训练Harness范式,标准化训练、基准测试与评测流程
- 探索Agentic Infra,将训练系统从人工驱动升级为Agent驱动
- 推动训练系统从工具集合向具备自我优化能力的系统演进
任职要求
- 具有较强工程能力,能独立完成复杂系统模块的设计与实现
- 熟练使用Python,具备扎实的代码能力(C++/CUDA为加分项)
- 熟悉PyTorch,有实际训练/调试经验
- 理解分布式系统或分布式训练的基本概念
- 对系统问题有良好的拆解能力,能从复杂现象中定位本质问题
- 对AI Native/Agent系统有兴趣,认可“用模型解决工程问题”的方向
- 对数据敏感:能判断指标是否可信、实验是否有效,而不是盲目跑实验
加分项
- 熟悉 PyTorch,有实际训练 / 调试经验
- 理解分布式系统或分布式训练的基本概念
- 对系统问题有良好的拆解能力,能从复杂现象中定位本质问题
- 对 AI Native / Agent 系统有兴趣,认可“用模型解决工程问题”的方向
- 对数据敏感:能判断指标是否可信、实验是否有效,而不是盲目跑实验
- (重要但不硬性)
- 有算子开发经验(CUDA / Triton / Kernel 优化)
- 有大模型训练经验(Megatron / DeepSpeed / FSDP 等)
- 有性能分析经验(Nsight Systems / Nsight Compute / profiler 等)
- 熟悉训练优化手段(FlashAttention / ZeRO / 混合精度 / checkpointing 等)
- 对 Agent 有深入理解或实践(tool use / planning / multi-agent 等)
- 阅读或改过大型训练框架源码
- 做过 benchmark / profiling / 自动化实验平台相关工作
福利待遇
- 参与前沿AI基础设施研发,推动技术边界
- 与顶尖团队合作,快速成长
- 灵活的工作环境与创新文化
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。