大模型训练推理工程师
岗位摘要
参与公司核心大模型训练与推理系统的设计、开发与优化,支撑多模态/万亿参数模型的高效稳定运行;聚焦分布式训练框架开发、高性能推理系统构建、自研算子开发与性能优化等方向,承担从设计到实现的完整研发任务
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 参与公司核心大模型训练与推理系统的设计、开发与优化,支撑多模态/万亿参数模型的高效稳定运行
- 聚焦分布式训练框架开发、高性能推理系统构建、自研算子开发与性能优化等方向,承担从设计到实现的完整研发任务
- 负责模型执行引擎与任务调度系统的性能提升与稳定性保障
- 开展多机多卡通信优化及模型格式转换与部署工具链开发
- 分析真实系统中的性能瓶颈,参与profiling工具、自动调优策略的设计与落地
- 与基础设施、调度、系统、算法等团队密切配合,推动跨栈优化与工程落地
任职要求
- 2026届毕业生,计算机、人工智能、软件工程、电子工程、数学等相关专业本科及以上学历
- 编程能力扎实,熟悉Python和至少一门系统级语言(如C++/Go),理解良好的工程设计方法
- 对PyTorch/TensorFlow/JAX等深度学习框架底层有深入兴趣并具备项目/课程/实习经验
- 或具备分布式训练/推理系统(如Megatron/DeepSpeed/vLLM/FasterTransformer)相关经验
- 或具备算子开发、CUDA编程、内存优化、图执行优化等经验
- 或熟悉推理引擎与部署流程(如ONNX/TensorRT/TVM/XLA等)
- 具备较强问题分析与解决能力,自驱力强,愿意深入底层、啃硬骨头
- 拥有NOI/ICPC/CCPC/ISC等竞赛奖项者、或具备复杂系统项目经验者优先
- 有良好的沟通协作能力,愿意承担工程交付责任,具备成长为系统owner的潜力
加分项
- 主导过训练/推理方向系统项目,有大模型平台开发实习经验
- 熟悉分布式系统、调度、内存/通信优化等方向
- 在 GitHub 等平台有相关系统项目或开源贡献
- 有大规模集群(如 K8s、Slurm、Ray、MPI 等)环境开发经验
福利待遇
- 薪资35-65K·16薪,具有市场竞争力的薪酬体系
- 工作地点位于北京海淀区蓟门壹号,交通便利
工作地址
北京海淀区蓟门壹号8楼
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。