语言大模型架构/优化/Scaling实习生
岗位摘要
深度参与前沿大模型(LLM)的架构设计与迭代,重点攻关Attention机制(如MLA、Linear Attention、VQ)及MoE等SOTA结构的性能与效率瓶颈;主导模型优化器与训练策略的研究,深入分析优化动力学,探索二阶优化(如Hessian-free)的可行性,并应用μ-Parametr…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 深度参与前沿大模型(LLM)的架构设计与迭代,重点攻关Attention机制(如MLA、Linear Attention、VQ)及MoE等SOTA结构的性能与效率瓶颈
- 主导模型优化器与训练策略的研究,深入分析优化动力学,探索二阶优化(如Hessian-free)的可行性,并应用μ-Parametrization (MuP)等技术指导模型稳定、高效地Scaling
- 与Infra团队紧密合作,共同设计和优化训练框架,将前沿算法思想高效映射到大规模GPU集群上,提升训练稳定性与资源利用率
任职要求
- 985/211/海外知名高校硕士及以上学历,计算机、人工智能、数学等相关专业
- 在大模型领域有丰富的实战经验,熟悉Transformer,并在至少一个方向有深入实践:模型结构创新、训练优化器、大规模训练(Scaling)或推理优化
- 编程能力卓越,精通PyTorch/JAX等框架,有丰富的深度学习模型训练及调优经验
- 具备强烈的技术热情和owner意识,善于沟通协作,能独立承担复杂挑战
加分项
- (有以下经验者优先)
- 熟悉Triton、CUDA,有高性能计算或算子优化经验
- 熟悉优化器/LLM Scaling原理
- 在ICLR、NeurIPS、ICML等ML/NLP顶会上发表过相关论文
- 有ACM/IOI/NOI等算法竞赛获奖经历
- 程女士 刚刚活跃
福利待遇
- 优厚日薪500-1000元/天
- 参与月之暗面前沿大模型核心技术研发,接触行业最顶尖技术方向
- 与顶级团队紧密协作,共同攻克大模型训练与Scaling难题
- 积累大规模GPU集群训练与优化的实战经验
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。