大语言模型预训练算法工程师
岗位摘要
负责Model Architecture的研发、优化和创新,包括Attention、MoE等架构的改进及全新架构探索;负责下一代预训练范式的研究和创新,推动技术Scale up;从算法角度推动大模型训练和推理低成本化,包括优化器改进、量化、投机采样等技术
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责Model Architecture的研发、优化和创新,包括Attention、MoE等架构的改进及全新架构探索
- 负责下一代预训练范式的研究和创新,推动技术Scale up
- 从算法角度推动大模型训练和推理低成本化,包括优化器改进、量化、投机采样等技术
- 研究通用智能本质,设计和迭代通用智能的评估和观测方法,指导下一代范式演进
- 负责大语言基座模型在代码、数学、Reasoning能力的提升,系统性增强模型能力,实现数据飞轮
任职要求
- 预计毕业时间在2025年9月至2026年8月的计算机、数学、人工智能等相关专业博士或优秀硕士
- 有独立研究能力,曾发表机器学习或相关领域的一作论文
- 具备扎实的编程基础和优秀的工程能力,能够独立实现相关算法和实验
- 具有大模型领域的实习或科研经验者优先
- 具备良好的团队协作能力和沟通能力
福利待遇
- 30-35K·16薪具有竞争力的薪酬
- 参与前沿大模型预训练核心技术的研发工作
- 系统性地提升模型在代码、数学和推理方面的能力
- 实现数据飞轮的机会
- 良好的团队协作和沟通环境
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。