大模型算法研究员/工程师(预训练)
岗位摘要
深度参与LLM的创新模型架构设计与改进,包括MLP和Attention模块,优化模型并行策略、算法和目标函数,力争在上下文长度、参数规模和前沿性能上取得SOTA级领先水平;与Infra团队紧密合作,优化训练框架,提高GPU使用效率和训练任务稳定性,确保高效的计算资源利用
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 深度参与LLM的创新模型架构设计与改进,包括MLP和Attention模块,优化模型并行策略、算法和目标函数,力争在上下文长度、参数规模和前沿性能上取得SOTA级领先水平
- 与Infra团队紧密合作,优化训练框架,提高GPU使用效率和训练任务稳定性,确保高效的计算资源利用
- 高效获取、清洗、构造和合成高质量的预训练数据,持续探索可规模化的数据合成方法,确保数据质量和规模
- 参与模型训练任务的监控,设计关键评测指标,确保模型健康成长并取得预期效果
任职要求
- 985/211/海外高校研究生学历以上或优秀本科生,专业为CS/AI/ML/CV/NLP/Math或相关专业
- 1-5年在大模型和AI相关领域的实际工作经验,熟悉Transformer架构及相关大模型技术,具有真实的预训练或模型Scaling经验者优先
- 扎实的编程能力,精通数据结构与算法设计,熟练使用深度学习框架(PyTorch、JAX等),具有丰富的深度学习训练和参数调优经验
- 有高性能计算经验者优先,熟悉Triton、CUDA等GPU编程与优化者优先
- 在顶级学术会议(如ICLR、NeurIPS、ICML、CVPR、ACL等)上发表过论文者优先
- 具备ACM/IOI/NOI/Top Coder等算法竞赛获奖经历者优先
- 强烈的责任心,积极主动,具备良好的沟通和团队协作能力,能够承担复杂任务并高质量完成
福利待遇
- 具有竞争力的薪酬待遇,25-50K·16薪
- 参与前沿大模型预训练研究,接触SOTA级技术挑战
- 与资深团队紧密协作,共同推动大模型技术突破
- 完善的福利体系和职业发展通道
工作地址
北京海淀区京东科技大厦13F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。