大模型算法研究员/工程师(预训练)
岗位摘要
深度参与LLM的创新模型架构设计与改进,包括MLP和Attention模块;优化模型并行策略、优化算法、目标函数等方向,提升模型训练效率和推理效果;力争在上下文长度、参数规模和前沿性能上取得SOTA级领先水平
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 深度参与LLM的创新模型架构设计与改进,包括MLP和Attention模块
- 优化模型并行策略、优化算法、目标函数等方向,提升模型训练效率和推理效果
- 力争在上下文长度、参数规模和前沿性能上取得SOTA级领先水平
- 与Infra团队紧密合作,优化训练框架,提高GPU使用效率和训练任务的稳定性
- 确保高效的计算资源利用
- 高效获取、清洗、构造和合成高质量的预训练数据
- 持续探索可规模化的数据合成方法,确保数据质量和规模
- 参与模型训练任务的监控,设计关键评测指标,确保模型健康成长并取得预期效果
任职要求
- 985/211/海外高校研究生学历以上或优秀本科生,专业为CS/AI/ML/CV/NLP/Math或相关专业
- 1-5年在大模型和AI相关领域的实际工作经验
- 熟悉Transformer架构及相关大模型技术,并有相应的研究或实践经验
- 具有真实的预训练或模型Scaling经验者优先
- 扎实的编程能力,精通数据结构与算法设计
- 熟练使用深度学习框架(PyTorch, JAX等),具有丰富的深度学习训练和参数调优经验
- 有高性能计算经验者优先
- 熟悉Triton、CUDA等GPU编程与优化者优先
- 在顶级学术会议(如ICLR、NeurIPS、ICML、CVPR、ACL等)上发表过论文者优先
- 具备ACM/IOI/NOI/Top Coder等算法竞赛获奖经历者优先
- 强烈的责任心,积极主动,具备良好的沟通和团队协作能力
- 能够承担复杂任务并以高质量完成
工作地址
北京海淀区京东科技大厦13
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。