大语言模型预训练算法专家
岗位摘要
探索大规模预训练数据合成技术,优化STEM与推理能力、长尾知识覆盖;开展精品数据挖掘过滤、自然数据scaling及长文本优化研究;面向test-time scaling进行数据优化策略设计与实现
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 探索大规模预训练数据合成技术,优化STEM与推理能力、长尾知识覆盖
- 开展精品数据挖掘过滤、自然数据scaling及长文本优化研究
- 面向test-time scaling进行数据优化策略设计与实现
- 探索新型预训练损失函数、遗忘对抗与持续学习机制
- 优化optimizer、lr scheduler,推进课程学习与scaling law预测研究
- 开展超参数优化及预训练策略的系统化改进
- 探索新型模型结构,提升模型可解释性
- 优化MoE架构、参数扩展与裁剪蒸馏技术
- 研发线性注意力、动态稀疏注意力等高效注意力机制
- 优化draft model、动态计算、KV cache压缩及decoding加速技术
任职要求
- 计算机科学、人工智能、机器学习等领域的博士或硕士毕业生
- 对预训练数据、训练策略或模型结构中的一项或多项具有完整研究经历或工业界落地经验
- 关注技术影响力,具备开源开放精神,对基础模型前沿问题保持持续热情
- 具备独立思考能力和系统性研究思维,动手能力强
- 敢于挑战现有范式,能够独立应用技术解决复杂问题
加分项
- 对LLM的训练优化或推理有深入认知,熟悉 Triton 或 CUDA
- 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于:NeurIPS、ICML、ICLR、ACL、TPAMI等国际顶级计算机会议/期刊
- 拥有知名开源项目,在开源社区具有较好的影响力,或在竞赛中获得引领性的研究成果
福利待遇
- 参与世界级大模型技术研发,打造全球领先的全模态模型技术体系
- 与顶尖AI研究团队深度合作,推动下一代人工智能发展
- 丰富的学术资源支持,鼓励发表顶级会议论文
- 开放的开源文化,支持个人技术影响力建设
- 极具竞争力的薪酬待遇与发展空间
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。