通义实验室-大模型预训练算法工程师-通义千问
岗位摘要
预训练数据:大规模预训练数据合成技术探索、STEM & reasoning 优化、长尾知识优化、精品数据挖掘过滤、自然数据 scaling、长文本优化、面向 test;预训练策略:新型预训练损失函数探索、遗忘对抗与持续学习、optimizer 优化、lr scheduler 优化、课程学习、sca…
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 预训练数据:大规模预训练数据合成技术探索、STEM & reasoning 优化、长尾知识优化、精品数据挖掘过滤、自然数据 scaling、长文本优化、面向 test
- 预训练策略:新型预训练损失函数探索、遗忘对抗与持续学习、optimizer 优化、lr scheduler 优化、课程学习、scaling law 预测、超参优化
- 模型结构:新型模型结构探索、模型可解释性、MoE 优化、参数扩展与裁剪蒸馏、线性注意力、动态稀疏注意力、draft model 优化、动态计算优化、KV cache压缩、长序列优化、decoding 加速等
任职要求
- 计算机科学、人工智能、机器学习能等领域的博士/硕士毕业生
- 对上述研究方向的某一项或者几项有完整的研究经历或者实际的工业界落地经验
- 关注技术影响力,具有开源开放精神,对基础模型的前沿问题有持续热情,有追求,务实,渴望做出有极大影响力的工作
- 具备独立思考能力和系统性研究思维,具备较强的动手能力,敢于挑战现有范式,能够独立应用技术解决复杂问题
- 对LLM的训练优化或推理有深入认知,熟悉 Triton 或 CUDA
- 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于:NeurIPS、ICML、ICLR、ACL、TPAMI等国际顶级计算机会议/期刊
- 拥有知名开源项目,在开源社区具有较好的影响力,或在竞赛中获得引领性的研究成果
加分项
- 对LLM的训练优化或推理有深入认知,熟悉 Triton 或 CUDA
- 曾发表顶级会议论文并具有一定的学术影响力,包括但不限于:NeurIPS、ICML、ICLR、ACL、TPAMI等国际顶级计算机会议/期刊
- 拥有知名开源项目,在开源社区具有较好的影响力,或在竞赛中获得引领性的研究成果
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。