核心预训练研究员
岗位摘要
设计下一代基座模型,实现Model size scaling与context length scaling;研发文本、视觉、音频原生融合的统一多模态架构,实现端到端物理世界感知与推理
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 设计下一代基座模型,实现Model size scaling与context length scaling
- 研发文本、视觉、音频原生融合的统一多模态架构,实现端到端物理世界感知与推理
- 坚持Algorithm-Infra Co-design,结合底层硬件特性设计架构,突破效率瓶颈
- 建设超大规模多模态数据发掘、采集、清洗与配比流水线
- 攻克高质量合成数据的生成与验证难题,提升数据知识密度与推理能力
- 研发适应万卡集群与超大Batch Size的新型优化器,实现极致收敛
- 深入研究Training Dynamics,解决Loss Spike与泛化难题,保障大规模训练鲁棒性
任职要求
- 笃信AGI愿景,坚持探索,致力于推动AGI的实现
- 深刻理解'The Bitter Lesson'核心逻辑,笃信算力规模与通用算法的长期价值
- 在AI领域顶级会议或期刊(如ICLR、NeurIPS、ICML、CVPR、ACL等)发表过有影响力的论文
- 精通PyTorch等主流深度学习框架,具备大规模分布式训练实战经验
- 熟悉Megatron-LM等训练框架底层原理,能进行Backbone、Optimizer或Data Loader的底层代码优化
- 具备在高度不确定性环境下解决复杂问题的韧性,能与Infra团队高效协作
福利待遇
- 参与前沿AGI研究,探索智能本质边界
- 与顶尖AI研究团队合作,共同推动技术突破
- 享受具有竞争力的薪酬与福利待遇
- 提供丰富的计算资源与实验平台支持
- 职业发展路径清晰,鼓励学术发表与技术创新
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。