Code Agent算法工程师(实习)
岗位摘要
负责代码数据的合成、清洗、权重分配及来源扩充,持续提升代码中程训练和后训练阶段的数据质量;探究预训练小领域数据配比与最终效果的关系,开发数据合成链路解决代码模型关键问题;探究深度推理技术,研究Test-time Compute和模型效果的Scaling laws
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 负责代码数据的合成、清洗、权重分配及来源扩充,持续提升代码中程训练和后训练阶段的数据质量
- 探究预训练小领域数据配比与最终效果的关系,开发数据合成链路解决代码模型关键问题
- 探究深度推理技术,研究Test-time Compute和模型效果的Scaling laws
- 参与后训练奖励模型、强化学习算法的优化流程,构建线上代码补全数据到RL过程的数据飞轮
- 专注于代码强化学习中奖励模型的优化和创新,配合SFT阶段解决判别能力较差场景
- 探究合成数据进行代码奖励模型的预训练,组织标注人员进行代码奖励模型标注
- 开展Critic前沿探究,进行强化学习过程中可执行代码与单元测试的质量过滤和扩充
- 利用强化学习方法改进智能体的规划、反思和利用工具能力,强化code agent实际场景可用性
- 探索基于人机协同的高质量数据挖掘与合成,加强智能体规划和利用工具能力
- 构建code agent基础能力,包括planning能力、测例和代码生成能力
- 构建多模态智能体,提升多模态大模型RLHF中的训练效果
- 构建code agent智能体自动化评测和docker环境生成
任职要求
- 本科及以上学历,计算机、物理、数学、神经科学或相关专业
- 具备软件工程背景,具有扎实的计算机科学功底和编程能力
- 熟悉常见算法和数据结构,具有良好的编程习惯
- 熟悉语言模型的基本技术和模型结构,对AI的未来有信仰和工作热情
- 工作认真细致,计划性强,具有刨根问底的探究精神
- 对研发工作有很强的实事求是的落地信念,追求最终效果而非盲目追求新颖方法
- 对工作内容有较强责任感,实习3个月以上
- 有NOI、ACM竞赛经历者优先
- 有推荐、搜索领域出色的数据驱动工作经验者优先
- 熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目者优先
- 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识
加分项
- 有NOI、ACM竞赛经历者优先
- 有推荐、搜索领域出色的数据驱动工作者优先
- 熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目
- 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识
- 高淳 刚刚活跃
- 上海阶跃星辰智能科技 · 校招HR
福利待遇
- 实习薪资300-500元/天
工作地址
北京海淀区大恒科技大厦12F
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。