Agent深度学习算法研究员
岗位摘要
针对大模型在推理、生成、指令遵循等方向的核心问题,提出创新性的想法并设计实验验证,探索提升模型能力的新方法与新范式;与数据标注团队紧密协作,设计标注方案与质量标准,通过数据分析发现模型能力短板,针对性地构建训练数据,形成'数据-训练-评测'的能力提升闭环
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 针对大模型在推理、生成、指令遵循等方向的核心问题,提出创新性的想法并设计实验验证,探索提升模型能力的新方法与新范式
- 与数据标注团队紧密协作,设计标注方案与质量标准,通过数据分析发现模型能力短板,针对性地构建训练数据,形成'数据-训练-评测'的能力提升闭环
- 参与强化学习(RL)在大模型对齐与能力提升中的应用研究,探索RLHF/RLAIF、过程奖励、偏好学习等方法的优化路径
- 持续跟踪大模型领域的前沿进展,快速复现并评估业界最新方法,推动有价值的研究成果落地
任职要求
- 面对问题能够独立分析并提出自己的idea,具备从0到1推动研究的能力
- 能够快速将想法转化为可运行的原型,具备高效的实验迭代能力
- 了解强化学习基本概念与常用算法(如PPO、DPO、Actor-Critic等),有相关实践经验者优先
- 熟练掌握Python、C/C++,熟悉PyTorch等深度学习框架
- 善于跨团队沟通,能够与数据标注、工程团队高效配合
- 加分项:有大模型预训练、微调、对齐相关研究或项目经验
- 加分项:在顶会(NeurIPS、ICML、ICLR、ACL等)发表过论文
- 加分项:有Agent系统、工具调用、代码生成相关研究或实践背景
- 加分项:深度使用过Claude Code、Cursor等AI编程工具,对模型能力边界有实践认知
- 加分项:参与过知名开源项目或有活跃的GitHub贡献
加分项
- 有大模型预训练、微调、对齐相关研究或项目经验
- 在顶会(NeurIPS、ICML、ICLR、ACL 等)发表过论文
- 有 Agent 系统、工具调用、代码生成相关研究或实践背景
- 深度使用过 Claude Code、Cursor 等 AI 编程工具,对模型能力边界有实践认知
- 参与过知名开源项目或有活跃的 GitHub 贡献
福利待遇
- 日薪500-510元
- 每周4天工作制
- 实习期6个月
- 位于北京海淀区融科资讯中心C座
工作地址
北京海淀区融科资讯中心C座
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。