LLM算法工程师-Agent与对齐方向
岗位摘要
针对工具使用、代码生成、长程Agent任务(如规划、搜索、浏览器/计算机操作)等复杂场景,主导SFT、RLHF及RLVR等核心算法的实验与迭代,实现模型能力的突破;主导特定高级任务的高质量数据闭环构建,负责合成查询、合成与验证执行轨迹、过滤与标注数据,以及构建高性能的验证器/奖励模型
登录后保留你的岗位线索
邮箱登录后可继续查看完整职责、任职要求和原岗位入口,并使用收藏与浏览记录沉淀适合自己的机会。
岗位职责
- 针对工具使用、代码生成、长程Agent任务(如规划、搜索、浏览器/计算机操作)等复杂场景,主导SFT、RLHF及RLVR等核心算法的实验与迭代,实现模型能力的突破
- 主导特定高级任务的高质量数据闭环构建,负责合成查询、合成与验证执行轨迹、过滤与标注数据,以及构建高性能的验证器/奖励模型
- 聚焦于改善用户体感的关键痛点,设计并实施技术方案以显著提升模型的指令遵循能力、增强回答的事实性、并有效抑制幻觉
- 负责提升模型在不同领域/任务的表现,确保模型输出的专业性与准确性
- 针对长文本理解、创意写作、多轮交互、Agent任务等新兴能力,与团队共同设计和建设科学、有效的评测指标与流程,量化模型进展
任职要求
- 计算机科学或相关专业本科及以上学历,具备1-3年以上人工智能与NLP相关开发经验
- 拥有丰富的大语言模型项目实战经验,精通SFT,并深入理解RLHF/RLVR的原理与实践细节
- 具备强大的数据工程与数据洞察能力,有主导构建高质量指令/轨迹/偏好数据集的成功经验
- 精通Python及PyTorch,具备优秀的工程实现与快速迭代能力,能将算法思想高效落地
- 有处理不同参数规模(如1B-100B+)和架构(Dense/MoE)模型微调的经验,熟悉其中的挑战与优化技巧
- 有Agent、Tool-use或Code LLM相关项目经验者优先
- 对Reward Model/Verifier的建模和训练有深入理解和独到见解者优先
- 具备分布式训练(如Megatron-LM)和verl/slime/swift/sglang/vllm/transformers/ray/tokenizers等应用经验
- 在相关领域的顶会或期刊有论文发表,具备扎实的算法研究背景知识
加分项
- 有 Agent、Tool
- use 或 Code LLM 相关项目经验者优先
- 对 Reward Model / Verifier 的建模和训练有深入理解和独到见解者优先
- 具备分布式训练(如 Megatron
- LM)和 verl/slime/swift/sglang/vllm/transformers/ray/tokenizers 等应用经验
- 在相关领域的顶会或期刊有论文发表,具备扎实的算法研究背景知识
- 赵楠 刚刚活跃
工作地址
北京海淀区科建大厦北京市海淀区科建大厦
登录后查看完整岗位详情
使用邮箱验证码登录后,可查看完整职责、任职要求、原岗位入口,并继续使用收藏和浏览记录。列表摘要保持公开,完整详情用于保护数据质量和降低恶意抓取。