返回岗位列表

面壁智能

LLM算法工程师-Agent与对齐方向

地点:北京 薪资:50-80K 日期:2026-03-03

岗位摘要

针对工具使用、代码生成、长程Agent任务(如规划、搜索、浏览器/计算机操作)等复杂场景,主导SFT、RLHF及RLVR等核心算法的实验与迭代,实现模型能力的突破;主导特定高级任务的高质量数据闭环构建,负责合成查询、合成与验证执行轨迹、过滤与标注数据,以及构建高性能的验证器/奖励模型

岗位职责

  • 针对工具使用、代码生成、长程Agent任务(如规划、搜索、浏览器/计算机操作)等复杂场景,主导SFT、RLHF及RLVR等核心算法的实验与迭代,实现模型能力的突破
  • 主导特定高级任务的高质量数据闭环构建,负责合成查询、合成与验证执行轨迹、过滤与标注数据,以及构建高性能的验证器/奖励模型
  • 聚焦于改善用户体感的关键痛点,设计并实施技术方案以显著提升模型的指令遵循能力、增强回答的事实性、并有效抑制幻觉
  • 负责提升模型在不同领域/任务的表现,确保模型输出的专业性与准确性
  • 针对长文本理解、创意写作、多轮交互、Agent任务等新兴能力,与团队共同设计和建设科学、有效的评测指标与流程,量化模型进展

任职要求

  • 计算机科学或相关专业本科及以上学历,具备1-3年以上人工智能与NLP相关开发经验
  • 拥有丰富的大语言模型项目实战经验,精通SFT,并深入理解RLHF/RLVR的原理与实践细节
  • 具备强大的数据工程与数据洞察能力,有主导构建高质量指令/轨迹/偏好数据集的成功经验
  • 精通Python及PyTorch,具备优秀的工程实现与快速迭代能力,能将算法思想高效落地
  • 有处理不同参数规模(如1B-100B+)和架构(Dense/MoE)模型微调的经验,熟悉其中的挑战与优化技巧
  • 有Agent、Tool-use或Code LLM相关项目经验者优先
  • 对Reward Model/Verifier的建模和训练有深入理解和独到见解者优先
  • 具备分布式训练(如Megatron-LM)和verl/slime/swift/sglang/vllm/transformers/ray/tokenizers等应用经验
  • 在相关领域的顶会或期刊有论文发表,具备扎实的算法研究背景知识

加分项

  • 有 Agent、Tool
  • use 或 Code LLM 相关项目经验者优先
  • 对 Reward Model / Verifier 的建模和训练有深入理解和独到见解者优先
  • 具备分布式训练(如 Megatron
  • LM)和 verl/slime/swift/sglang/vllm/transformers/ray/tokenizers 等应用经验
  • 在相关领域的顶会或期刊有论文发表,具备扎实的算法研究背景知识
  • 赵楠 刚刚活跃

工作地址

北京海淀区科建大厦北京市海淀区科建大厦