返回岗位列表

Glean

机器学习工程师,大语言模型评估与可观测性

地点:美国 薪资:$200,000-$300,000 日期:2026-07-20

岗位摘要

设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供可靠且具有代表性的真实助手行为覆盖;构建和维护大规模评估管道,用于衡量数千个真实用户查询的助手质量;构建LLM驱动的评判器,用于评分正确性、完整性和响应质量等指标,并使其与人类判断对齐

岗位职责

  • 设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供可靠且具有代表性的真实助手行为覆盖
  • 构建和维护大规模评估管道,用于衡量数千个真实用户查询的助手质量
  • 构建LLM驱动的评判器,用于评分正确性、完整性和响应质量等指标,并使其与人类判断对齐
  • 在新模型和产品变更发布前进行评估,提供质量信号以控制发布并防止回归
  • 为AI代理构建可观测性基础设施,包括追踪增强、数据管道和仪表板,使助手行为可检查
  • 利用评估结果、客户反馈和自动提示迭代等技术,闭环质量测量与改进,推动助手行为的具体提升
  • 与公司各团队工程师合作,使评估成为发布流程的一等公民

任职要求

  • 2年以上软件工程经验,具备扎实的编码能力
  • 扎实的后端基础,熟悉Go和Python,能够处理分布式数据管道
  • 有LLM评估、基于人类反馈的强化学习或相关领域经验者优先
  • 对质量有深刻理解,能够构建可衡量系统
  • 具备良好的协作和沟通能力,能够跨团队推动评估实践

福利待遇

  • 参与构建全球领先的工作AI平台,影响数百万用户
  • 与顶尖工程师和研究人员合作,推动AI评估和可观测性前沿
  • 灵活的工作环境,支持远程办公
  • 有竞争力的薪酬和股权激励
  • 全面的健康保险和福利计划
  • 持续学习和职业发展机会