返回岗位列表

Glean

机器学习工程师,大语言模型评估与可观测性

地点:美国 薪资:$200,000-$300,000 日期:2026-07-20

岗位摘要

设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供对真实助手行为的可靠、代表性覆盖;构建和维护大规模评估管道,在数千个真实用户查询上衡量助手质量;构建基于LLM的评判模型,评估正确性、完整性和响应质量等指标,并与人类判断对齐

岗位职责

  • 设计和策划评估数据集,包括采样策略、查询多样性和黄金数据集,以提供对真实助手行为的可靠、代表性覆盖
  • 构建和维护大规模评估管道,在数千个真实用户查询上衡量助手质量
  • 构建基于LLM的评判模型,评估正确性、完整性和响应质量等指标,并与人类判断对齐
  • 在新模型和产品变更发布前进行评估,提供质量信号以控制发布并防止回归
  • 构建AI代理的可观测性基础设施,包括追踪增强、数据管道和仪表板,使助手行为可检查
  • 利用评估结果、客户反馈和自动提示迭代等技术,闭环质量测量与改进,推动助手行为的具体提升
  • 与公司各团队工程师合作,使评估成为发布流程的一等公民

任职要求

  • 2年以上软件工程经验,具备扎实的编码能力
  • 扎实的后端基础,熟悉Go和Python,能处理分布式数据管道
  • 有大语言模型评估或基于人类反馈的强化学习经验

福利待遇

  • 参与构建影响全球企业AI应用的核心基础设施
  • 与顶尖团队合作,直接推动产品质量和用户体验提升
  • 在快速发展的AI领域获得前沿技术实践机会