产品设计师,评估与提示词
岗位摘要
编写并修订Claude工具、功能和行为在产品界面上的提示词;测试该界面,将发现转化为提示词修复,发布修复,并确认用户获得的是预期提示词;构建证明提示词修复有效的评分器,并在下一个模型上重新运行;将设计师手动执行的评分标准转化为自动化评估,然后阅读对话记录以发现评估遗漏的内容
岗位职责
- 编写并修订Claude工具、功能和行为在产品界面上的提示词;测试该界面,将发现转化为提示词修复,发布修复,并确认用户获得的是预期提示词
- 构建证明提示词修复有效的评分器,并在下一个模型上重新运行;将设计师手动执行的评分标准转化为自动化评估,然后阅读对话记录以发现评估遗漏的内容
- 构建可视化、低代码的评估工具,让设计师无需工程师即可使用:从真实对话记录中组装对比集,将纯英文评分标准转化为评分器,跨模型并排比较提示词变体,并在工具中而非笔记本中读取结果
- 观察设计师使用这些工具,并使其更简单
- 支持模型发布:针对新模型测试每个界面,编写提示词修复和迁移,并为随之发布的功能编写提示词,从而让界面负责人的决策有数据支撑
- 搭建并扩展评估框架:构建可测试我们50到100个工具的测试环境,并配备可信设置,保持评估跨模型通过,并判断回归是来自框架还是模型
- 将提示词无法修复的问题打包用于训练,并附上评估:为明确行为构建评分器,为写作质量等模糊行为提供人工反馈问题和好/坏配对
任职要求
- 有为LLM产品构建和维护评估管线的经验:评分器、评分标准、对比集、回归套件,以及跨模型运行这些内容的管道
- 有构建带真实界面的内部工具的经验,供不写代码的人使用
- 有搭建测试框架、沙箱化工具调用并固定设置以确保运行可比的经验
- 有发布提示词的经验,或与发布提示词的人紧密合作的经验,并理解为什么在一个模型上有效的提示词在下一个模型上会失败
- 阅读对话记录,而不仅仅是分数
- 曾在模型发布周期内工作过
- 有A/B测试经验,并能将离线评估与在线结果联系起来
- 有前端或笔记本到应用的经验,并对什么使评估结果一目了然有见解
- 曾将产品评分标准转化为训练信号:评分器、人工反馈问题或偏好配对
- 关心Claude对使用者的行为表现,而不仅仅是指标是否变化