返回岗位列表

Anthropic

有害说服安全防护产品政策经理

地点:远程 薪资:$245,000-$330,000 日期:2026-01-29

岗位摘要

为有害说服风险(尤其是在选举诚信、影响力行动和欺诈方面)制定和维护全面的政策框架;设计清晰、可执行的政策语言,确保其能被执行团队一致应用,并能转化为技术检测要求;设计并监督评估的执行,以评估模型利用、生成和执行欺骗性及有害说服技术的能力

岗位职责

  • 为有害说服风险(尤其是在选举诚信、影响力行动和欺诈方面)制定和维护全面的政策框架
  • 设计清晰、可执行的政策语言,确保其能被执行团队一致应用,并能转化为技术检测要求
  • 设计并监督评估的执行,以评估模型利用、生成和执行欺骗性及有害说服技术的能力
  • 撰写和完善面向外部的使用政策语言,向用户和外部利益相关者清晰传达政策违规和限制
  • 制定培训指南、评估标准和评估协议
  • 验证执行决策和自动化评估,为复杂的边缘案例提供定性分析和政策指导
  • 与外部专家、民间社会组织和学术界协调,收集关于政策清晰度和覆盖范围的反馈
  • 就干预措施的用户体验设计提供政策意见,确保面向用户的元素符合政策意图,并最大限度地减少合法使用的摩擦
  • 与微调团队合作,为模型安全改进做出贡献
  • 支持法规遵从工作,包括与欧盟AI法案及其他新兴AI治理框架相关的咨询
  • 作为需要专家政策判断的复杂有害说服案例的升级处理点

任职要求

  • 在政策制定、信任与安全政策或平台政策方面拥有5年以上经验,并在以下领域有工作经验:选举诚信、欺诈/诈骗、协调的不真实行为、影响力行动或虚假信息
  • 对全球围绕选举诚信、平台监管和数字服务责任的监管环境有基本了解
  • 具备强大的政策撰写能力,能够将复杂的风险框架转化为清晰、可执行的指导方针