AI资讯 / 产业

产业 / 媒体

真人审核员每小时50美元阅读你的ChatGPT聊天记录

IT之家

据404 Media披露,OpenAI内部存在一项代号为「莉莉计划」(Project Lily)的评估项目,专门雇用人工审核员阅读经匿名处理的真实ChatGPT用户聊天记录,以评判模型回复质量。审核员被称为「提示词审核员」,工作内容包括判断回答是否切题、是否存在过度谄媚或拟人化表述等问题,时薪据称超过50美元。尽管聊天记录在交付审核前会经过匿名处理,但OpenAI承认过滤环节仍可能遗漏部分个人数据,且审核版本附带汇总用户偏好与上下文的「记忆摘要」。令人担忧的是,许多用户将ChatGPT视为私密倾诉对象,并不知晓对话内容可能被他人阅读。报道发布后,OpenAI更新了帮助页面,但新版文档仍未明确说明会有真人读取会话内容。

404 Media近日获取了OpenAI内部「莉莉计划」的操作指引文档、Slack工作群组记录、真实ChatGPT对话样本及评分体系,首次完整披露了这套人工审核机制的运作细节。从事该项目的人员被称为「提示词审核员」,其核心职责是查看匿名化处理后的真实用户对话,对ChatGPT的回复质量进行评级,重点检查回答是否切题,以及是否存在过度使用表情符号、说教语气、谄媚口吻或拟人化表述等问题。

在具体规范上,莉莉计划明确禁止ChatGPT编造「个人经历」。例如,模型可以表述「我查到了一些相关信息」,但不得出现「身为一名厨师,我喜欢……」或「我明白这种感受」之类的拟人化措辞。一名参与该项目的审核员表示,这份工作「十分机械重复」,但时薪据称超过50美元,对于难度不算高的工作而言报酬颇为可观。该审核员还指出,项目操作指引频繁变动,不同版本之间时有矛盾。

隐私层面的隐患是此次曝光最受关注的焦点。虽然聊天记录在交付审核前据称会经过匿名处理,审核员无法看到用户名,但OpenAI向404 Media承认,过滤环节仍可能遗漏部分个人数据,简短会话尤为如此。更值得注意的是,交给审核员的会话版本附带一份「用户记忆摘要」,汇总了用户的提问习惯、兴趣偏好、上下文信息,甚至可能包含位置数据。大量对话中,用户还明确要求ChatGPT对谈话内容保密。

莉莉计划的职能范围相对有限:它不负责核查回答的事实准确性,仅标记显而易见的错误;也与排查用户潜在伤害意图的安全审查团队相互独立。这意味着OpenAI内部至少还存在其他独立团队承担不同维度的评估工作。该项目的存在本身也说明,与AI公司对外塑造的「技术自动进化」印象相反,大模型的持续迭代依然高度依赖大量人工参与。

在用户知情权方面,面向普通用户的ChatGPT默认开启「允许使用对话记录改进产品」选项,企业版、商业版及教育版则默认关闭。但这一开关不具备回溯效力——历史记录一旦存入数据库,即便用户事后关闭选项或主动删除对话,相关内容或许早已完成匿名处理并留存于训练数据集中。报道发布后,OpenAI更新了帮助页面,但新版内容仍未明确告知用户会有真人阅读其聊天记录。谷歌Gemini和Anthropic均在隐私政策中明确说明了人工审核的存在,而Perplexity的隐私政策对此既未确认也未否认。

要点

  • OpenAI内部「莉莉计划」雇用人工审核员阅读匿名化的真实用户ChatGPT对话,以评估模型回复质量,时薪超过50美元。
  • 聊天记录虽经匿名处理,但OpenAI承认过滤环节可能遗漏个人数据,且审核版本附带包含用户偏好和上下文的「记忆摘要」。
  • 数据收集开关不具回溯效力,用户删除对话或关闭数据共享后,此前已被抓取的内容仍可能留存于训练数据集中。
  • 报道发布后OpenAI更新帮助页面,但新版文档仍未明确说明会有真人读取用户会话内容,透明度存在明显缺口。
  • 人工审核聊天记录是行业普遍做法,谷歌Gemini和Anthropic均有明确披露,但各家透明度标准参差不齐。
查看原始来源

原始标题:OpenAI 内部 Lily 项目曝光:人工审核 ChatGPT 用户聊天记录以优化大模型

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。