AI资讯 / 产业

产业 / 媒体

巴基斯坦法院大规模试验AI助手,结案率提升6.3%

IEEE Spectrum AI

巴基斯坦司法系统长期面临积压226万件案件、每10万人仅有不足2名法官的严峻困境。为此,俄罗斯新经济学院经济学家苏丹·马哈茂德与合作者联合开发了专为巴基斯坦司法场景定制的AI工具JudgeGPT,将OpenAI的GPT-4大语言模型与包含逾12.8万份巴基斯坦司法意见及943部法规的知识库相结合,并于2024年向全国约半数的1559名初审法官开放使用。研究结果显示,经过系统培训的法官所在地区结案数量中位数提升6.3%,上诉率略有下降,判决质量未见明显下滑。这是迄今为止规模最大的司法AI独立评估研究,为全球司法系统引入AI辅助工具提供了重要参考依据。

巴基斯坦司法系统长期积压超过226万件未结案件,每10万人口中法官数量不足2人,远低于欧盟的22人和巴西的8人。面对如此巨大的司法压力,研究团队与司法机构合作,探索AI技术能否有效减轻法官负担。参与研究的法官坦言,案件积压造成的延误已给民众带来切实痛苦,他们对新技术的接受意愿甚至超过了研究者本身的预期。

研究团队开发的JudgeGPT采用检索增强生成技术,使模型能够实时查询包含128292份司法意见和943部法规的本地数据库,并在回复中附上指向原始判决和法律条文的脚注链接。这一设计有效解决了通用商业AI工具在处理巴基斯坦法律查询时频繁出现幻觉、捏造案例法的问题。苏黎世联邦理工学院副教授埃利奥特·阿什指出,解决幻觉问题的关键不在于模型本身更智能,而在于将模型与可执行搜索和来源验证的工具相结合。

培训环节被证明是决定工具使用效果的关键因素。研究团队为1197名法官安排了六次各90分钟的线上培训课程,内容涵盖大语言模型的工作原理、局限性、偏见与幻觉风险以及核实输出结果的重要性。数据显示,接受过专项培训的法官平均登录系统56次、发送212条提示词,而仅接受通用技术培训的法官仅登录10次、发送25条提示词;未经任何培训的法官则在使用约一个月后便基本停止使用该工具。

在效果评估方面,研究团队委托法律专家对判决质量进行评价,并借助GPT-5-mini对同一法官培训前后的判决进行两两比较。结果显示,AI模型在59%的情况下选择了培训后的判决,两位经验丰富的巴基斯坦律师与AI模型的判断吻合率达70.6%,与彼此之间的吻合率73%相近。从经济效益来看,每投入1美元运营成本,可节约约38.5美元的司法开支,折算下来每名受训法官每月多结案38.5件。

尽管整体结果积极,研究也揭示了若干值得警惕的问题。约五分之一的提示词涉及研究者所称的「实质性AI委托」行为,即法官直接要求工具给出最佳裁决、生成法律推理或撰写判决意见,而几乎不加入自身判断。专项培训虽然降低了此类不当委托的比例,但问题并未完全消除。澳大利亚拉筹伯大学法律与技术教授约翰·泽莱兹尼科夫提醒,提升效率固然重要,但司法公正的质量同样不可忽视,法官必须对AI输出保持审慎的核查态度。

麻省理工学院经济学教授大卫·奥托尔对这项研究给予高度评价,认为在公共服务领域开展如此大规模的实地实验殊为不易,尤其是在司法这一关乎重大利益的领域。目前,巴西和印度也在推进面向法官的AI工具部署,但此前均缺乏系统性的独立评估。研究团队表示,随着底层AI模型和数据库的持续更新,工具效果有望进一步提升,这一实验为全球司法AI应用提供了迄今最具说服力的实证依据。

要点

  • JudgeGPT将GPT-4与超过12.8万份本地司法文件结合,通过检索增强生成技术有效抑制了AI幻觉问题,使结案率提升6.3%且上诉率略有下降
  • 系统性培训是决定AI工具能否持续发挥效用的核心变量,接受专项培训的法官使用频率是仅接受通用培训者的8倍以上
  • 约五分之一的使用行为涉及不当的实质性AI委托,即法官将裁决权过度让渡给工具,这一现象在专项培训后有所改善但未完全消除
  • 从经济效益看,每投入1美元运营成本可节约约38.5美元司法开支,但研究者强调效率提升不能以牺牲司法公正质量为代价
  • 这是全球首个针对司法AI工具持续使用情况的大规模独立评估,为巴西、印度等正在推进类似部署的国家提供了重要参考
查看原始来源

原始标题:Pakistani Judges Give Their Verdict on JudgeGPT

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。