AI资讯 / Agent

Agent / 工程

LangChain 开源结构化数据提取服务上线托管版本与可视化前端

LangChain

LangChain 团队在 2024 年 3 月推出结构化数据提取服务的托管版本与可视化前端,作为此前开源版本的应用演示。该服务可从 PDF、HTML 和文本等非结构化文档中抽取符合指定 Schema 的信息,支持自定义抽取指令、少样本示例、模型切换以及多用户共享抽取器。核心抽取逻辑以 LangServe 端点暴露,便于接入既有 LangChain 工作流;前端允许用户以自然语言定义 Schema 并即时在文本或文件上测试。文章以 Uber 2023 年 Q4 财报会议记录为例,演示了从下载 PDF、定义财务数据 Schema、调用 API 到获得结构化结果的完整流程,并展示如何通过少量示例修正模型输出与 Schema 描述不一致的问题。

LangChain 团队于 2024 年 3 月正式上线了结构化数据提取服务的托管版本,并配套发布了简易的前端界面。该项目是其月初发布的开源抽取服务的延伸,使用者无需自行部署即可在线体验抽取能力,也可参考其 LangServe 端点将其嵌入到自有 LangChain 工作流中。官方明确该托管版本仅供演示,不适用于生产负载或敏感数据。

服务聚焦从 PDF、HTML 和纯文本等非结构化来源中抽取符合 Schema 的结构化数据。核心能力包括:自定义 Schema 与指令并持久化保存、添加少样本示例进行上下文学习、在用户之间共享抽取器,以及在不同大语言模型之间灵活切换。抽取逻辑以 LangServe 端点形式对外暴露,方便开发者将其接入既有 LangChain 流程。

在前端层面,用户可以用自然语言定义抽取 Schema 并即时在文本或文件上测试,官方同时提供了 YouTube 演示视频与 GitHub 仓库链接。需要注意的是,前端目前尚不支持少样本示例配置,而完整的 API 路径允许用户上传文件、指定模型并获得带证据字段的结构化结果。

文章以 Uber 2023 年第四季度财报电话会议的文字记录为示例进行完整演示:先用 Python 下载 PDF,再用 Pydantic 定义包含名称、数值、单位、时间区间、时长和原文证据等字段的财务数据 Schema,然后通过 HTTP 接口创建抽取器并提交 PDF,最终以 GPT-3.5 Turbo 为模型获得包含调整后 EBITDA、GAAP 营业利润、营收等在内的结构化记录。

示例也揭示了模型输出与 Schema 描述不完全一致的问题,例如 Schema 中要求使用 MM、B、percent 等单位,而模型返回了 million、billion、$ 等不同写法。官方建议在升级更大模型之前,先通过添加少量示例来更高效地校准模型行为,使抽取结果更贴合预期格式与领域语义。

要点

  • LangChain 在 2024 年 3 月推出结构化抽取服务的托管版本与前端,作为开源实现的可视化补充,方便开发者快速体验与参考。
  • 服务支持 PDF、HTML 和文本输入,可自定义 Schema 与抽取指令,并通过少样本示例和模型切换提升抽取质量与灵活性。
  • 核心抽取逻辑以 LangServe 端点暴露,用户既可使用托管前端,也可将服务嵌入到自有 LangChain 工作流中。
  • 示例展示了从 Uber 财报 PDF 中抽取财务数据并附带原文证据字段的过程,便于下游验证和跨公司、跨期对比分析。
  • 当模型输出与 Schema 描述不一致时,优先添加少量示例通常比直接更换更大模型更经济高效。
查看原始来源

原始标题:Open Source Extraction Service

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。