AI资讯 / 研究

研究 / 官方

用多智能体 LLM 系统自动为企业数据目录生成列描述与敏感性标签

Apple Machine Learning

企业数据湖中的数据表积累速度远超人工整理能力,大量数据列缺乏描述说明与治理分类标签,由此形成的「文档债务」严重影响数据发现、访问控制与合规管理。苹果机器学习研究团队发布了名为 Glyph 的生产级系统,将列描述生成与列类型标注两个相互关联的问题,转化为以有状态图编排的协作式 LLM 智能体任务。系统中的 Descriptor 智能体通过主动检索增强生成技术,从企业 GitHub 中提取生成每列数据的管道源代码;Tagger 智能体则并行运行三种互补策略,并借助倒数排名融合算法整合结果,最终在包含 275 个叶节点的数据分类本体中完成标签分配。研究团队还对 MiniLM 元数据编码器进行微调,将同标签检索的 NDCG@10 指标从 0.55 大幅提升至 0.92,使整套系统具备可审计性与生产可操作性。

企业数据湖面临一个长期困境:数据表的生成速度远超数据管理人员的文档化与分类能力。大量数据列缺少描述,治理标签也未能及时分配,这种「文档债务」不仅阻碍数据发现与检索,还会削弱访问控制机制,并在监管合规层面埋下隐患。苹果机器学习研究团队针对这一痛点,推出了生产级系统 Glyph,旨在以自动化方式同时解决列描述生成与列类型标注两个核心问题。

Glyph 的架构核心是两个协作式 LLM 智能体,以有状态图的形式进行编排。其中 Descriptor 智能体负责列描述生成,其独特之处在于采用「代码驱动」而非「值驱动」的设计思路——通过推理-行动工具循环,按需从企业 GitHub 仓库中检索生成该列数据的管道源代码,以此作为生成描述的基础,从而避免直接接触敏感数据内容。

Tagger 智能体负责从一个包含 275 个叶节点的受治理数据分类本体中为列分配标签。它并行运行三种互补策略:基于描述的标注器、基于业务线正则表达式的标注器,以及由经过微调的对比编码器支撑的元数据标注器。三种策略的排序输出最终通过倒数排名融合算法进行整合,以提升整体标注质量与鲁棒性。

在模型优化层面,研究团队对一个 6 层 MiniLM 元数据编码器进行了批内对比目标微调。结果显示,在分布内留出集上,同标签检索的 NDCG@10 指标从基础编码器的 0.55 跃升至 0.92,MAP@100 则从 0.19 提升至 0.90,性能提升幅度显著。这一改进直接增强了向量数据库检索策略的精准度,是 Glyph 整体性能的重要支撑。

Glyph 在设计上与现有商业敏感性扫描工具及学术列类型标注方案存在明显差异。系统采用无值、代码驱动的设计,避免直接处理原始数据;同时提供逐标签来源溯源,使每个标注结果均可追溯;并具备优雅降级能力,在部分策略失效时仍能维持系统正常运转。这些特性共同确保了 Glyph 作为生产服务的可审计性与可操作性,为企业数据目录的自动化治理提供了一条可落地的路径。

要点

  • Glyph 将列描述生成与列类型标注两个任务设计为协作式 LLM 智能体,以有状态图进行编排,实现端到端自动化数据目录治理
  • Descriptor 智能体采用代码驱动而非数据值驱动的主动 RAG 设计,从企业 GitHub 检索管道源代码,在保护数据隐私的同时提升描述准确性
  • Tagger 智能体并行运行三种互补标注策略并通过倒数排名融合整合结果,覆盖包含 275 个叶节点的数据分类本体
  • 经批内对比微调的 MiniLM 编码器将同标签检索 NDCG@10 从 0.55 提升至 0.92,MAP@100 从 0.19 提升至 0.90
  • 系统具备逐标签来源溯源与优雅降级能力,满足企业生产环境对可审计性与稳定性的要求
查看原始来源

原始标题:Glyph: A Multi-Strategy Agentic System for Column Description and Sensitivity-Ontology Tagging of Enterprise Data Catalogs

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。