百万级发现与十位数调查能力之间的结构性缺口
Kai Security 是一家以"AI 原生"为定位的网络安全公司,总部位于北美,面向财富 500 和全球 2000 强企业提供自主暴露面管理平台。它要解决的问题,不是"如何发现更多漏洞"——企业扫描器已经可以持续、大量地产出安全发现——而是发现之后的一切:判断哪些发现代表真实暴露,哪些只是噪声;确认暴露的严重程度;把确认有效的问题转化为工程师可以直接执行的修复动作。
这条从"发现"到"修复"的链路,在传统安全运营中几乎完全依赖人工。Kai 联合创始人兼 CTO Damiano Bolzoni 在官方案例中给出了一个锚点数字:一名熟练的安全分析师每天可以深入调查 10–20 个漏洞。而他们的客户"坐在数百万条发现上面"。
口径说明:该数字指"单名熟练分析师的每日调查量",官方未定义"深入调查"的统一标准、样本来源或工作时长假设。
与此同时,攻击端的时间窗口正在急剧压缩。官方案例明确指出,AI 使攻击者从漏洞发现到利用的窗口从数周缩短到数小时,有时甚至是数分钟。防御端的人力调查流程——以周为单位——在结构上已经无法追上这个速度。这不是"效率不够高"的问题,而是"这条路径在数学上走不通"的问题。
Kai 的第一个架构决策:在模型介入之前约束数据质量
面对这个结构性缺口,安全行业的主流应对框架是持续威胁暴露管理(CTEM)——一套涵盖识别、优先级排序、验证和修复的循环流程。但 Bolzoni 指出,CTEM 的每个阶段都是为人工执行设计的,每个依赖人工调查或协调的环节都会成为瓶颈。Kai 的目标是让这个循环的每个阶段都能自主运行,速度与攻击者匹配,准确性与资深分析师匹配。
这个目标决定了 Kai 的第一个关键架构选择:不是直接把原始安全数据交给大语言模型,而是在模型之前设置一层确定性处理。按照官方案例的描述,这一层负责摄取、清洗、去重、验证和切分原始安全数据,然后才把处理后的数据交给 Claude 进行分析。
"当基础是碎片化的,AI 只会更快地制造碎片。它不会弥合碎片之间的缝隙。"
这个顺序的意义在于:它把数据质量问题和模型分析问题分开处理。确定性算法负责保证输入数据的干净和一致,模型负责在干净数据上完成需要推理能力的分析任务——比如从非结构化数据中提取洞察、判断发现之间的关联性。Bolzoni 将这种设计描述为"harness"(约束框架),强调的是控制、可审计和可靠性。
模型选择:并行测试与一致性
官方案例称,Kai 针对代表性的 CTEM 任务进行了并行测试,考察维度包括提取准确性、模式遵循(schema compliance)、幻觉率、延迟、成本和人工清理量。最终选择 Claude 作为分析层,理由是"分析深度、一致性和指令遵循的组合在客户每天带来的输入量和多样性下保持稳定"。
官方材料未披露参与并行测试的候选模型名称、测试集规模、各项评分或评分方法。因此无法独立验证模型选择的比较基础。
在具体使用中,Kai 将任务分配给 Claude Sonnet 和 Claude Opus 两个模型,根据任务特性选择最适合的模型。官方案例没有说明哪些任务使用 Sonnet、哪些使用 Opus,也没有披露两者之间的任务分配比例或切换逻辑。
访问路径:一个独立于模型选择的安全决策
Kai 通过 Amazon Bedrock 访问 Claude 模型。Bolzoni 在案例中明确指出,对于处理敏感数据的安全平台,"模型的访问路径本身就是一个安全决策"。Bedrock 提供的访问控制、监控和合规框架使 Kai 的企业客户能够批准自主执行,而不仅仅是评估。
这里需要保持所有权边界的清晰:这些基础设施控制由 Bedrock 提供,案例并未将它们描述为 Kai 自建的能力。Kai 的贡献在于确定性处理层和智能体编排逻辑,Bedrock 的贡献在于模型托管和企业级安全框架。
从发现到修复:调查链的实际运转方式
理解 Kai 的系统不能只看架构图,还需要理解一条安全发现从进入平台到产出修复的完整路径中,哪些环节是确定性的、哪些依赖模型推理、哪些需要人工判断。
第一阶段:确定性层的数据约束
原始安全数据从扫描器、日志系统、资产清单和威胁情报源进入平台后,首先经过确定性算法处理。这一层的五个步骤——摄取、清洗、去重、验证、切分——都是规则驱动的,不涉及模型推理。它的作用是确保进入模型的数据已经过基本的质量控制:重复的发现被合并,格式不一致的数据被标准化,明显无效的输入被过滤。
Bolzoni 将这一层称为"harness"(约束框架),并强调 Kai 将大语言模型实现为"完全自主的系统而非聊天机器人",这使得他们能够在敏感和复杂的工作流中使用模型,同时保持控制、可审计性和可靠性。
官方案例描述了确定性层的五个处理步骤,但未披露具体的去重算法、验证规则或切分策略。也未说明确定性层本身的错误率或质量指标。
第二阶段:多智能体关联调查
经过确定性处理的数据进入智能体分析层。多个调查智能体关联来自不同来源的信号,目标是区分真实暴露与噪声。官方案例描述了环境相关的严重性评分维度,包括网络可达性、漏洞链和现实可利用性——这意味着同一个漏洞在不同网络环境中可能获得完全不同的优先级。
这个阶段是模型能力发挥作用的核心环节:从非结构化数据中提取洞察、判断多个信号之间的关联性、在特定环境上下文中评估风险。这些任务超出了规则引擎的能力范围,也是 Kai 选择大语言模型而非传统机器学习方法的原因。
第三阶段:修复生成与交付
对确认有效的应用安全发现,Kai 生成包含依赖分析的可提交修复。官方案例特别提到,平台会处理上游和下游依赖关系,目标是避免修复引入破坏性变更。Bolzoni 的原话是:"工程师收到的不是一份漏洞报告和一个待解决的问题。对于应用安全发现,他们收到的是带有依赖分析的可提交修复。剩下的是真正需要人工判断的工作。"
"工程师收到的不是一份漏洞报告和一个待解决的问题。对于应用安全发现,他们收到的是带有依赖分析的可提交修复。剩下的是真正需要人工判断的工作。"
这里有一个重要的边界需要标注:"可提交"(commit-ready)描述的是修复的完成度——它已经包含了代码变更和依赖分析,工程师可以直接提交。但官方案例没有披露这些修复在进入生产环境之前是否必须经过人工审批、自动化测试套件或回滚检查。"可提交"不等于"已安全部署"。
DataHub 判断:Kai 案例中最值得关注的设计选择是交付单位的变化——从"需要人工继续研究的发现"推进到"带有环境判断和后续动作的调查结果"。这不仅涉及分析速度,也改变了人机分工的边界:机器负责调查和初步判断,人负责最终的部署决策和例外处理。但这个分工模型的实际运行效果——特别是人工复核的触发条件和频率——官方材料未披露。
三组结果数字:规模醒目,但各有不同的测量口径
官方案例披露了三组量化结果,每组来自不同的任务类型和范围,不应合并解读。
结果一:250 million 个漏洞的调查与分级
Kai 在 20 小时内调查并分级由企业扫描器发现的 2.5 亿个漏洞,其中 83% 被判定为无害(benign),对可利用的发现触发自动修复。该披露没有说明涉及多少客户或环境,也没有给出抽样复核方法、误判率或独立验证结果。
结果二:2.5 million 个 SCA 发现的误报消除
在一个全球 1000 强客户的实例中,Kai 在不到一小时内处理来自 5,000 个容器镜像的 250 万个软件成分分析(SCA)发现,其中 99.5% 被判定为误报。这是特定工作负载的结果,漏报率、人工复核比例和误报判定标准均未披露。
结果三:年度工时节省估算
同一客户实例中,官方案例估算相关分级工作每年节省约 300 万个工程与安全工时。该数字是 Kai 官方估算,不是审计后的财务或人效结果;其人力基线、重复发现处理方式和估算公式没有公开。
当攻击端的响应时间也被提及时,官方案例还称 Kai 将零日和供应链攻击的响应时间从数天或数周缩短到数分钟——包括识别所有受影响资产、生成缓解步骤和自主启动威胁狩猎。但这一陈述没有附带具体的时间对比数据或测量方法。
这个案例真正展示的模式,以及它还不能证明的事
可迁移的决策原则
Kai 案例中最值得其他团队借鉴的,不是处理规模的数字,而是三个架构层面的决策逻辑:
第一,在模型之前设置确定性约束层。Kai 没有把原始数据直接交给大语言模型,而是先用规则驱动的算法完成清洗、去重和验证。这个设计选择的核心逻辑是:模型擅长推理和关联,但不擅长处理脏数据——脏数据进入模型后,错误会被放大而非被纠正。对于任何需要在大规模非结构化数据上使用 AI 的场景,"先约束输入质量,再让模型参与分析"都是一个值得认真考虑的架构模式。
第二,改变交付单位而非仅提升处理速度。Kai 的目标不是"更快地生成漏洞报告",而是把交付物从"需要人工继续研究的发现"推进到"带有环境判断和依赖分析的可提交修复"。这意味着人机分工的边界发生了根本变化:机器承担了调查和初步判断的工作,人的角色从"逐项调查"转变为"审核和部署决策"。
第三,将模型访问路径视为独立的安全决策。Kai 明确区分了"选择哪个模型"和"通过什么路径访问模型"两个决策,并将后者定位为安全决策而非实施细节。对于处理敏感数据的企业应用,这种分离有助于在模型能力评估和安全合规评估之间保持清晰的责任边界。
读者需要注意的局限
证据来源的单一性。本案例的所有信息来自 Anthropic 发布的官方客户案例,即模型供应商发布的客户成功故事。没有第三方独立验证、同行评审或公开的测试数据集。读者应将这些结果理解为"供应商与客户共同披露的成果",而非经过独立审计的基准测试。
关键运营细节的缺失。官方案例没有披露:智能体的具体数量和编排逻辑;Sonnet 与 Opus 之间的任务分配规则;误报判定的具体标准和人工复核比例;修复进入生产环境前的审批、测试和回滚机制;年度工时节省估算的基线和计算方法。这些缺失使得读者无法评估系统在实际运营中的可靠性和安全性。
结果的可迁移性未知。披露的结果来自特定客户、特定工作负载和特定时间窗口。99.5% 的误报消除率是在 SCA 场景下、针对 5,000 个容器镜像实现的,不能直接推广到其他安全领域或其他规模的环境。不同企业的扫描器配置、资产复杂度和安全策略差异可能导致完全不同的结果。
完整证据来源与未披露信息清单
主要来源:Anthropic,Kai Claude Platform case study。原文发布日期未标注。
未披露的关键信息:
- 模型并行测试的候选模型名称、测试集、样本量和各项评分
- 确定性处理层的具体算法、验证规则和自身错误率
- 调查智能体的数量、编排逻辑和任务分配规则
- Claude Sonnet 与 Opus 的任务分配比例和切换条件
- 误报/漏报判定标准和人工复核比例
- 可提交修复进入生产前的审批、测试和回滚机制
- 250M 漏洞调查涉及的客户数量和环境数量
- 年度 3M 工时节省估算的人效基线和计算公式
- 零日响应时间缩短的具体测量方法和对比数据
补充信息与证据说明(2)
编辑旁注:AI 原生 vs. AI 增强
Bolzoni 在案例中将 Kai 描述为"AI 原生"平台——"对我们来说,没有'之前'"。这与在现有安全工具上叠加 AI 层的路径形成对比。AI 原生意味着架构从一开始就围绕模型能力设计,但也意味着没有传统工具积累的规则库和运营经验作为后备。这个取舍在案例中未被讨论。
编辑旁注:证据等级
本案例的证据等级为 B 级(模型厂商官方客户案例)。数据由 Kai 与 Anthropic 共同披露,缺少第三方误报复核、漏报率测量和独立攻击对照。读者在引用具体数字时,应同时引用其测量口径和未披露信息。