Financial Services · Generative AI / LLMs

Nasdaq:如何检验 AI 市场运营平台

一家从 1971 年起服务资本市场的技术平台公司,在自建生成式 AI 平台后遇到的第一个障碍不是模型能力,而是嵌入太慢、成本太高。它选择先用四场全球黑客松把真实使用压力提前暴露出来,再决定改造哪一段技术栈。

企业:Nasdaq核心技术:NVIDIA NeMo Retriever、NVIDIA NIM microservices、NVIDIA AI Enterprise验证方式:四场全球黑客松,每个区域三天,程序员与非程序员共同参与

决策起点

自建 AI 平台后,首个障碍出现在嵌入环节:处理速度慢、运营成本高,在高性能环境中不可接受。三项并列目标是性能、准确性与成本效率。

验证方式

四场全球黑客松,每区域三天,程序员与非程序员共同参与,产出数百个 hack。影响力最大的方案决定了后续 AI 采用路线图。

技术栈

NVIDIA NeMo Retriever 微服务负责检索,NVIDIA NIM 负责自托管 GPU 嵌入与模型部署管理,运行在 NVIDIA L40 GPU 上,采购经 NVIDIA AI Enterprise 订阅。

一家交易所公司,为什么先卡在嵌入这一步

Nasdaq 自 1971 年起在资本市场担任基础设施角色,为超过 130 个全球市场提供交易、结算、金融犯罪和监管报送方面的技术支持。这类业务的共同特征是:延迟不是体验问题,而是可用性问题。一个在演示里表现良好、在真实环境里慢半拍的系统,在这里通常等于不可用。

该公司近期自建了一套 AI 平台,明确把性能、准确性和成本效率作为三个并列目标。这三项放在一起本身就是一种取舍声明:不是先追求能力上限,而是要求平台在被大量员工日常使用时仍然算得过账。

平台上线初期暴露的问题集中在处理速度和运营成本两处,其中嵌入操作尤其缓慢。对一个高性能环境而言,这个瓶颈的位置相当尴尬——它既不在模型推理的显眼位置,也不在用户界面上,而是藏在数据进入检索系统之前的那一段。用户感受到的是"平台反应慢",工程团队看到的却是嵌入队列和账单同时上涨。

Michael O'Rourke,Nasdaq 负责 AI 与新兴技术的高级副总裁,把这套平台的意义描述为一种整合能力:"在 Nasdaq,我们是一家技术平台公司,AI 有能力把我们所有不同的业务和产品统一起来。"这句话解释了为什么公司愿意为一个内部平台改造底层技术栈,而不是让各业务线各自采购工具。

场景证据

Nasdaq 生成式 AI 平台

Nasdaq 生成式 AI 平台界面示意
官方材料中随案例发布的平台图像,用于说明这是一套面向内部员工的实际产品形态,而非概念示意。图中未标注具体架构层级、权限模型和部署拓扑,因此本页后续的结构图均为 DataHub 依据官方文字叙述重绘,不代表 Nasdaq 内部真实系统图。

把嵌入从托管服务搬回自托管 GPU

随着平台使用量增长,成本和延迟同步上升,嵌入操作是最集中的压力点。Nasdaq 的处理方式是改变嵌入的运行位置:通过 NVIDIA NIM 实施自托管 GPU 嵌入,从而显著降低费用并优化资源使用。

这个决定的技术含义比"换个供应商"更具体。在与此前的托管服务嵌入方案对比时,Nasdaq 观察到的直接变化是每个 chunk 的处理时间下降。chunk 是文档被切分后送入嵌入模型的最小单位,它的处理时间决定了整个语料库多久能重新索引一遍。官方材料把这项时间节省与另一个结果连起来:它使数据索引可以更频繁进行,从而让 agents 和 skills 始终拿到较新的信息。换句话说,这不只是响应变快,而是知识新鲜度的约束被松开了。

检索侧使用的是 NeMo Retriever microservices,官方描述其作用是增强搜索能力,带来更准确、更相关的结果。NeMo Retriever 本身是一组生成式 AI 微服务,用于把自定义模型连接到多样的业务数据。平台的灵活性、部署便利性和可扩展性,配合 NVIDIA L40 GPU 这类硬件,使 Nasdaq 能够管理大量数据并执行高负载 AI 任务。

NIM 在这套结构里承担两个角色。一是优化 AI 模型的部署和管理,使平台能以较低延迟处理高并发请求;二是提供模型性能的实时洞察,让团队能快速定位并处理数据索引缓慢、响应不准确这类问题。负责软件工程的高级总监 Eric Reiser 对部署环节的评价很直接:"我们发现 NIM 架构非常易用,它提供了一条快速部署 AI 模型的直接路径。"

成本侧还有一项结构性安排:平台采用 NVIDIA AI Enterprise 的订阅模式,官方将其价值表述为成本可预测、扩容时不必承担财务不确定性,并指出这对需要管理预算的金融机构是必要条件。具体的基础设施支出、节省金额和绝对延迟数值,官方材料未披露。

系统结构

从业务数据到对话界面:平台的处理链与观测回路

Nasdaq AI 平台端到端处理链示意
官方披露的部分:数据接入方式、嵌入运行位置、检索组件、NIM 的双重角色、每 chunk 处理时间下降与索引频率提升的因果链条。DataHub 重绘的部分:模块边界的划分方式、回路箭头方向和"未披露"清单的归类。图中不含任何官方未提及的组件。

四场黑客松如何变成路线图的决策依据

Nasdaq 没有先做架构评审再推广,而是先让人用。公司组织了四场全球黑客松作为 AI 平台的概念验证,每个区域持续三天,参与者同时包括程序员和非程序员,构建方向集中在聊天机器人和其他 AI 应用。

这套安排的关键在于测试是实时的。活动期间团队直接在平台上操作,对功能和性能给出即时反馈,而这些反馈指向的改进方向正是准确性和数据索引速度——与前一节工程侧感受到的瓶颈完全对上。也就是说,业务用户的抱怨和技术团队的监控指标在同一场活动中被对齐了,这比事后收集需求要省一轮争论。

活动产生了数百个 hack,为构建平台潜在投资回报的判断提供了数据基础。部门分布上,工程部门有 50 个 hack 聚焦内部流程改进,客户服务部门有 30 个 hack 用于创建聊天机器人。市场团队在使用量上领先,法务团队则把注意力放在风险管理和监管合规上。这个分布本身就是一份需求地图:合规部门参与的方式与工程部门不同,前者关心边界,后者关心效率。

黑客松结束后,Nasdaq 优先实施影响力最大的 hacks,并让这批方案决定整个 AI 采用路线图。这是本案例中最值得注意的治理动作——路线图的排序权来自真实使用产出,而不是自上而下的功能规划。官方材料同时指出,黑客松凸显了需要立即把 AI 服务推入生产、直接利用概念验证阶段的洞察。

用户在活动中提出的关键需求包括:更多数据连接能力、与其他工具的集成、以及通过 API 层与平台对话的能力。平台随后被设计为支持无代码数据集成和便捷的 API 链接。50 个工程 hack 和 30 个客户服务 hack 中最终有多少进入生产、持续使用或被下线,官方材料未披露。

实施与人机分工

谁在哪一步做决定:黑客松到生产的角色泳道

黑客松到生产实施的角色分工泳道图
官方披露的部分:黑客松场次与形式、参与者构成、两个部门的 hack 数量、反馈内容、按影响力挑选实施项并据此定路线图、NIM 提供实时性能洞察。DataHub 重绘的部分:四阶段的切分、三条泳道的角色归类、箭头顺序。上线审批人、验收标准和回退机制官方未披露,图中以边界说明标出,未替企业补写。

三个"30%"分别指什么,不能合并成一个结论

官方材料里出现了三处 30%,它们的测量对象并不相同,合并阅读会得出比实际更强的结论。

第一处是响应时间:平台响应时间加快 30%,官方将其归因于处理与检索能力的提升。基线延迟、样本量和测试周期均未披露,因此无法判断这是端到端用户感知延迟,还是某一环节的处理耗时。第二处是准确性:聊天机器人和对话界面的准确性提高 30%,官方称这减少了人工干预需求、提升了用户满意度。准确性的定义、评测集、统计方法和分工作流的分项结果同样未披露——在缺少评测集说明的前提下,这个数字只能理解为企业自报口径。

第三处最容易被误读:官方在描述黑客松之后立即将 AI 服务推入生产时,提到这一举措带来 30% 的速度提升,同时结果改善、成本下降。材料没有说明它与前述响应时间指标是否属于同一次测量。把三个数字叠加成"整体提升 90%"是错误读法;把其中任一数字当作平均值或普遍水平,也超出了官方口径。

另有一项结果是相对比较而非百分比:与此前的托管服务嵌入方案相比,每个 chunk 的处理时间下降。这是本案例中唯一带明确对照组的表述,但官方未给出绝对数值。O'Rourke 对效果的描述停留在使用行为层面:"改善准确性对各个团队影响很大。转向 NeMo Retriever 和 NIM 让我们与平台的互动更多,因为它返回得更快——这意味着用户可以做更有意义的工作,并把平台纳入日常工作流。"Reiser 补充的判断偏向财务:"它带来了改善的速度,提升了用户体验,而或许最重要的是,它产生了足以支撑这项投资的长期可观节省。"具体节省金额未披露。

还有一组数字容易被错位引用。官方在展望部分提到 Nasdaq 的数据生态超过 160 PB,5,000 多家公司在其交易所上市,技术支撑 55 个以上国家的 135 个市场。这些是平台与业务的总体规模,不是当前 AI 系统已处理的数据量或已覆盖的市场数。同一段落中的 NeMo Retriever extraction 承接监管管线、多模态文本与图像处理、图像生成与多模态护栏、GPU 集群运行,官方均表述为计划或探索方向,当前实施状态未披露。

证据边界

已兑现、未定义、未披露与不能推出的结论

案例结果的证据强度分层示意
官方披露的部分:各项结果的原始措辞与归因方式。DataHub 重绘的部分:按证据强度分成四层,并把"不能推出"的错误读法单列。最底层内容不是官方否认的结论,而是现有材料不足以支持的推断。

什么条件下这套做法能搬走

可迁移性最高的不是技术选型,而是排序方式:先用一轮真实使用把瓶颈和需求同时暴露出来,再让产出的影响力决定改造顺序。Nasdaq 的四场黑客松同时收到了准确性和索引速度两类反馈,这让业务抱怨和技术监控指向同一处,省掉了通常要花在需求争论上的一轮。前提是组织能容纳非程序员参与构建,并且平台已具备无代码集成和 API 链接这类降低门槛的能力——否则活动只会产出演示,不会产出决策依据。

嵌入从托管服务迁回自托管 GPU 的账,只在特定条件下算得过来:使用量已经上升到成本和延迟同时构成压力,且团队有能力承担 GPU 资源的部署与运维。Nasdaq 用订阅模式换取成本可预测性,这个安排对预算需要提前锁定的机构有参考价值,但官方未披露支出规模,无法据此估算门槛。

金融服务场景中最关键的一环,本案例恰好没有答案。访问控制、数据隔离、人工复核、审计和监管验证机制官方均未披露,而这些通常是同类项目能否上线的决定性条件。计划复现这套路径的团队,需要把这部分当作自己要独立设计和验证的工作,而不是当作已被本案例证明可行的部分。

补充信息与证据说明(1)

编辑说明与证据边界

本页企业事实、人物职务、技术组件与数字全部取自 NVIDIA 发布的 Nasdaq 客户案例,未引入其他来源。所有百分比均为企业自报口径,官方未提供基线、评测集、样本量与观察周期。

页内三张结构图为 DataHub 依官方文字叙述重绘,不代表 Nasdaq 内部真实系统图;随案例发布的平台图像仅作场景证据。

未获披露而对复现关键的内容包括:hack 的生产转化情况、平台当前活跃用户与请求量、访问控制与数据隔离方式、审计与监管验证机制、基础设施成本与节省金额、异常回退设计。官方在展望部分列出的监管管线卸载、多模态处理与图像生成属于计划,当前状态未披露。