一家交易所公司,为什么先卡在嵌入这一步
Nasdaq 自 1971 年起在资本市场担任基础设施角色,为超过 130 个全球市场提供交易、结算、金融犯罪和监管报送方面的技术支持。这类业务的共同特征是:延迟不是体验问题,而是可用性问题。一个在演示里表现良好、在真实环境里慢半拍的系统,在这里通常等于不可用。
该公司近期自建了一套 AI 平台,明确把性能、准确性和成本效率作为三个并列目标。这三项放在一起本身就是一种取舍声明:不是先追求能力上限,而是要求平台在被大量员工日常使用时仍然算得过账。
平台上线初期暴露的问题集中在处理速度和运营成本两处,其中嵌入操作尤其缓慢。对一个高性能环境而言,这个瓶颈的位置相当尴尬——它既不在模型推理的显眼位置,也不在用户界面上,而是藏在数据进入检索系统之前的那一段。用户感受到的是"平台反应慢",工程团队看到的却是嵌入队列和账单同时上涨。
Michael O'Rourke,Nasdaq 负责 AI 与新兴技术的高级副总裁,把这套平台的意义描述为一种整合能力:"在 Nasdaq,我们是一家技术平台公司,AI 有能力把我们所有不同的业务和产品统一起来。"这句话解释了为什么公司愿意为一个内部平台改造底层技术栈,而不是让各业务线各自采购工具。
场景证据
Nasdaq 生成式 AI 平台
把嵌入从托管服务搬回自托管 GPU
随着平台使用量增长,成本和延迟同步上升,嵌入操作是最集中的压力点。Nasdaq 的处理方式是改变嵌入的运行位置:通过 NVIDIA NIM 实施自托管 GPU 嵌入,从而显著降低费用并优化资源使用。
这个决定的技术含义比"换个供应商"更具体。在与此前的托管服务嵌入方案对比时,Nasdaq 观察到的直接变化是每个 chunk 的处理时间下降。chunk 是文档被切分后送入嵌入模型的最小单位,它的处理时间决定了整个语料库多久能重新索引一遍。官方材料把这项时间节省与另一个结果连起来:它使数据索引可以更频繁进行,从而让 agents 和 skills 始终拿到较新的信息。换句话说,这不只是响应变快,而是知识新鲜度的约束被松开了。
检索侧使用的是 NeMo Retriever microservices,官方描述其作用是增强搜索能力,带来更准确、更相关的结果。NeMo Retriever 本身是一组生成式 AI 微服务,用于把自定义模型连接到多样的业务数据。平台的灵活性、部署便利性和可扩展性,配合 NVIDIA L40 GPU 这类硬件,使 Nasdaq 能够管理大量数据并执行高负载 AI 任务。
NIM 在这套结构里承担两个角色。一是优化 AI 模型的部署和管理,使平台能以较低延迟处理高并发请求;二是提供模型性能的实时洞察,让团队能快速定位并处理数据索引缓慢、响应不准确这类问题。负责软件工程的高级总监 Eric Reiser 对部署环节的评价很直接:"我们发现 NIM 架构非常易用,它提供了一条快速部署 AI 模型的直接路径。"
成本侧还有一项结构性安排:平台采用 NVIDIA AI Enterprise 的订阅模式,官方将其价值表述为成本可预测、扩容时不必承担财务不确定性,并指出这对需要管理预算的金融机构是必要条件。具体的基础设施支出、节省金额和绝对延迟数值,官方材料未披露。
系统结构
从业务数据到对话界面:平台的处理链与观测回路
四场黑客松如何变成路线图的决策依据
Nasdaq 没有先做架构评审再推广,而是先让人用。公司组织了四场全球黑客松作为 AI 平台的概念验证,每个区域持续三天,参与者同时包括程序员和非程序员,构建方向集中在聊天机器人和其他 AI 应用。
这套安排的关键在于测试是实时的。活动期间团队直接在平台上操作,对功能和性能给出即时反馈,而这些反馈指向的改进方向正是准确性和数据索引速度——与前一节工程侧感受到的瓶颈完全对上。也就是说,业务用户的抱怨和技术团队的监控指标在同一场活动中被对齐了,这比事后收集需求要省一轮争论。
活动产生了数百个 hack,为构建平台潜在投资回报的判断提供了数据基础。部门分布上,工程部门有 50 个 hack 聚焦内部流程改进,客户服务部门有 30 个 hack 用于创建聊天机器人。市场团队在使用量上领先,法务团队则把注意力放在风险管理和监管合规上。这个分布本身就是一份需求地图:合规部门参与的方式与工程部门不同,前者关心边界,后者关心效率。
黑客松结束后,Nasdaq 优先实施影响力最大的 hacks,并让这批方案决定整个 AI 采用路线图。这是本案例中最值得注意的治理动作——路线图的排序权来自真实使用产出,而不是自上而下的功能规划。官方材料同时指出,黑客松凸显了需要立即把 AI 服务推入生产、直接利用概念验证阶段的洞察。
用户在活动中提出的关键需求包括:更多数据连接能力、与其他工具的集成、以及通过 API 层与平台对话的能力。平台随后被设计为支持无代码数据集成和便捷的 API 链接。50 个工程 hack 和 30 个客户服务 hack 中最终有多少进入生产、持续使用或被下线,官方材料未披露。
实施与人机分工
谁在哪一步做决定:黑客松到生产的角色泳道
三个"30%"分别指什么,不能合并成一个结论
官方材料里出现了三处 30%,它们的测量对象并不相同,合并阅读会得出比实际更强的结论。
第一处是响应时间:平台响应时间加快 30%,官方将其归因于处理与检索能力的提升。基线延迟、样本量和测试周期均未披露,因此无法判断这是端到端用户感知延迟,还是某一环节的处理耗时。第二处是准确性:聊天机器人和对话界面的准确性提高 30%,官方称这减少了人工干预需求、提升了用户满意度。准确性的定义、评测集、统计方法和分工作流的分项结果同样未披露——在缺少评测集说明的前提下,这个数字只能理解为企业自报口径。
第三处最容易被误读:官方在描述黑客松之后立即将 AI 服务推入生产时,提到这一举措带来 30% 的速度提升,同时结果改善、成本下降。材料没有说明它与前述响应时间指标是否属于同一次测量。把三个数字叠加成"整体提升 90%"是错误读法;把其中任一数字当作平均值或普遍水平,也超出了官方口径。
另有一项结果是相对比较而非百分比:与此前的托管服务嵌入方案相比,每个 chunk 的处理时间下降。这是本案例中唯一带明确对照组的表述,但官方未给出绝对数值。O'Rourke 对效果的描述停留在使用行为层面:"改善准确性对各个团队影响很大。转向 NeMo Retriever 和 NIM 让我们与平台的互动更多,因为它返回得更快——这意味着用户可以做更有意义的工作,并把平台纳入日常工作流。"Reiser 补充的判断偏向财务:"它带来了改善的速度,提升了用户体验,而或许最重要的是,它产生了足以支撑这项投资的长期可观节省。"具体节省金额未披露。
还有一组数字容易被错位引用。官方在展望部分提到 Nasdaq 的数据生态超过 160 PB,5,000 多家公司在其交易所上市,技术支撑 55 个以上国家的 135 个市场。这些是平台与业务的总体规模,不是当前 AI 系统已处理的数据量或已覆盖的市场数。同一段落中的 NeMo Retriever extraction 承接监管管线、多模态文本与图像处理、图像生成与多模态护栏、GPU 集群运行,官方均表述为计划或探索方向,当前实施状态未披露。
证据边界
已兑现、未定义、未披露与不能推出的结论
什么条件下这套做法能搬走
可迁移性最高的不是技术选型,而是排序方式:先用一轮真实使用把瓶颈和需求同时暴露出来,再让产出的影响力决定改造顺序。Nasdaq 的四场黑客松同时收到了准确性和索引速度两类反馈,这让业务抱怨和技术监控指向同一处,省掉了通常要花在需求争论上的一轮。前提是组织能容纳非程序员参与构建,并且平台已具备无代码集成和 API 链接这类降低门槛的能力——否则活动只会产出演示,不会产出决策依据。
嵌入从托管服务迁回自托管 GPU 的账,只在特定条件下算得过来:使用量已经上升到成本和延迟同时构成压力,且团队有能力承担 GPU 资源的部署与运维。Nasdaq 用订阅模式换取成本可预测性,这个安排对预算需要提前锁定的机构有参考价值,但官方未披露支出规模,无法据此估算门槛。
金融服务场景中最关键的一环,本案例恰好没有答案。访问控制、数据隔离、人工复核、审计和监管验证机制官方均未披露,而这些通常是同类项目能否上线的决定性条件。计划复现这套路径的团队,需要把这部分当作自己要独立设计和验证的工作,而不是当作已被本案例证明可行的部分。
补充信息与证据说明(1)
编辑说明与证据边界
本页企业事实、人物职务、技术组件与数字全部取自 NVIDIA 发布的 Nasdaq 客户案例,未引入其他来源。所有百分比均为企业自报口径,官方未提供基线、评测集、样本量与观察周期。
页内三张结构图为 DataHub 依官方文字叙述重绘,不代表 Nasdaq 内部真实系统图;随案例发布的平台图像仅作场景证据。
未获披露而对复现关键的内容包括:hack 的生产转化情况、平台当前活跃用户与请求量、访问控制与数据隔离方式、审计与监管验证机制、基础设施成本与节省金额、异常回退设计。官方在展望部分列出的监管管线卸载、多模态处理与图像生成属于计划,当前状态未披露。