银行与金融服务 · 知识工作与组织生产力

BBVA:18 个月把企业 AI 从 3,000 人推向 10 万人

从 3,000 人受控试点到覆盖全球组织,这篇案例拆解 BBVA 的决策顺序、人机分工,以及官方案例尚未回答的度量与控制问题。

BBVA × OpenAIChatGPT Enterprise · 自定义 GPT2024 年启动部署
企业与场景

BBVA,全球金融机构,服务欧洲、墨西哥、南美、土耳其和美国市场。场景为受监管企业的生成式 AI 规模化采用。

技术与供应商

ChatGPT Enterprise 与自定义 GPT,由 OpenAI 提供。2024 年启动部署,现覆盖超过 100,000 名员工。

核心决策

提供企业级访问而非封堵;治理先于部署;领导层与 champions 网络同时推动;部门自建工作流。

一家受监管银行面对的两难:禁止还是引导

BBVA 服务欧洲、墨西哥、南美、土耳其和美国市场,客户规模达数千万。对这样一家跨多个司法管辖区运营的机构来说,2024 年的问题不是"要不要用生成式 AI",而是员工已经在用了,银行打算怎么办。

合规压力让许多银行的第一反应是封堵。BBVA 选择相反的路径:主动提供安全的企业级访问和正式赋能计划,把未授权工具实验带来的风险从不可见变成可治理。前提是在开放访问之前,就让安全、法律、合规和技术团队坐到同一张桌子上,围绕信任、治理、结构化学习三个支柱定义框架。

2024 年首批部署覆盖多个国家和业务领域的 3,000 名员工。官方仅披露了这一覆盖范围,未说明选择这些国家和部门的标准,也未说明试点的验证目标——DataHub 判断这是一次受控试点,前提是它随后被扩大而非终止。

图 1
从治理框架到十万人部署的结构
BBVA 生成式 AI 扩展结构
图 1 为 DataHub 绘制的架构图。四层结构是 DataHub 依据官方披露内容归纳,BBVA 未公布这样的阶段划分。虚线框表示领导层培训与 champions 网络在原文中没有明确的先后次序。

扩展靠采用网络,工作流由部门自建

自上而下的部分是领导层示范:250 名领导者接受专门培训,其中包括首席执行官和董事长。自下而上的部分是 AI champions 网络和内部称为 AI wizards 的高级用户,前者做实操培训与工作流接入,后者识别高价值用例并搭原型。官方把领导层参与描述为采用的"主要加速器",但未给出它与 champions 网络的时间关系。

覆盖范围最终从 3,000 人扩展到超过 100,000 名员工。这是平台部署规模,即持有企业版访问权限的人数,不是日常活跃人数;同一份案例的结果概览另给出已部署员工的周活跃使用率超过 70%。

工作流由部门自己搭。员工创建了超过 20,000 个自定义 GPT,约 4,000 个被全球团队频繁使用。信用风险团队的 Credit Analysis Pro GPT 从年报、ESG 披露和媒体报道中提取非结构化数据,AI 做提取与结构化,风险判断仍在人。西班牙的法律助手协助处理分行经理每年提交的约 40,000 个客户法律咨询,由九人法律团队使用;官方只说该团队的人工检索时间大幅下降,未说明助手由谁构建。墨西哥客户体验团队用自定义 GPT 分析数千条开放式调查回复,提取情绪、主题和建议行动。

图 2
BBVA 与 OpenAI 的合作场景
BBVA 与 OpenAI 合作的官方展示图片
图 2 为官方图片,来源为 OpenAI 客户案例页面,仅作背景说明,不承担本文的分析任务。本文的三张分析图为图 1、图 3、图 4,均由 DataHub 绘制。

人机分工与未披露的控制细节

在已披露的四个工作流里,AI 都停在提取、分类和草拟,人保留判断和对外责任。但控制层的空白很明显:20,000 多个自定义 GPT 的质量审查与下线机制、跨部门跨国的数据权限边界、异常升级与回退流程,官方均未披露。回退指的是当 AI 草拟的法律回复或风险分析被发现有误时,业务如何切回纯人工处理并追溯已发出的内容——在受监管行业,缺少这一层意味着错误可能沿着分行沟通链条扩散后才被发现。

图 3
四个工作流的人机边界
BBVA 四个工作流的人机分工
图 3 由 DataHub 绘制。四行的人工职责按同一粒度描述:复核 AI 输出、做最终判断、承担对外责任。"未披露"列是官方材料中缺失、但受监管企业必须自行回答的控制项。

DataHub 建议:评估这套模式时,重点不是 20,000 个 GPT 的规模感,而是自己的组织能否回答上面的控制问题。缺少质量审查和回退机制的自定义 GPT 生态,在受监管行业可能比不用 AI 更危险。

结果口径与可参考的前提

官方结果概览给出三组数字,口径宽窄差别很大。周活跃使用率超过 70%,分母是已部署员工,未披露统计周期、绝对人数和地区差异。每人每周约节省 3 小时缺少样本量、岗位分布、测量方法和基线定义,只能当方向性参考,不能用于 ROI 计算。秘鲁内部助手覆盖当地超过 3,000 名员工,平均查询处理时间从约 7.5 分钟降至约 1 分钟,是三组中范围最窄的一组。

官方把工作流效率提升表述为"最高达 80%"。DataHub 计算:7.5 分钟降至 1 分钟约为 87% 的缩减,与 80% 不完全一致;官方未说明两者的换算关系,也未列出其他达到该水平的工作流,因此不宜把 80% 当作多个场景的汇总。处理时间缩短同样不等于回复质量不变,原文未披露准确性评估方式。

图 4
结果口径与证据边界
三组结果数字的口径与不能推出的结论
图 4 由 DataHub 绘制,承担结果口径与证据边界。虚线框内的 87% 是 DataHub 换算,不是官方说明。

可参考的不是产品选择,而是决策顺序:治理框架先于工具部署,领导层示范与采用网络同时推动,部门自建先于中央统一。想复现的企业需要验证三个前提:能否在部署前让安全、法律、合规和技术团队达成共识;是否有足够的中层推动者愿意在本职之外承担培训与用例识别;GPT 数量从几十增长到数千时,能否做质量审查与权限管理。

DataHub 建议:员工万人以下、合规团队尚未建立 AI 评估能力的企业,直接复制全组织铺开的风险较高。更稳妥的起点是在一到两个部门跑完治理、部署、度量的闭环,用自己的效率数据和风险事件记录决定是否扩展。前提是本案例数字缺少样本、周期与测量方法,且无独立验证,不宜直接作为立项依据。

DataHub 判断:复制这套做法的前提,首先是把安全、法律、合规与技术团队放进同一张决策桌,在扩大覆盖之前先形成企业级访问的统一入口,否则员工会自行流向消费级工具,权限与数据边界从第一天起就失控。其次需要一层可运营的内部网络:具备实操能力的推广者、能把工作流拆解成可复用助手的进阶用户,以及愿意亲自受训的高层,三者缺一,采用就会停在开通账号的层面。数据侧的前提同样具体,法律、风险、客户体验这类部门要能合法调取自己的非结构化材料并明确留存与访问规则,才谈得上把专业知识沉淀成可交付的自定义助手。

公开材料未披露的边界比已公布的数字更值得注意:官方案例没有说明周活跃口径的统计周期、绝对人数与部门分布,也没有交代每周节省时间的样本量、岗位差异以及数据来自员工自报还是系统采集,所选工作流的效率提升同样缺少基线定义。数万个自定义助手的质量审查、下线机制与权限治理,公开材料未披露;部署成本、模型调用规模与安全事件记录亦然。DataHub 判断:迁移前的验证应自建口径,先在两三个高频流程上记录人工基线耗时与返工率,再按相同定义对比助手介入后的结果,并对涉及客户与风险判断的输出保留抽样复核。路线图中的长期目标属于意图声明,不能当作已完成的业务成果来对标。

补充信息与证据说明(1)
编辑说明与证据边界

本文企业事实与数字均来自 OpenAI 官方客户案例(2026 年 6 月 11 日发布)。证据等级 B:供应商官方案例,未见独立第三方审计,BBVA 未单独发布技术白皮书。

官方未披露:周活跃率的统计周期与绝对人数;3 小时的样本量与测量方法;20,000 多个自定义 GPT 的质量审查与下线机制;法律助手的知识源边界与构建方;部署成本与安全事件数据。

标注为 DataHub 判断、计算或建议的内容为编辑分析,不代表 BBVA 或 OpenAI 立场。四层实施结构和 87% 换算均属编辑归纳。The Eight 路线图是长期愿景,不能视为已实现的业务结果。