AI资讯 / 产业

产业 / 媒体

数据移动成为新瓶颈

MIT Technology Review

AI推理时代已经到来,医疗系统实时分析海量数据、智能助手同时处理数千个复杂请求,这些场景对基础设施提出了全新要求。传统企业IT架构建立在相对稳定的假设之上,但推理与智能体AI带来了延迟、数据移动、可扩展性等新维度的挑战,使架构选择的后果更加深远。行业分析师Jim McGregor指出,AI并非单一工作负载,而是数十亿种不同负载的集合,每种负载对系统层面的要求各不相同。在这一背景下,数据中心必须将计算、内存、存储与网络视为一个协同整体来设计,而非各自优化的孤立模块。检索增强生成等技术的普及,使数据移动效率成为决定AI系统竞争力的关键变量,延迟不再只是技术缺陷,更直接影响业务声誉与用户信任。

AI推理工作负载与此前以训练为核心的部署模式截然不同。推理任务是持续性的、地理上分散的,且对响应时间极为敏感。这意味着企业不能再将内存和存储视为辅助硬件,而必须将其置于系统架构的核心位置。数据管道需要具备快速摄取、清洗、转换、存储、移动和交付数据的能力,任何环节的滞后都会直接影响AI服务的质量与成本。

Tirias Research创始人兼首席分析师Jim McGregor强调,数据中心如今必须支持持续、分布式且日益实时的AI服务,而这些服务从系统层面来看各有不同需求。他指出,优化AI基础设施的关键在于深入理解具体工作负载的特征,围绕计划运行的负载类型来优化整个网络,包括内存与存储,而不是追求通用的「AI就绪」状态,否则容易在某些领域过度投入,同时在真正的瓶颈处留下隐患。

随着企业部署先进的推理和智能体系统,实时查询的数据量使数据移动成为最紧迫的制约因素。检索增强生成技术要求系统持续扫描海量数据库以生成准确响应,这不仅需要强大的计算能力,更需要对数据的即时访问能力。McGregor表示,当前最核心的工作是将数据从一处高效移动到另一处,并确保能够有效利用这些数据,内存带宽、缓存策略与存储邻近性因此成为决定AI系统性能的关键变量。

最有效的AI基础设施并非由各自最优的零件堆砌而成,而是计算、内存、存储与网络之间的平衡系统。McGregor指出,瓶颈往往会从一个层级迁移到下一个层级,因此必须将四者作为整体来架构设计。在机器人、金融服务、医疗和面向用户的AI系统中,延迟不仅是技术层面的不完美,更可能危及安全性、响应能力或用户信任,AI基础设施的性能已成为企业声誉管理的重要组成部分。

在采购框架层面,规划AI基础设施不能简单等同于选择最快的硬件,而是要在不将组织锁定于可能迅速过时的假设前提下实现可扩展性。McGregor建议企业保持灵活性,因为工作负载需求和技术本身都在快速变化。具体而言,企业应明确所要优化的AI工作负载类型,构建计算、内存、存储、电力与冷却的模块化架构,并与完整的供应商和集成商生态系统合作,以降低供应风险,确保在需求变化时能够灵活调整容量,而非过早锁定僵化的架构方案。

要点

  • AI推理工作负载是数十亿种不同负载的集合,要求企业对具体工作负载有深入理解,而非追求通用的AI就绪状态
  • 数据移动效率已超越原始算力,成为AI系统性能的核心瓶颈,内存带宽与存储邻近性是关键竞争变量
  • 计算、内存、存储与网络必须作为协同整体进行架构设计,孤立优化任何单一层级都会导致瓶颈转移
  • 在医疗、金融、机器人等领域,AI系统的延迟直接影响安全性与用户信任,基础设施性能已上升为声誉管理议题
  • 未来AI基础设施规划应优先保持模块化与灵活性,避免过早锁定可能迅速过时的架构假设
查看原始来源

原始标题:Architecting memory and storage in the AI era

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。