AI资讯 / 产业

产业 / 分析

AI算力供不应求,模型分层定价能否维系杰文斯悖论?

Tomer Tunguz

2026年第二季度财报季,谷歌、亚马逊、英伟达相继表示AI算力严重供不应求,需求旺盛态势预计延续至2028年。与此同时,HBM3e内存价格上涨20%,HBM4预计翻倍,但B200现货租赁价格基本持平。在供给紧张背景下,AI模型定价出现明显分化:Anthropic旗舰模型Fable 5定价每百万输出token 50美元,较上代翻倍;谷歌Gemini旗舰版四代间涨价8倍;而OpenAI则在五天内将GPT-5.6 Luna价格下调80%。分析人士指出,模型厂商正将市场切割为高端、中端与低价三个层级,以确保被高端价格挤出的工作负载能流向更低价的模型,从而维持GPU总使用时长的持续增长。路由层作为连接用户与模型的关键基础设施,战略价值日益凸显。

2026年第二季度财报季成为AI算力紧缺的集中表态时刻。谷歌CEO桑达尔·皮查伊表示公司仍处于供给受限状态,视之为需求旺盛的积极信号;亚马逊CEO安迪·贾西则直言,即便今年投入2200亿美元资本开支,2026年和2027年的算力仍将无法满足全部需求,而2028年的预订需求已令人震惊;英伟达CEO黄仁勋则称Blackwell芯片销售「爆表」,云端GPU全面售罄。三大巨头的表态共同勾勒出一幅算力极度稀缺的图景。

在硬件层面,供给紧张正在向内存市场传导。HBM3e价格已上涨约20%,下一代HBM4的价格预计将在此基础上再度翻倍。然而,B200 GPU的现货租赁价格目前仍基本持平,显示出市场对短期供给预期的复杂判断。这种硬件成本的上行压力,正在成为模型定价策略调整的重要背景变量。

模型定价层面的分化已十分明显。Anthropic于7月24日推出Fable 5,定价每百万输出token 50美元,较此前的Opus 5翻倍,刷新高端市场天花板;谷歌Gemini旗舰版从1.5美元涨至12美元,四代累计涨幅达8倍。与此形成对比的是,OpenAI在Fable 5发布五天后将GPT-5.6 Luna价格下调80%,此举被解读为抢占市场份额的战略动作,或是成本端出现实质性突破的信号。

面对价格上行压力,AI实验室正押注于市场分层策略来维系杰文斯悖论的运转逻辑。所谓杰文斯悖论,是指效率提升导致资源消耗总量反而增加的现象,此前一直是AI时代降本增量的核心叙事。当前市场已形成清晰的三层结构:高端层以Fable 5和Opus 5为代表,价格是低价层的13倍,但智能水平仅高出约20%;中端层以GPT-5.6 Sol和Kimi K3为代表,以40%的成本提供96%的前沿智能;低价层则从GLM-5.2延伸至DeepSeek V4 Flash,以高端层1%至5%的价格提供84%的智能水平。

在分层格局下,路由层正成为连接用户与模型的战略基础设施。路由器负责将应用查询自动分配至最合适的模型,可内嵌于模型内部、集成于客户软件,或作为独立中间件存在。对于大型实验室而言,若无法在三个价格层级均有布局,便会在路由竞价中因价格劣势而出局。对于初创公司而言,机会在于在大型实验室无法经济性覆盖的某个价格节点上建立壁垒——DeepSeek V4 Flash以每百万token 0.03美元的定价,已成为这一策略可行性的现实证明。分层定价的最终目的,是让GPU总使用时长持续增长,从而让杰文斯悖论在算力涨价的冲击下依然成立。

要点

  • 谷歌、亚马逊、英伟达三大巨头在2026年Q2财报季集体确认AI算力供不应求,需求旺盛态势预计延续至2028年。
  • HBM3e内存价格已涨20%,HBM4预计翻倍,硬件成本上行正向模型定价传导,高端模型价格出现大幅上涨。
  • 模型市场正形成高端、中端、低价三层结构,分层定价是维持GPU总消耗量增长、延续杰文斯悖论的核心机制。
  • 路由层成为分层市场的关键基础设施,大型实验室需在三个层级均有布局,初创公司则可在大厂无法经济性覆盖的价格节点建立竞争壁垒。
  • DeepSeek V4 Flash以每百万token 0.03美元的定价,证明了极低价格层级的商业可行性,对整个市场定价格局构成参照。
查看原始来源

原始标题:Racing to Sustain Jevons' Paradox

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。