AI资讯 / 产业

产业 / 媒体

PrismML 用极小模型挑战大模型霸权,本地运行或成现实

TechCrunch AI

AI 初创公司 PrismML 正在押注一个颠覆性命题:高性能推理大语言模型不必真的「大」。该公司由加州理工学院教授 Babak Hassibi 领衔,核心团队均来自 Caltech,并获得 Khosla Ventures、Cerberus Capital 等机构共计 2225 万美元种子轮融资。其最新发布的 Bonsai 2 27B 模型,将阿里巴巴开源模型 Qwen3.8 27B 压缩至 5.9 GB,内存占用缩减约 9 至 10 倍,已可在普通 PC 乃至高端智能手机上本地运行。在基准测试中,该模型保留了原始模型 98% 的综合得分,较数月前发布的第一代 Bonsai 的 95% 进一步提升。公司表示,首代模型已累计下载超过 1100 万次,更小尺寸的衍生模型也获得约 260 万次下载,显示市场对本地化 AI 推理的强烈需求。

PrismML 的核心技术路径是对模型「权重」进行极致压缩。传统 LLM 中每个权重需要 16 位存储空间,而 PrismML 采用所谓「三值权重」方法,将每个权重简化为 +1、-1 或 0 三种状态,从而大幅削减模型体积。最新发布的 Bonsai 2 27B 正是基于这一技术,将 Qwen3.8 27B 从原始体量压缩至 5.9 GB,实现了约 9 至 10 倍的内存缩减,同时在综合基准测试中保留了 98% 的原始性能。

Hassibi 坦言,压缩技术在理论上难以实现 100% 的基准性能对等,但他认为这在实际应用中并不构成障碍。LLM 本身在未压缩状态下也并非完全精准,而基准测试也无法完美映射真实使用场景,因此 2% 的性能差距在日常任务中几乎感知不到。此外,模型运行所依赖的外围软件框架同样对实际表现有显著影响,单纯的基准数字并不能说明全部问题。

PrismML 并非 LLM 压缩领域的唯一玩家。总部位于西班牙的 Multiverse Computing 同样深耕这一赛道,且已完成规模更大的融资。但 Hassibi 强调,PrismML 的差异化优势在于压缩后的性能损耗极低,这一点在 Bonsai 系列从第一代到第二代的迭代中已有明显体现。公司顾问 Ion Stoica 是 Databricks 联合创始人,也是伯克利 Sky Computing Lab 的负责人,其背书进一步强化了 PrismML 的技术公信力。

在商业化层面,PrismML 据传正与苹果洽谈合作,但 Hassibi 对此拒绝置评。从技术路线来看,将高性能推理模型部署至苹果设备的逻辑十分清晰:苹果长期致力于在端侧运行 AI 功能,而 PrismML 的压缩技术恰好能够满足这一需求。若合作落地,将为双方带来显著的战略价值,也将加速本地 AI 推理的普及进程。

展望未来,PrismML 计划在未来数月内将压缩技术扩展至数千亿参数量级的更大模型。Hassibi 指出,模型规模越大,压缩时保留智能的空间反而越充裕,因此更大模型更容易接近 100% 的性能保留率。顾问 Stoica 对此表示乐观:「你将在指尖拥有智能,而且它是免费的,因为它运行在你已经购买的设备上,同时也是私密的,因为数据不会被发送到云端。」这一愿景若能实现,将从根本上改变 AI 的使用方式与商业模式。

要点

  • PrismML 的三值权重压缩技术可将主流开源模型体积缩减 9 至 10 倍,使其可在 PC 和高端智能手机上本地运行。
  • 最新 Bonsai 2 27B 模型在综合基准测试中保留了原始 Qwen3.8 27B 模型 98% 的性能,较上一代提升 3 个百分点。
  • 首代 Bonsai 模型已累计下载超 1100 万次,验证了市场对本地化轻量推理模型的强烈需求。
  • 公司下一步计划将压缩技术应用于数千亿参数的超大模型,并预期更大模型的性能保留率将更高。
  • 本地运行 AI 模型意味着用户无需将数据上传至云端,在隐私保护和使用成本方面具有显著优势。
查看原始来源

原始标题:PrismML hopes its tiny LLM will change how we all use AI

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。