产业 / 媒体
可在 iPhone 上本地运行的开放推理模型
PrismML 推出 Bonsai 27B,把基于阿里 Qwen3.6-27B 的 270 亿参数模型压缩到 3.9 GB 左右,足以在 iPhone 17 Pro Max 上本地运行。较大版本约 5.9 GB,面向笔记本。公司表示在 15 项基准测试中,小版本保留了原模型约 90% 的能力,较大版本达 95%,数学与编程能力几乎不受影响。PrismML 用 1 比特或略低于 2 比特的权重表示方法实现压缩,模型权重以 Apache 2.0 协议开源。CNBC 报道称苹果正在测试这项压缩技术以缩小本地 AI 差距。PrismML 计划下一步把该方案应用于 Google Gemma 系列。
由加州理工研究人员创立的 PrismML 正式发布 Bonsai 27B,这是一款基于阿里 Qwen3.6-27B 的 270 亿参数推理模型,最大亮点是可直接在 iPhone 上本地运行。该模型支持多步推理、工具调用、图像理解以及智能体任务,覆盖了当前主流端侧 AI 应用所需的核心能力。
原始 27B 模型通常占用约 54 GB 存储,即便经过常规压缩仍需 18 GB 左右。PrismML 通过将每个神经网络权重压缩至 1 比特或略低于 2 比特,并应用于整个语言模型,推出了两个大幅瘦身版本:较大版本约 5.9 GB,面向笔记本电脑;较小版本约 3.9 GB,可装入 iPhone 17 Pro Max。
PrismML 自评的 15 项基准测试显示,较大版本保留原模型 95% 的性能,较小版本保留 90%,数学与编程得分几乎不受影响。压缩更激进时,图像理解、指令遵循和智能体工具调用能力下降相对明显,但同等体积下 Bonsai 变体仍优于常规压缩的 Qwen3.6-27B。在 iPhone 17 Pro Max 上,小版本每秒可生成约 11 个 token,单次充电可生成约 6.7 万个 token。
PrismML 把端侧推理视为常驻智能体与离线助手的基础:本地运行能把循环调用的边际成本压到零,并避免屏幕内容、文档等隐私数据离开设备。简单和隐私敏感任务留在本地,仅把最复杂的步骤交给云端前沿模型处理。
据 CNBC 报道,PrismML 正在与苹果洽谈该压缩技术。PrismML CEO Babak Hassibi 确认苹果及其他公司正在测试模型的速度、功耗与表现,相关洽谈处于早期阶段但进展顺利。模型权重以 Apache 2.0 协议开源,并已提供限时免费的开发者预览 API 与 HuggingFace 演示。PrismML 计划下一步把同一压缩方案应用于 Google Gemma 系列。
要点
- Bonsai 27B 是基于 Qwen3.6-27B 的 270 亿参数开放推理模型,最小版本仅约 3.9 GB,可在 iPhone 17 Pro Max 本地运行。
- PrismML 用 1 比特或略低于 2 比特权重实现压缩,自评基准显示性能保留 90% 到 95%,数学与编程几乎不受影响。
- 模型权重以 Apache 2.0 协议开源,可在 Apple MLX 与 NVIDIA GPU 上运行,并提供限时免费开发者 API。
- CNBC 报道称苹果正在测试该压缩技术,可能用于缩小自家端侧 AI 与竞争对手的差距。
- PrismML 下一步计划把同一压缩方案扩展到 Google Gemma 系列。
原始标题:Bonsai 27B is a full open reasoning model that fits on an iPhone
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。