研究 / 官方
SGLang 为 Muse Glimmer 提供首日支持,这款多模态模型专为本地智能体工作流而生
Meta Superintelligence Labs 与 SGLang 团队宣布合作,为多模态模型 Muse Glimmer 提供首日(Day-0)推理支持,并针对本地硬件上的智能体工作流进行了专项优化。Muse Glimmer 是一款拥有 300 亿参数的密集型多模态模型,支持超过 128k token 的上下文窗口,由 279 亿参数的文本解码器、19 亿参数的视觉编码器(ViT)以及基于 GELU 的多模态投影层构成。SGLang 为其提供了 DFlash 推测解码、RadixAttention 前缀缓存和可中断 CUDA 图等原生优化能力。在 NVIDIA GeForce RTX 5090 上,采用 NVFP4 精度配合 DFlash 推测解码,总输出吞吐量可达每秒 1452 token,单用户解码速度达每秒 236 token。该模型同时支持 Apple Silicon 设备,通过 MLX 后端实现高性能本地部署,覆盖从消费级显卡到工作站的多种硬件平台。
Muse Glimmer 是 Meta Superintelligence Labs 推出的一款 300 亿参数多模态密集模型,专为在本地硬件上运行端到端智能体工作流而设计。其架构由三部分组成:279 亿参数的文本解码器、19 亿参数的视觉变换器(ViT)以及基于 GELU 激活函数的多模态投影层。文本解码器包含 52 个 Transformer 层,每层采用分组查询注意力机制,配置 32 个查询头和 2 个键值头,并搭配 SwiGLU 前馈网络。
在注意力机制设计上,Muse Glimmer 采用了混合注意力模式:每隔三层使用 2048 token 滑动窗口注意力,第四层则切换为全序列注意力,兼顾效率与长程依赖建模。局部窗口层使用旋转位置编码(RoPE),全注意力层则采用无位置编码(NoPE),这一组合使模型能够将上下文长度扩展至训练限制之外,实现超过 128k token 的有效处理能力。
SGLang 为 Muse Glimmer 提供了广泛的硬件支持,覆盖 NVIDIA GeForce RTX 5090、RTX PRO 6000、DGX Spark 以及 Apple Silicon 设备(包括 Mac mini 和 M 系列 MacBook Pro)。在 NVIDIA SM120 平台上,SGLang 利用优化的 GEMM 和 FlashInfer 后端实现高吞吐推理;Apple Silicon 设备则通过原生 MLX 后端提供高性能本地服务。此外,前缀缓存等多项优化已被移植至 MLX 后端,进一步提升了苹果设备上的智能体工作负载性能。
在量化格式方面,Muse Glimmer 提供多种检查点以满足不同需求:追求最高精度的开发者可在单张 H100 GPU 上运行原生 BF16 检查点;SM120 路径提供约 19.5 GB 的混合 NVFP4+MXFP8 量化方案;18 GB 的 NVFP4 检查点搭配 5 GB 的 BF16 DFlash 推测器可完整装入单张 RTX 5090。此外还提供 Q4KM 和 Q4K-Dynamic 两种 GGUF 格式,以及面向 Apple Silicon 的 MLX 4-bit 格式,兼顾速度与模型质量的不同取舍。
性能测试覆盖七个硬件平台,批量大小从 1 到 8 进行扫描。在 RTX 5090 上,NVFP4 精度配合 DFlash 推测解码实现了每秒 1452 token 的批量 8 总输出吞吐量,以及每秒 236 token 的单用户解码速度。DFlash 在批量 1 场景下可将交互速度提升 1.9 至 4.3 倍,在大多数配置上达到 3 倍以上提升。Apple M5 Pro 在 Q4 格式下单用户解码速度约为每秒 17.6 token,批量 8 吞吐量约为每秒 56.9 token,为本地 Mac 部署提供了可用的性能基准。
要点
- Muse Glimmer 是一款 300 亿参数多模态模型,支持 128k+ token 上下文,专为本地智能体工作流优化,无需云端即可运行完整的端到端任务
- SGLang 的 DFlash 推测解码在批量 1 场景下可将推理速度提升最高 4.3 倍,在 RTX 5090 上实现每秒 1452 token 的峰值吞吐量
- 模型提供 BF16、NVFP4、GGUF(Q4KM、Q4K-Dynamic)及 MLX 4-bit 多种格式,覆盖从 H100 到消费级显卡再到 Apple Silicon 的全硬件谱系
- 混合滑动窗口与全序列注意力的架构设计,结合 RoPE 与 NoPE 的组合,使模型上下文能力可超越训练时的长度限制
- Apple Silicon 用户通过 MLX 后端即可在本地部署该模型,前缀缓存等优化已同步支持,为 Mac 设备上的智能体应用提供实用性能
原始标题:SGLang Adds Day-0 Support for Muse Glimmer, a Multimodal Model Built for Local Agentic Workflows
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。