模型 / 官方
美团开源 LongCat-Next 多模态推理框架,支持图像、音频与文本全链路任务
美团 LongCat 团队近日在 GitHub 公开了 LongCat-Next-inference 仓库,这是一套专为原生多模态大模型(NMM)设计的推理测试框架,使用 Python 编写,目前已获得 32 个 Star 和 9 次 Fork。框架支持图像理解、图像生成、音频转文本、语音合成以及音频到音频五类任务,能够以顺序或并发两种模式运行测试用例。在架构层面,框架围绕统一隐状态接口、解耦生成接口、共享内存 I/O 流水线和智能前缀缓存四项核心优化展开,旨在兼顾模型灵活性与推理效率。此外,团队还推荐配合 Omni-Flow 使用,后者提供分布式 KV 缓存共享与跨角色流水线编排能力,可进一步提升高吞吐场景下的部署表现。框架要求 CUDA 12.9 及以上版本。
美团 LongCat 团队于 2025 年 7 月初在 GitHub 公开了 LongCat-Next-inference 仓库,定位为面向原生多模态大模型的推理测试框架。与传统 LLM 推理框架不同,该框架从设计之初便将图像、音频、文本等多种模态视为一等公民,力求在不牺牲推理效率的前提下支持快速迭代。仓库目前以 Python 为主要语言,并附有 Shell 脚本用于环境配置与安装。
框架的推理流水线分为三个核心阶段:输入处理阶段由各模态专属编码器将图像、音频、文本统一编码为隐状态表示;核心推理阶段由 LLM 主干对隐状态进行上下文建模;多模态输出生成阶段则由任务感知头将 LLM 输出转换为多模态 token,再经由音频声码器、图像精炼器等模态解码器还原为最终输出。这一设计使得单次前向传播路径保持统一,便于跨模态推理优化。
在系统级优化方面,框架实现了四项关键机制。统一隐状态接口消除了不同模态输入进入 LLM 前的格式差异;解耦生成接口将 token 采样与模型前向计算分离,支持异步准备下一步输入;共享内存 I/O 流水线通过重叠调度让嵌入传输与模型计算并行执行,显著压缩单次迭代延迟;智能前缀缓存则在传统 KV 缓存基础上引入隐状态缓存,避免对相同输入重复编码,同时保证语义层面的缓存命中率。
为应对多模态生成中复杂的序列依赖问题,框架内置了一套轻量级状态机。该状态机通过解析 LLM 输出中的特殊 token,动态将处理流程路由至对应的模态解码器,从而支持先生成图像再处理后续文本、先生成文字稿再合成语音等多步骤工作流,无需外部编排系统介入。这一机制大幅降低了复杂多模态任务的工程复杂度。
在使用层面,框架提供了简洁的命令行接口,用户可通过 demo.py 指定模型路径、输出目录、执行模式及任务类型,测试用例则统一配置在 example/test_cases.yaml 文件中。团队同时推荐将本框架与 Omni-Flow 结合使用,后者原生支持 LongCat-Next、DeepSeek-V2、HunyuanImage-3 等多款多模态模型,并提供灵活的流水线组合与 SGLang 集成能力,适合对吞吐量要求较高的生产部署场景。框架运行需要 CUDA 12.9 或更高版本。
要点
- LongCat-Next-inference 将图像、音频、文本统一为隐状态表示,通过单一前向路径支持五类多模态任务,简化了跨模态推理的工程实现。
- 共享内存 I/O 流水线与解耦生成接口的组合,使输入准备与模型计算可并行执行,有效降低多步推理的迭代延迟。
- 内置轻量级状态机通过解析特殊 token 动态路由模态解码器,无需外部编排即可支持复杂多步骤多模态工作流。
- 框架可与 Omni-Flow 配合使用,获得分布式 KV 缓存共享与高吞吐流水线编排能力,适合生产级部署需求。
- 项目要求 CUDA 12.9 及以上,目前处于早期开源阶段,社区关注度仍在增长中。
原始标题:meituan-longcat/LongCat-Next-inference
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。