模型 / 官方
OpenBMB 开源 MiniCPM-o 4.5 全功能 Web Demo
OpenBMB 团队在 GitHub 开源了 MiniCPM-o 4.5 的官方 PyTorch+CUDA 全功能 Web Demo。该系统采用前后端轻量化设计,旨在以透明、简洁、无损的方式呈现 MiniCPM-o 4.5 在音视频全双工全模态方面的能力。MiniCPM-o 4.5 是该系列最新模型,总参数量为 9B,端到端融合了 SigLip2、Whisper-medium、CosyVoice2 与 Qwen3-8B。模型在视觉、语音、OCR 等任务上均达到领先水平,并支持实时全双工多模态直播和主动交互功能,可在本地 GPU、PC 等设备上直接体验。
MiniCPM-o 4.5 由 OpenBMB 团队端到端构建,整合了 SigLip2、Whisper-medium、CosyVoice2 与 Qwen3-8B 等模块,总参数量为 9B。其官方 Web Demo 系统采用 PyTorch+CUDA 推理后端搭配轻量级前后端架构,方便开发者在本地快速部署,直观体验音视频全双工对话能力。仓库已获得 266 颗 Star 和 55 次 Fork,社区关注度持续上升。
在视觉能力方面,MiniCPM-o 4.5 在 OpenCompass 八项主流基准上取得 77.6 的平均分,以 9B 参数规模超越 GPT-4o、Gemini 2.0 Pro 等闭源模型,并接近 Gemini 2.5 Flash 的视觉语言表现。单个模型同时支持指令模式和思考模式,可在效率与性能之间灵活取舍。
语音方面,模型支持中英双语实时语音对话,提供多种可配置音色,并通过参考音频片段实现音色克隆和角色扮演,其克隆效果优于 CosyVoice2 等主流 TTS 工具。系统还引入新的音频系统提示,使用户能够在推理阶段灵活调整助手的声音特征。
全双工多模态直播是此次更新的核心亮点。模型可同时处理连续的视频和音频输入流,并以端到端方式并行生成文本和语音输出流而不互相阻塞,实现“边看边听边说”的实时全模态对话。系统以 1Hz 频率监测输入流并主动发起提醒或评论,使交互更加自然流畅。
在 OCR 与效率层面,MiniCPM-o 4.5 支持最高 180 万像素的高分辨率图像和 10fps 的高帧率视频,并在 OmniDocBench 上超越 Gemini-3 Flash、GPT-5 及 DeepSeek-OCR 2 等模型,覆盖 30 多种语言。部署方面提供 llama.cpp、Ollama、vLLM、SGLang、FlagOS 等多种推理后端,并附带 16 种不同尺寸的 int4 与 GGUF 量化模型,适配从 GPU 到 PC 的本地设备。
要点
- MiniCPM-o 4.5 是 OpenBMB 最新端到端全模态模型,总参数量 9B,官方 Web Demo 已开源
- 模型同时具备视觉、语音、OCR 等能力,多项基准成绩超越主流闭源模型
- 新增全双工全模态直播功能,支持实时音视频输入与文本、语音输出并行生成
- 系统支持主动交互机制,能以 1Hz 频率判断是否主动发起语音回应
- ['提供 PyTorch、llama.cpp、vLLM、SGLang 等多种推理后端及 16 种量化版本,适配本地多设备部署']
原始标题:OpenBMB/MiniCPM-o-Demo — Official PyTorch+CUDA Full-functional Web Demo for MiniCPM-o 4.5
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。