9B 参数多模态模型
该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总计 9B 参数,并被呈现为 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上推出的 9B 参数多模态模型,支持视觉、语音、OCR 与全双工直播工作流,并提供指令与思考模式及多种部署方式。
MiniCPM-o 4.5 是 openbmb 在 Hugging Face 上推出的一个多模态模型,将视觉、语音和直播能力整合到一个端到端系统中。模型卡将其描述为 MiniCPM-o 系列中最新、能力最强的模型,由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 构建,总计 9B 参数。
来源重点介绍了该模型的四项主要任务:视觉理解、实时语音对话、全双工多模态直播,以及 OCR/文档解析。它还指出,该模型支持英语和中文的双语语音,整体覆盖 30 多种语言,并提供多种部署路径,从 Nvidia GPU 上的 PyTorch 到 llama.cpp、Ollama、vLLM、SGLang、量化格式和 FlagOS。
该模型由 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B 端到端构建,总计 9B 参数,并被呈现为 MiniCPM-o 系列中的最新模型。
MiniCPM-o 4.5 在单一模型中同时支持指令模式和思考模式,用户无需切换模型即可在更快响应与更深层推理行为之间进行选择。
该模型支持英语和中文的双语实时语音对话、可配置的助手音色、声音克隆,以及基于简短参考音频的角色扮演。
它可以同时处理连续音频和视频流,并并发生成文本与语音输出,从而实现不受模态阻塞的全双工实时交互。
该模型可处理最高 180 万像素的高分辨率图像和最高 10 fps 的高帧率视频,并被描述为在 OCR 和文档解析任务上表现出色。
页面列出了多种部署路径,包括在 Nvidia GPU 上使用 PyTorch、llama.cpp、Ollama、量化 int4 和 GGUF 模型、vLLM、SGLang 以及 FlagOS 支持。
当你需要一个既能回答图像、文档页面或其他视觉输入问题,又能处理语音交互的单一系统时,可使用该模型。
适用于必须实时倾听并响应的直播对话代理,包括支持英语和中文语音交互且音色可配置的场景。
适用于将摄像头输入与音频结合并持续输出的应用,例如演示体验、具身接口或实时场景讲解。
当 OCR 或文档解析是工作的一部分时可使用,尤其适合高分辨率页面和图像密集型工作流。
当你需要通过 PyTorch、llama.cpp、Ollama、vLLM、SGLang 或量化格式进行本地或优化推理时,可使用可部署版本和运行时支持。
MiniCPM-o 4.5 被定位为用于视觉、语音和全双工直播的多模态模型。它被描述为一个同时支持指令模式和思考模式的单一模型。
来源说明该模型可通过在 Nvidia GPU 上进行 PyTorch 推理用于基础使用,也支持 llama.cpp 和 Ollama 进行 CPU 推理、支持量化 int4 和 GGUF 格式、支持用于更高吞吐量推理的 vLLM 和 SGLang,以及用于统一多芯片后端插件的 FlagOS。
该模型被描述为支持英语和中文的实时语音对话,以及全双工多模态直播,即在处理视频和音频输入的同时并发生成文本和语音输出。
模型卡说明 MiniCPM-o 4.5 可以处理最高 180 万像素的高分辨率图像、最高 10 fps 的高帧率视频,并支持超过 30 种语言的多语言能力。
Hugging Face 的定价页面确认 Hugging Face 提供付费基础设施和推理服务,但所收集的来源并未提供 MiniCPM-o 4.5 的模型专属定价。
流量数据仅供参考。
| 4月 | 30272948 |
|---|---|
| 5月 | 27366782 |
| 6月 | 27117684 |