发布时间:2026/8/23 11:42:50
MiniCPM-o-2_6架构全解:SigLIP、Whisper、ChatTTS与Qwen2.5如何组成端到端8B模型? MiniCPM-o-2_6架构全解SigLIP、Whisper、ChatTTS与Qwen2.5如何组成端到端8B模型【免费下载链接】MiniCPM-o-2_6项目地址: https://ai.gitcode.com/OpenBMB/MiniCPM-o-2_6MiniCPM-o-2_6 是 OpenBMB 开源的端到端 8B 全模态多模态大模型它将 SigLIP-400M 视觉编码器、Whisper-medium-300M 语音编码器、ChatTTS-200M 语音合成模块与 Qwen2.5-7B 语言主干焊在同一个模型里一张图、一段话、一段声音都能理解还能用可配置的声音实时对话。这篇文章带你用最少代码、最多直觉彻底搞懂它的架构组成。 先记结论8B 参数 4 个模块拼出来的MiniCPM-o-2_6 不是一个单塔模型而是4 个成熟小模型端到端联合训练的产物组件参数量角色项目中的位置SigLIP 视觉编码器约 400M看图图像/视频帧编码modeling_navit_siglip.pyWhisper-medium 语音编码器约 300M听音语音/音频特征提取config.json中audio_configQwen2.5-7B 语言模型约 7B大脑推理与生成config.json主干参数ChatTTS 语音合成器约 200M说话文本→语音config.json中tts_config合计约 8B端到端联合训练—关键点这四个模块不是调用链而是可微分地连在一起输入和输出都能接收/生成图像、音频和文本any-to-any。️ 组件一SigLIP-400M Perceiver 重采样器视觉通路视觉侧由两部分构成SigLIP 编码器27 层、hidden_size1152、patch_size14负责把图像切成 patch 后提取特征。实现见modeling_navit_siglip.py它采用 NaViT 式动态分辨率方案——支持任意宽高比、最高 1.8M 像素如 1344×1344的图像图像切片逻辑在image_processing_minicpmv.py中最多 9 片。Perceiver 重采样器Resampler用一个64 个可学习 queryquery_num: 64见config.json从视觉特征中提问把高维特征压缩成固定数量的视觉 token。代码在resampler.py。 这正是它省 token的秘密1.8M 像素的大图只产生约 640 个视觉 token比同类模型少 75% 以上首字延迟、显存和功耗都直接受益。️ 组件二Whisper-medium-300M音频输入通路耳朵是改造版的 Whisper 编码器24 层编码器、d_model1024配置在config.json的audio_config基于openai/whisper-medium自定义的MiniCPMWhisperEncoder在modeling_minicpmo.py中实现加入了流式友好的分块注意力掩码音频按1 秒一个 chunkaudio_chunk_length: 1.0切分特征再按audio_pool_step: 2下采样最后经音频投影层audio_projection_layer映射到 3584 维语言空间效果中文语音识别在 AISHELL-1 上 CER 低至 1.6超过 GPT-4o-Realtime。 组件三Qwen2.5-7B大脑与中枢语言主干就是 Qwen2.5-7B配置一目了然config.jsonhidden_size: 3584、num_hidden_layers: 28、28 个注意力头4 个 KV 头GQA上下文长度32768max_position_embeddings词表 151700视觉/音频 token 和文本 token 共用同一个 Transformer视觉 query、音频特征都投影到 3584 维后与文本一起进入注意力也就是说看图和听音不是外挂能力而是和文字在同一空间里做注意力交互这是端到端架构能理解画面里的人在说什么的基础。 组件四ChatTTS-200M语音输出通路嘴巴是ConditionalChatTTStts_config.model_type: conditional_chatttsllm_dim: 3584与主干对齐实现同样在modeling_minicpmo.py文本先生成语音 tokenGFSQ 量化 4 级码本再经 DVAE 解码成 mel 频谱最终由 Vocos 声码器模型文件assets/Vocos.pt把 mel 还原为 24kHz 波形它额外带一个chattts 专用分词器assets/chattts_tokenizer/和说话人嵌入speaker embedding这个说话人嵌入来自一个巧妙设计系统提示词里可以放一段参考音频作为音频 system prompt从而在推理时自由配置音色、做零样本音色克隆甚至描述造声说像一个魅力男巨星那样说话就能生成对应声线。 四个组件如何焊在一起端到端训练把架构简化成一条数据流就懂了图像 ── SigLIP ── Resampler(64 token) ─┐ 音频 ── Whisper ── 音频投影层 ─────────┼── Qwen2.5-7B ── 文本 token ── ChatTTS ── Vocos ── 语音 文本 ────────────────────────────────────┘ │ ── 语音 token 也可回灌实时对话联合可微梯度能穿过投影层回传到 SigLIP 和 Whisper四个模块在configuration_minicpm.py的MiniCPMOConfig中统一组装、端到端训练流式机制把离线编码器改为在线处理并用时分复用TDM机制把视频流、音频流、文本流按小时间片交织进 LLM 的序列里实现边看边听边说的多模态直播live streaming模型入口类是modeling_minicpmo.py中的MiniCPMO常用方法有chat()单轮/多轮对话、streaming_prefill()/streaming_generate()流式直播、get_sys_prompt()配置音色 项目文件速查表文件作用modeling_minicpmo.py主模型MiniCPMO、Whisper 编码器、ChatTTS、流式 TTSmodeling_navit_siglip.pySigLIP 视觉编码器resampler.pyPerceiver 视觉重采样器configuration_minicpm.py统一配置视觉/音频/TTSprocessing_minicpmo.py多模态 Processor文本图音混合输入image_processing_minicpmv.py动态分辨率图像切片tokenization_minicpmo_fast.py分词器与特殊 token 定义config.json模型超参数总入口model-00001-of-00004.safetensors等 4 个分片模型权重共 4 片assets/Vocos.pt声码器权重assets/demo.wav、assets/Skiing.mp4演示用的参考音频与视频assets/input_examples/各种说话风格示例音频音色克隆、情感、语速等 快速上手三步1. 获取项目git clone https://gitcode.com/OpenBMB/MiniCPM-o-2_6.git2. 安装依赖注意 transformers 版本要求 4.44.2pip install transformers4.44.2 torch2.3.1 librosa soundfile vocos3. 加载并对话最小示例from transformers import AutoModel, AutoTokenizer model AutoModel.from_pretrained( openbmb/MiniCPM-o-2_6, trust_remote_codeTrue, attn_implementationsdpa, torch_dtypetorch.bfloat16) model model.eval().cuda() model.init_tts() # 初始化 TTS 处理器与 Vocos 声码器 tokenizer AutoTokenizer.from_pretrained(openbmb/MiniCPM-o-2_6, trust_remote_codeTrue) res model.chat(msgs[{role:user,content:[描述一下这张图,xx.jpg]}], tokenizertokenizer) print(res)更多用法实时语音对话、音色克隆、多模态直播详见README.md的 Usage 章节。 小提示显存吃紧时可用 int4 量化版约 7GB或 GGUF 格式跑端侧设备。❓ 常见疑问FAQQ1为什么叫端到端因为听→理解→说整条链路是同一个模型可微训练出来的不是ASR 工具 LLM TTS 工具的拼接音高、情感、语气能直接参与推理。Q28B 参数具体怎么分配的约 7B 在 Qwen2.5 语言主干约 400M 在 SigLIP约 300M 在 Whisper约 200M 在 ChatTTS另加少量投影层——总和正好 8B手机/单卡可跑。Q3只用视觉/只用语音行不行可以。加载时设置init_audioFalse, init_ttsFalse即得到纯视觉模型用法与 MiniCPM-V 系列一致音频相关功能会随配置自动跳过。写在最后MiniCPM-o-2_6 的架构哲学一句话用小模块做专业事用端到端训练让它们变成整体。SigLIP 负责看得细高 token 密度、Whisper 负责听得准、Qwen2.5 负责想得清、ChatTTS 负责说得像再加上 TDM 流式机制和可配置音频系统提示词就得到了一个 8B 身材、GPT-4o 级别视觉理解、开源最强实时语音对话的全模态模型。【免费下载链接】MiniCPM-o-2_6项目地址: https://ai.gitcode.com/OpenBMB/MiniCPM-o-2_6创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/23 11:42:50

企业招聘困境解析与高效招聘策略

1. 招聘困境的本质解析"招不到人"这个表面现象背后,实际上是企业需求与市场供给的结构性错配。根据我十年人力资源咨询经验,企业招聘漏斗从职位发布到offer接受的转化率通常不足15%,而其中真正能通过试用期的可能只有30%。这意味着…

2026/8/23 11:42:50

SWE-Explore基准:AI编码智能体如何高效探索复杂代码仓库

1. 项目概述:当AI编码助手开始“翻箱倒柜”最近,一个名为“SWE-Explore”的基准测试在开发者社区和AI研究圈里引起了不小的讨论。乍一看标题,你可能会觉得这又是一个枯燥的学术评测,但如果你深入一线,特别是那些正在尝…

2026/8/23 11:42:50

博弈论数学建模:从纳什均衡到实战应用

1. 从“田忌赛马”到现代博弈:对策论是什么? 如果你玩过石头剪刀布,或者在商业谈判中思考过如何出价,甚至在游戏中琢磨过对手的策略,那么你已经不自觉地运用了对策论的思想。对策论,也叫博弈论,…

2026/8/23 12:57:54

MES项目成功三要素:业务目标、技术架构与变革管理实践

在实际制造业数字化转型过程中,MES(制造执行系统)项目的成败往往决定了从“自动化孤岛”到“数字化车间”的跨越能否真正实现。很多企业投入了大量资源,但项目最终未能达到预期效果,甚至沦为昂贵的摆设。这背后的问题&…

2026/8/23 12:57:54

DeepSeek TUI工具:命令行交互式AI助手配置与实战指南

1. 先搞清楚 dsh-tui 到底是什么,以及它解决了什么问题 如果你最近在关注 DeepSeek 相关的开发工具,可能会在各种社区看到 dsh-tui 这个名字。它被标记为“DeepSeek Harness 官方收录的插件”,这个描述本身就容易让人困惑。它到底是一个独立…

2026/8/23 12:52:54

BongoCat 互动桌宠快速上手指南:键盘、鼠标、手柄全响应

BongoCat 互动桌宠快速上手指南:键盘、鼠标、手柄全响应 【免费下载链接】BongoCat 🐱 跨平台互动桌宠 BongoCat,为桌面增添乐趣! 项目地址: https://gitcode.com/gh_mirrors/bong/BongoCat BongoCat 是一款跨平台互动桌宠…

2026/8/23 0:02:04

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:02:04

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:02:04

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/23 0:02:04

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/23 0:02:04

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/23 0:02:04

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/21 15:40:01

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/23 6:14:43

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/23 4:22:01

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…