发布时间:2026/8/18 10:03:02
DeepSeek 用不起了,切换小米 MiMo 搭建语音交互的实战经验 DeepSeek 用不起了切换小米 MiMo 搭建语音交互的实战经验DeepSeek 8/17 起要涨价峰谷价而小米的 MiMomimo-v2.5刚好出来——一个模型覆盖 ASR TTS Vision 文本TTS 限时免费ASR 仅 ¥0.5/小时。能力不差还更便宜。换完之后顺便把语音交互也搭了发现 MiMo 的 ASR/TTS 走 Chat Completions API接入成本很低踩了几个坑记录一下。1. MiMo 多模态能力实测1.1 视觉理解VisionMiMo 的视觉理解能力和其他多模态模型类似通过input_image参数传入图片。这里不展开重点说 ASR 和 TTS。1.2 语音识别ASRMiMo 的 ASR 调用方式和传统方案完全不同。它不走标准的/v1/audio/transcriptions端点调了会 404而是走 Chat Completions 接口。核心要点只能传input_audio不能传text部分。import json, base64, urllib.request API_KEY your-key BASE_URL https://token-plan-cn.xiaomimimo.com/v1 # 读取音频文件并编码为 base64 with open(voice_message.mp3, rb) as f: audio_b64 base64.b64encode(f.read()).decode() data json.dumps({ model: mimo-v2.5-asr, messages: [{ role: user, content: [{ type: input_audio, input_audio: {data: audio_b64, format: mp3} }] }], max_tokens: 2000 }).encode() req urllib.request.Request( f{BASE_URL}/chat/completions, datadata, headers{api-key: API_KEY, Content-Type: application/json} ) with urllib.request.urlopen(req, timeout60) as r: result json.loads(r.read()) text result[choices][0][message][content] print(text)⚠️坑如果 messages 里同时传了text类型的 contentAPI 会报错。MiMo ASR 的 user content 必须只有input_audio不能混入text。这和一些其他多模态模型的用法不同需要注意。成本方面MiMo ASR 按音频时长计费大约 ¥0.5/小时音频对于日常语音消息场景非常划算。1.3 语音合成TTSMiMo 的 TTS 同样走 Chat Completions API模型名是mimo-v2.5-tts。核心要点必须传audio参数否则返回 500 错误。import json, base64, urllib.request data json.dumps({ model: mimo-v2.5-tts, messages: [ {role: assistant, content: 要合成的文本内容} ], audio: {format: mp3, voice: 茉莉} }).encode() req urllib.request.Request( f{BASE_URL}/chat/completions, datadata, headers{api-key: API_KEY, Content-Type: application/json} ) with urllib.request.urlopen(req, timeout120) as r: result json.loads(r.read()) audio_data result[choices][0][message][audio][data] audio_bytes base64.b64decode(audio_data) # 保存音频文件...⚠️坑messages 必须包含assistantrole。文本放在 assistant content 里不是 user content。如果只传 user messageAPI 会报400: messages must contain an assistant role for TTS model。内置音色有茉莉、冰糖等具体列表可查 MiMo 文档。2. 语音交互搭建2.1 ASR 配置在 Hermes 的config.yaml中配置 MiMo ASR 作为 STT providerstt: enabled: true language: zh provider: mimo-asr providers: mimo-asr: command: python3 /path/to/ask_mimo_asr.py --audio {input_path} --out {output_path} format: txt language: zh timeout: 300 type: commandHermes 会在收到语音消息时自动调用这个脚本将音频文件转为文字。注意timeout要给够长语音可能需要几十秒。2.2 TTS 配置TTS 同样通过 command provider 模式接入tts: provider: mimo-tts providers: mimo-tts: command: python3 /path/to/ask_mimo_tts.py --text-file {input_path} --out {output_path} --voice xiaoai output_format: mp3 timeout: 120 type: command voice_compatible: trueHermes 会把要合成的文本写入{input_path}文件脚本读取后调用 MiMo API合成的音频输出到{output_path}。2.3 音色克隆MiMo TTS 支持音色克隆——传入一段参考音频模型会用这个音色来合成新内容。核心原理在 user message 的 content 中传入input_audio参考音频assistant content 放要合成的文本。# 读取参考音频 with open(reference_voice.mp3, rb) as f: ref_audio base64.b64encode(f.read()).decode() # 克隆调用格式 data json.dumps({ model: mimo-v2.5-tts, messages: [ { role: user, content: [ {type: input_audio, input_audio: {data: ref_audio, format: mp3}}, {type: text, text: 用这个声音的音色来说} ] }, {role: assistant, content: 要合成的文本内容} ], audio: {format: mp3} # 注意克隆模式不传 voice 参数 }).encode()实测中我们用小爱同学的语音片段作为参考音频进行克隆效果不错。参考音频的获取流程从视频网站找到目标音色的干净语音片段用yt-dlp下载音频用ffmpeg截取 5-30 秒无背景噪音的片段调用克隆 API 生成音频再用 MiMo 听一下验证相似度⚠️参考音频质量直接影响克隆效果需要干净的人声背景噪音太多会导致音色偏差。3. 多平台接入3.1 QQ Bot 语音消息QQ Bot 原生支持语音消息发送。在 Hermes 中配置 QQ Bot 后语音交互可以直接打通platforms: qqbot: enabled: true extra: app_id: your-app-id client_secret: your-secret dm_policy: pairing group_policy: pairing stt: provider: mimo-asrQQ Bot 支持send_voice()方法TTS 合成的音频可以直接作为语音消息发送。完整的语音交互链路是这样的用户在 QQ 发送语音消息Hermes 收到后调用ask_mimo_asr.py将音频转为文字文本经过 MiMo 模型推理生成回复内容调用ask_mimo_tts.py将回复文本合成为语音通过 QQ Bot 的send_voice()将语音发送给用户全链路都在 MiMo 生态内完成不需要跨多个服务商。下面是实际效果——QQ 上的语音对话截图用户发送语音消息AI 用 MiMo ASR 转录为文字经过推理后用 MiMo TTS 合成语音回复全程自动完成。另外有个常见坑如果dm_policy设为open需要同时设置环境变量GATEWAY_ALLOW_ALL_USERStrue否则 Gateway 会拒绝启动日志里会看到Refusing to start: qqbot has dm_policy/group_policy set to open but neither GATEWAY_ALLOW_ALL_USERS nor QQ_ALLOW_ALL_USERS is enabled这样的报错。3.2 微信语音条为什么不支持微信 Bot API 目前不支持发送语音条——API 层面接受消息但客户端静默丢弃。这是平台限制不是代码问题。目前微信渠道只支持文字消息收发语音交互建议走 QQ Bot。4. 踩坑记录TTS 必须传audio参数不传会返回 500 错误请求体中需包含audio: {format: mp3}ASR 不能传textcontentuser message 只能包含input_audio类型和 Vision 等其他多模态调用方式不同TTS 必须用assistantrole文本放在 assistant content 里放 user 会报 400 错误克隆模式不传voice参数voice只用于内置音色选择克隆模式下传了可能导致意外行为OGG 格式需要转换MiMo TTS 不直接支持 OGG 输出需要先出 WAV 再用 ffmpeg 转换5. 总结MiMo 的统一 API 设计让语音交互搭建变得很简单——ASR TTS Vision 一个模型搞定不用再维护多个 API。目前 TTS 限时免费ASR 仅 ¥0.5/小时性价比很高。如果你也在做类似的语音交互项目可以试试 MiMo。有问题欢迎评论区交流。

相关新闻

2026/8/18 10:03:02

参赛意识到,民私营经济崛起在钱、不在内涵

这是用豆包写的。 从一场编程竞赛说起:当“大厂光环”照不进细节,我们还能期待什么?一场比赛,折射出的不仅是一家公司的组织能力,更是一家企业对“人”的基本态度。写在前面 前几天,我参加了一场头部科技公…

2026/8/18 9:58:02

多数据库检索中的重复数据问题与去重技术方案

1. 多数据库检索中的重复数据问题在科研、市场调研或商业分析工作中,我们经常需要从多个数据库检索信息。比如同时查询PubMed、Web of Science和CNKI等学术数据库,或者从不同电商平台抓取商品数据。这时最头疼的问题就是:不同来源的检索结果中…

2026/8/18 9:58:01

ARM Cortex-M查表跳转指令TBB/TBH原理与编译器优化实战

1. 项目缘起:一个被忽视的底层指令在嵌入式开发,尤其是基于ARM Cortex-M系列内核的项目中,我们每天都在和C语言、编译器、链接器打交道。高级语言和开发框架的便利性,常常让我们忽略了处理器最底层的执行机制。直到有一天&#xf…

2026/8/18 14:59:01

36款Cherry MX键帽3D模型免费开源:从选型到打印的完整攻略

36款Cherry MX键帽3D模型免费开源:从选型到打印的完整攻略 【免费下载链接】cherry-mx-keycaps 3D models of Chery MX keycaps 项目地址: https://gitcode.com/gh_mirrors/ch/cherry-mx-keycaps cherry-mx-keycaps 是一个免费开源的 Cherry MX键帽3D模型库&…

2026/8/18 14:59:01

卸载数据安全卫士DGS

卸载数据安全卫士DGS DGS安装目录在C:\Program Files (x86)\Agile DGS下 因为双击卸载闪退,所以用shell运行了UninstallClient.exe, 删除后等待,发现文件没有加密锁的标识了, 将Agile DGS下能删的都删掉了,注册表带dgs的也都删除了…

2026/8/18 14:53:59

几十G测试数据难处理?试试Visual ADP一键搞定

作为一名常年与试验数据“死磕”的测试或研发工程师,你是否也经历过这些让人血压飙升的瞬间?几十GB的传感器采集文件刚导入,分析软件直接卡死崩溃,一下午进度归零;为了揪出几个异常跳点,手动排查上百条波形…

2026/8/17 10:49:52

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/18 6:58:27

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/18 0:02:05

Qwen3.8-27B本地部署实战:17GB内存运行270亿参数大模型

1. 这篇文章真正要解决的问题 你是否曾对动辄需要上百GB显存才能运行的百亿参数大模型望而却步?是否觉得在个人电脑上部署一个功能强大的语言模型是天方夜谭?最近,通义千问团队发布的 Qwen3.8-27B 模型,宣称仅需 17GB 内存即可在本…

2026/8/18 0:02:05

ME3169 36V,8A,180KHz 恒压Buck DC-DC 转换器

概述ME3169 是一款180KHz,PWM 模式恒压Buck DC-DC 转换器,8V 到36V 宽工作电压范围,低纹波,内置低导通电阻功率MOS。ME3169 内置环路补偿电路,可以减少外围元器件数量。内部设计有恒压环路,可以通过外部电阻…

2026/8/17 15:07:41

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/17 17:27:06

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/18 7:12:40

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…