banner
约 2,100 字
7 分钟

免费使用小米MIMO-V2.5-TTS在线语音模型搭配阅读APP听小说

摘要

小米 MIMO-V2.5-TTS 是小米推出的在线语音合成模型,音质在免费方案中表现突出,优于 MultiTTS、TTS Server 等成熟项目。本文介绍如何下载作者(夜雨扰心弦)提供的部署包,在 Windows 上运行 start.bat 启动本地服务,登录小米 MIMO 开放平台获取 API Key 并接入,随后将 TTS 引擎一键(或手动)导入手机「阅读」APP,实现用高质量 AI 语音听小说。文章还提到语音克隆、角色分配等进阶功能尚不成熟,手机端可脱离电脑部署但配置略繁琐。

前言

逛 B 站的时候发现了一个有意思的项目:用小米的 MiMo-V2.5-TTS 在线语音模型,搭配手机阅读 APP 来听小说,作者是 B 站 UP 主夜雨扰心弦

我试用了一下,这个项目虽然还比较初期,但更新到 MiMo-V2.5 之后效果好了很多,声音的自然度、语气都比预期好,甚至比 MultiTTS、TTS server 这类更成熟的免费项目只强不弱。所以专门推荐一下,喜欢"听书"的朋友可以试试。

先搞清楚:TTS 的两条路线

"听书"这件事,最大的差别不在用哪个 App,而在语音是从哪来的。目前就两条路:

本地 TTS 引擎

云端 TTS API(本项目)

代表

手机系统自带、MultiTTS、TTS server

MiMo-TTS、各家云厂商语音合成

音质

一般,机械感明显

明显更自然,接近真人

要不要网

不用,离线可用

必须联网

速度

取决于手机性能

取决于网络 + 平台排队

花钱

免费

按调用量计费(免费额度另说)

隐私

内容不出手机

文本会发给云端

这就解释了为什么"另一个 TTS 项目"总在更新、总有人换——本地引擎受限于手机算力,音质天花板就在那儿;云端模型可以跑大得多的网络,音质自然更好。代价是必须联网,而且你看的文本会经过小米的服务器。

这一点要说清楚:如果你听的只是公开出版的小说,问题不大;但如果是自己写的东西、或者含个人信息的文档,用云端 TTS 就等于把它上传了。敏感内容建议还是用本地引擎。

想了解"完全本地、绝不联网"的另一条路,可以看本地运行 Gemma 4那篇,思路是一样的。

下载

作者提供了两个下载渠道:

部署使用

作者提供了 Windows 和安卓两种部署方法。我自己用 Windows 演示,安卓的原理相同,只是操作更麻烦一点(需要的可以去看作者"部署豆包那期"的视频,讲得很详细)。

1. 下载并解压

下载压缩包后,解压到一个文件夹里(路径最好别带中文和空格,避免一些工具读取异常):

解压

"路径别带中文和空格"不是迷信,这是 Windows 上的老问题:很多命令行工具在处理带空格/非 ASCII 的路径时,参数解析会出错或截断。放在 D:\mimo-tts 这种纯英文短路径下最稳。

2. 运行启动脚本

双击运行目录里的 start.bat

运行start.bat

3. 打开 Web 界面

根据终端提示,在浏览器打开对应的 Web 界面地址。注意:这个终端窗口不要关,一旦关了服务就停了。

打开web界面

为什么会这样start.bat 启动的是一个本地服务器进程,那个黑窗口就是它的"生命体征"。关掉窗口 = 杀掉进程 = 服务停止。这在 Windows 上是个通病——不像 Linux 可以用 systemd 让它后台常驻。

实用建议:如果想让它在后台跑,可以用 Windows 的"任务计划程序"创建一个"登录时启动"的任务,或者干脆把它丢在角落里最小化,别手贱点关闭。更重要的是——电脑睡眠/休眠也会让服务中断,如果你打算边干活边听书,记得把电源计划里的睡眠关掉。

4. 填写 MiMo API Key

进入设置页,填写 MiMo API Key

填API key

5. 获取 API Key

API Key 需要到小米 MiMo 开放平台,登录小米账号后在控制台获取,网站地址:

https://platform.xiaomimimo.com/console/balance

获取key

⚠️ 注意:新建的 API Key 只在创建时显示一次,一定要当场保存好,关掉页面就再也看不到了。我这里填的是示例 key,别直接复制使用——要用你自己的,否则没法调用。

"只在创建时显示一次"——这是安全设计,不是产品缺陷。正规平台的 API Key 在服务器上只存哈希值(一段不可逆的摘要),所以平台自己也无法"再显示一遍"给你看。只有创建的那一刻,明文在浏览器里出现过一次,之后就永久消失了。

所以养成一个习惯:创建 Key 的当下就存进密码管理器(或者至少粘到本地文本文件里)。万一真丢了,处理办法只有一个——删掉旧的、重新创建一个,重新填一遍。没有"找回"这条路。

6. 测试合成效果

输入一段文本、选择一个音色,点开始合成测试一下效果。实测声音自然度和语气表现还是很好的

测试合成

接入阅读 APP(重点)

Web 端跑通后,把它接入手机上的阅读 APP,就能实现"用 MiMo 语音听小说"了:

1. 一键导入(或手动)

在 Web 页面切到 阅读 APP 界面,选择音色后,点一键导入即可把 TTS 引擎导入到手机上的阅读 APP。

我看作者演示是自动导入的,但我打开 App 的 Web 访问后没反应。没关系,如果自动导入不行,就选择手动导入(下面几步)。

一键导入

2. 复制配置

复制页面里给出的引擎配置:

复制配置

3. 打开阅读 App 的朗读引擎设置

手机上的阅读 App(指开源阅读 Legado)里,进入 朗读设置 → 朗读引擎

朗读引擎

4. 新建引擎并粘贴源

新建引擎,来源类型选择 粘贴源

新建引擎

5. 粘贴配置

把刚才复制的配置粘贴进去,保存后就是这个样子:

粘贴配置

6. 切换引擎测试

在阅读 App 里把朗读引擎切换到 MiMo-TTS,然后点朗读测试一下。效果还不错:

切换引擎测试

"粘贴源"这个东西的本质值得知道一下:所谓朗读引擎配置,其实就是一段 JSON——里面写着"请求哪个地址、用什么参数、返回的音频在哪"。阅读 App 支持的是下面这套约定:

  • 请求:你给它一段文字,它发到配置里指定的地址

  • 响应:那个地址返回音频数据(或一个音频链接),App 拿去播放

所以引擎本质上是一个 HTTP 接口。理解了这点,你就能明白为什么"引擎"能来自任何地方——只要那个地址能按约定吐出音频就行。这也是为什么手机必须能访问到那个服务地址(下一节会讲这个坑)。

7. 查看终端

看一下后台终端,项目会持续合成后续的语音(有预取机制),朗读时基本不用担心卡顿:

终端持续合成

"预取"是让听书不卡的关键机制,值得解释一下:朗读是边听边合成的,如果每读完一段才去请求下一段,每段之间都会停顿等网络。项目做的是你还在听第 N 段的时候,后台已经把第 N+1、N+2 段合成好了——所以终端里会一直刷合成日志,而你的播放是连续的。

代价是:预取会提前消耗额度。你听到一半就退出,后面预取的那些也已经被计费了。所以听书过程中频繁"听两句就切走"其实挺浪费的。

几个容易踩的坑

1. 手机连不上服务

最常见的问题。如果你在电脑上跑这个服务,手机上的阅读 App 要访问它,地址不能填 localhost127.0.0.1——那指的是手机自己。要么填电脑的局域网 IP(形如 192.168.x.x),要么把服务部署到一台 24 小时开机的机器上(比如 NAS)。

还要确认防火墙:Windows 防火墙默认会拦掉外部访问本地端口的请求,需要在"入站规则"里放行这个端口。

2. 听书听一半断了

先看服务端窗口还开着没。如果窗口被关了、或者电脑睡眠了,合成自然就停了。这是"电脑当服务器"这种方案的固有毛病。

3. 换了网络环境就用不了

因为服务在你自己家里,出门用流量就访问不到了。想在外面也能听,得做内网穿透(把家里的服务暴露到公网)。这块我写过几篇,比如 Cloudflare Tunnel 方案,但要注意:把服务暴露到公网前,务必确认服务本身有鉴权,否则等于把接口开放给所有人用。

其他功能与不足

项目还提供了一些其他功能,我实测下来效果一般:

  • 文字描述 / 语音克隆:试了一下,不如默认音色的效果好,追求稳定的建议还是用默认音色;

  • AI 分配角色:可以让不同角色用不同声音,但语音衔接不太好,多角色对话时体验一般;

  • 手机端部署:作者也提供了安卓端方案,可以脱离电脑使用,但部署起来比较麻烦

为什么"语音克隆"这类功能常常不达预期:少样本克隆的原理是"给你一段参考音频,模型去模仿它的音色"。它能学到音色特征(听起来像谁),但学不到语气和节奏的处理方式。所以克隆出来的声音往往"像但是僵"——音色对了,但语调平平。想稳定还不如用官方调好的音色,这是有道理的,不是功能没做好。

个人结论

这套 MiMo-TTS 听小说的方案,胜在音色质量确实能打(尤其 MiMo-V2.5 更新后),在免费方案里属于第一梯队,比老牌的 MultiTTS、TTS server 体验更好。搭建成本不高:Windows 端下个包跑起来、填个 MiMo key、再手动导入到阅读 App 就能听。

但有三件事要先接受:一是必须联网,服务在电脑上就得占用一台常开的机器;二是文本会经过云端,敏感内容别用它;三是依赖第三方个人项目 + 自己的 API 额度,项目停更或额度用完都会影响使用。

缺点是部分进阶功能(语音克隆、AI 角色配音)还不够成熟,以及 key 只在创建时显示一次容易弄丢。期待作者继续更新,把功能做完善、部署做得更简单。喜欢用 AI 语音听书的朋友,值得一试。

END

相关文章

暂无相关文章