<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>语音克隆 on Text Matrix</title><link>https://txtmix.com/tags/%E8%AF%AD%E9%9F%B3%E5%85%8B%E9%9A%86/</link><description>Recent content in 语音克隆 on Text Matrix</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Tue, 21 Jul 2026 20:06:14 +0800</lastBuildDate><atom:link href="https://txtmix.com/tags/%E8%AF%AD%E9%9F%B3%E5%85%8B%E9%9A%86/index.xml" rel="self" type="application/rss+xml"/><item><title>kyutai-labs/pocket-tts：把 100M 参数 TTS 装进 CPU 口袋</title><link>https://txtmix.com/posts/tech/kyutai-labs-pocket-tts-cpu-text-to-speech/</link><pubDate>Fri, 10 Jul 2026 02:58:08 +0800</pubDate><guid>https://txtmix.com/posts/tech/kyutai-labs-pocket-tts-cpu-text-to-speech/</guid><description>&lt;h2 id="核心判断">核心判断&lt;/h2>
&lt;p>Pocket TTS 不是“又一个开源 TTS”。它的赌注很明确：&lt;strong>让 TTS 回归本地、CPU、零网关&lt;/strong>。100M 参数、首块 ~200ms、6× 实时率（M4 MacBook Air）、支持英语/法语/德语/葡萄牙语/意大利语/西班牙语、声音克隆、Python API + CLI + HTTP 服务三入口——这些数字合起来，对标的是商业 TTS API（ElevenLabs、Azure TTS、Google Cloud TTS），但&lt;strong>完全跑在用户的 CPU 上&lt;/strong>。它的工程价值在于：把流式自回归 TTS 模型裁剪到了消费级笔记本能撑住的水位。&lt;/p></description></item><item><title>mellifluous：本地运行的 Markdown TTS 工具，让文档自己"出声"</title><link>https://txtmix.com/posts/tech/mellifluous-markdown-tts-apple-silicon/</link><pubDate>Sun, 17 May 2026 12:05:30 +0800</pubDate><guid>https://txtmix.com/posts/tech/mellifluous-markdown-tts-apple-silicon/</guid><description>&lt;blockquote>
&lt;p>&lt;strong>项目信息卡&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>GitHub&lt;/strong>: &lt;a href="https://github.com/alexr314/mellifluous" target="_blank" rel="noopener noreffer ">alexr314/mellifluous&lt;/a>&lt;/li>
&lt;li>&lt;strong>Stars&lt;/strong>: 3+ | &lt;strong>Forks&lt;/strong>: 0+ | &lt;strong>License&lt;/strong>: MIT&lt;/li>
&lt;li>&lt;strong>语言&lt;/strong>: Python | &lt;strong>平台&lt;/strong>: macOS Apple Silicon (M1+)&lt;/li>
&lt;li>&lt;strong>核心依赖&lt;/strong>: MLX-Audio, markdown-it-py, Qwen3-TTS&lt;/li>
&lt;/ul>&lt;/blockquote>
&lt;h2 id="学习目标">学习目标&lt;/h2>
&lt;p>读完本文后，你应该能够：&lt;/p>
&lt;ol>
&lt;li>理解 mellifluous 的核心设计思路——为什么 Markdown 结构化朗读比通用 TTS 更适合技术文档&lt;/li>
&lt;li>区分 mellifluous 架构中的关键模块职责（synth、parse、Detector 链）&lt;/li>
&lt;li>独立完成 mellifluous 的安装、演示和运行&lt;/li>
&lt;li>配置自定义语音克隆样本，并理解 WAV 格式要求&lt;/li>
&lt;li>判断 mellifluous 是否适合你的使用场景，以及它的平台限制&lt;/li>
&lt;/ol>
&lt;h2 id="目录">目录&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="#%e5%ad%a6%e4%b9%a0%e7%9b%ae%e6%a0%87" rel="">学习目标&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e9%a1%b9%e7%9b%ae%e6%a6%82%e8%a7%88" rel="">项目概览&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e6%a0%b8%e5%bf%83%e7%89%b9%e6%80%a7" rel="">核心特性&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e6%8a%80%e6%9c%af%e6%9e%b6%e6%9e%84" rel="">技术架构&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e5%bf%ab%e9%80%9f%e5%bc%80%e5%a7%8b" rel="">快速开始&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e9%80%82%e7%94%a8%e5%9c%ba%e6%99%af%e4%b8%8e%e9%99%90%e5%88%b6" rel="">适用场景与限制&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e8%87%aa%e6%b5%8b%e9%a2%98" rel="">自测题&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e8%bf%9b%e9%98%b6%e8%b7%af%e5%be%84" rel="">进阶路径&lt;/a>&lt;/li>
&lt;li>&lt;a href="#%e6%80%bb%e7%bb%93" rel="">总结&lt;/a>&lt;/li>
&lt;/ul>
&lt;h2 id="项目概览">项目概览&lt;/h2>
&lt;p>&lt;strong>mellifluous&lt;/strong>（&lt;a href="https://github.com/alexr314/mellifluous" target="_blank" rel="noopener noreffer ">alexr314/mellifluous&lt;/a>）是一个 macOS Apple Silicon 上的本地 Markdown 转语音（TTS）工具。它的核心思路是把 Markdown 文档解析为&amp;quot;有结构的朗读&amp;quot;——不是把文字一股脑送进 TTS，而是理解文档的层次（标题、段落、列表、代码块），按阅读节奏插入停顿，让语音输出听起来更像真人朗读。&lt;/p></description></item></channel></rss>