作者:互联网 时间: 2026-08-03 12:54:56
目录
🎄前言
🎄1 什么是Index-TTS
🎄2 Index-TTS下载及启动
🎋2.1 硬件与系统要求
🎋2.2 整合包下载
🎋2.3 启动整合包
🎄3 Index-TTS声音克隆使用
🎄4 使用cpolar将Index-TTS穿透至公网
🎋4.1为什么要穿透Index-TTS?
🎋4.2 什么是cpolar?
🎋4.3 下载cpolar
🎄4.4注册及登录cpolar web ui管理界面
🎋4.4.1 注册cpolar
🎋4.4.2 访问web ui管理界面
🎄4.5 穿透Index-TTS的WebUI界面
🎋4.5.1 随机域名方式(免费方案)
🎋4.5.2 固定域名方式(升级任意套餐皆可)
🎄5 给Index-TTS服务添加授权验证
🎄总结
做视频配音、有声内容或产品讲解时,重复录音是一件很消耗时间的事。文案稍微修改,就可能需要重新录制整段音频;如果还要保持音色、语速和情绪一致,后期处理也会变得更加复杂。
Index-TTS提供了一种本地化处理方式。准备一段清晰的参考音频,再输入新的文本,就可以生成接近参考音色的语音。模型和素材都运行在自己的电脑上,更适合需要反复调整和批量生成的使用场景。
本文会使用Windows整合包完成部署,避免从零配置Python、CUDA和模型环境。解压后通过PowerShell脚本启动服务,再进入TTS推理页面,导入参考音频、填写文案并完成第一次语音生成。
硬件方面,独立显卡和足够的显存会明显影响生成速度。首次启动还可能需要下载模型,因此建议提前预留存储空间,并避免将整合包放在带有中文、空格或特殊字符的目录中。
本地流程跑通后,还会借助 cpolar 将Index-TTS的9872端口映射到公网,并配置固定二级子域名和访问验证,让这套本地语音服务可以在其他设备上远程使用。

Index-TTS(Index Text-to-Speech)是一个工业级的、可控且高效的零样本文本转语音(TTS)系统。它主要基于 XTTS 和 Tortoise 等先进的语音合成技术,旨在提供高质量、高效率的语音克隆和文本转语音服务。Index-TTS 的核心优势在于其“零样本”能力,这意味着它只需要极少量的参考音频(甚至无需预先训练),就能学习并模仿特定音色的语音风格,从而生成自然、富有表现力的语音。
Index-TTS 的主要特点包括:
工业级品质: 具备在实际应用中稳定运行和提供高质量语音输出的能力。可控性: 允许用户对语音的语速、音调、情感等多个维度进行精细化控制,以满足不同场景的需求。高效性: 优化了语音合成的效率,能够在较短时间内完成文本到语音的转换。零样本学习: 仅需少量参考音频即可实现声音克隆,极大地降低了使用门槛。多语言支持: 能够支持中文和英文等多种语言的语音合成。简而言之,Index-TTS 让普通用户也能轻松拥有一个“声音克隆工厂”,无论是为视频配音、制作有声读物,还是为智能应用提供个性化语音,都能得心应手。
由于官方的开源代码方式部署环境较为复杂不适宜新手小白入门上手,所以本教程演示的将使用@宇宙重女库瓦特罗,@心空 12138 制作的整合包,让新手小白入门上手变得更加简单!
在开始使用 Index-TTS 整合包之前,请确保您的计算机满足以下基本要求:
| 硬件/软件类别 | 最低要求 | 推荐配置 | 说明 |
|---|---|---|---|
| 操作系统 | Windows 10 | Windows 11 | 确保系统已安装最新的系统更新和驱动程序 |
| 显卡类型 | NVIDIA 显卡 | NVIDIA 显卡 | 必须支持CUDA |
| 显存容量 | 6GB | 8GB 或更高 | 显存越大,处理速度越快 |
| 显卡型号 | GTX 1060 6GB | RTX 3060 及以上 | 推荐RTX系列以获得更好性能 |
| 处理器 | Intel i5 / AMD Ryzen 5 | Intel i7 / AMD Ryzen 7 | 多核心处理器有助于提升性能 |
| 内存(RAM) | 8GB | 16GB 或更高 | 内存不足可能导致程序崩溃 |
| 存储空间 | 10GB 可用空间 | 20GB 可用空间 | 用于安装和运行,模型文件较大 |
| 网络速度 | 2MB/s | 5MB/s 或更高 | 首次运行需要下载模型文件 |
特别提醒:
| 情况 | 说明 | 建议 |
|---|---|---|
| 无独立显卡 | 可以使用CPU进行推理 | 处理速度会非常慢,请做好心理准备 |
| 首次启动 | 系统会自动下载模型文件 | 这可能需要较长时间,请耐心等待 |
| 运行环境 | 建议关闭其他占用显存的应用程序 | 以确保最佳性能 |
满足以上要求的计算机可以流畅运行 Index-TTS 整合包,为您提供高质量的声音克隆服务。
整合包获取:

这边将以windows操作系统进行操作演示,所以这里下载windows的整合包。
将解压工具7-Zip下载下来后安装,使用7-Zip工具进行解压整合包:

接着进入到解压后的目录,找到脚本run.ps1,右键点击使用PowerShell运行:

运行后,会弹出PowerShell窗口:

等待一会儿,浏览器会自动打开网页:
http://localhost:9874
可以看到,Index-TTS正常启动啦!
首先,在网页上点击1-TTS推理,然后点击打开TTS推理WebUI按钮,如下图:

接着,将准备好的音频素材放入工作目录WORKSPACE中:
D:AIIndexTTSindex-tts-testWORKSPACEsource灵笼-白月魁
这里将音频素材放在工作目录的source目录下:

接着,回到页面,依次如下图操作:

点击刷新文本后,滚动到下方,上传原素材参考音频,然后点击生成音频按钮:

生成完成后,可以点击播放按钮进行播放,也可以将其下载,下来:

也可以在工作目录中找到克隆生成的音频文件:

让我们试听一下原素材的音频和克隆后的音频对比:
原素材(灵笼-白月魁 [分离人声-43s]):
您的浏览器不支持 audio 标签。
克隆后的音频文件:
好啦,是不是特别的像?到这儿,Index-TTS克隆声音的教程就结束啦!
很多时候我们在本地电脑或服务器上部署了 Index-TTS,但又希望能在外面随时访问,比如和同事协作、给客户演示,或者让别人直接调用生成语音。问题是本地服务默认只能在局域网里用,外网是访问不到的。通过 cpolar 我们可以把本地的 Index-TTS 安全地映射到公网,得到一个随时可用的公网地址,这样无论身处何地,都能方便地远程使用和共享,再也不用折腾复杂的网络配置或购买固定公网 IP。
打开cpolar官网的下载页面:点击立即下载 64-bit按钮,下载cpoalr的安装包:

下来下来是一个压缩包,解压后执行目录种的应用程序,一路默认安装即可,安装完成后,打开cmd窗口输入如下命令确认安装:
cpolar version
出现如上版本即代表安装成功!
访问cpolar官网,点击免费注册按钮,进行账号注册

注册页面:

注册完成后,在浏览器中输入如下地址访问 web ui管理界面:
http://127.0.0.1:9200
输入刚才注册好的cpolar账号登录即可进入后台页面:

前面可以看到,TTS推理WebUI的界面,端口显示为:9872

所以我们需要将该端口进行穿透以支持咱们公网访问!
随机域名方式适合预算有限的用户。使用此方式时,系统会每隔 24 小时左右 自动更换一次域名地址。对于长期访问的不太友好,但是该方案是免费的,如果您有一定的预算,可以查看大纲4.2 的固定域名方式,且访问更稳定。
点击左侧菜单栏的隧道管理,展开进入隧道列表页面,页面下默认会有 2 个隧道:

点击website隧道的编辑按钮,填写如下信息:

接着,点击左侧菜单的状态菜单,接着点击在线隧道列表菜单按钮,可以看到有2个website的隧道,一个为http协议,另一个为https协议:

接下来在浏览器中访问website隧道生成的公网地址(http和https皆可)
这里以https为例:

可以看到成功访问啦!
进入官网的预留页面:https://dashboard.cpolar.com/reserved

列表中显示了一条已保留的二级子域名记录:
地区:显示为China Top。二级域名:显示为indextts。 注:二级域名是唯一的,每个账号都不相同,请以自己设置的二级域名保留的为主进入侧边菜单栏的隧道管理下的隧道列表,可以看到名为index-tts的隧道

点击编辑按钮进入编辑页面,修改域名类型为二级子域名,然后填写前面配置好的子域名,点击更新按钮:

来到状态菜单下的在线隧道列表可以看到隧道名称为index-tts的公网地址已经变更为二级子域名+固定域名主体及后缀的形式了:

这里以https协议做访问测试:

访问成功!
接下来进行测试,这里使用原来的音频素材,文案换一个如下:
cpolar 是一款内网穿透工具,可以将你在局域网内运行的服务(如本地 Web 服务器、SSH、远程桌面等)通过一条安全加密的中间隧道映射至公网,让外部设备无需配置路由器即可访问。操作步骤参考图如下:

可以看到,成功生成且下载下来了克隆的音频文件,让我们听一下输出的效果:
这样一来,即使 Index-TTS 服务部署在家中或本地服务器,使用 cpolar 将其映射到公网后,人在外地也可以像访问普通网站一样通过浏览器直接使用家中的语音服务。无论是远程协作、给客户演示,还是随时生成语音内容,都无需担心网络配置复杂或公网 IP 问题,让使用更加灵活便捷。
由于Index-TTS服务的WebUI界面无需登录即可进行访问,为了保护个人的隐私即安全,cpolar的隧道服务支持给网站添加授权验证功能,防止您部署在家中的Index-TTS服务被滥用。
首先,打开隧道列表,点击编辑index-tts的隧道:

然后,点击高级按钮,展开,按照如下图进行配置:

点击更新按钮后,访问穿透的地址,可以发现需要授权验证:
https://indextts.cpolar.top
输入用户名admin和密码123456进行登录:

可以发现,成功登录进来啦!这样,一个可以随时访问且带有安全性的Index-TTS网页端就弄好啦!
完成部署以后,这台Windows电脑就具备了一套独立的语音生成环境。参考音频、输入文本和生成文件都可以保存在本地,适合视频旁白、课程配音、有声读物和个人语音助手等场景。
Index-TTS的实际效果与参考音频质量关系很大。背景噪声、多人说话、音乐伴奏和明显混响都会影响音色还原,建议优先使用单人、清晰、语速自然的干净音频,并对生成结果进行试听和人工检查。
通过 cpolar 映射9872端口后,用户可以在外部设备上打开WebUI,提交文本并下载生成结果。随机域名适合临时演示,固定二级子域名更适合长期协作和个人收藏。
由于Index-TTS页面默认可能没有完善的登录机制,公网开放时必须增加访问验证,并使用强密码。示例中的admin:123456只能用于说明格式,不能直接作为正式密码。
声音克隆还涉及明确的使用边界。参考声音应来自本人,或已经获得声音权利人的明确授权;不要用于冒充他人、伪造身份、制作误导性内容,也不应未经同意复制公众人物或普通人的声音。
Index-TTS负责把本地显卡变成语音生成工具,cpolar负责补上远程访问能力。两者结合后,配音工作不再受固定电脑和局域网限制,但便利性必须建立在授权、标注和安全使用的基础上。
如果小假的内容对你有帮助,请点赞,评论,收藏。创作不易,大家的支持就是我坚持下去的动力!
