MegaTTS3：声音克隆及语音合成-AI应用帮

请先查看下方配置要求，确认电脑能使用再下载，如果不知道什么是网盘、什么是压缩包以及什么是电脑配置，请勿下载

MegaTTS3 是由字节跳动与浙江大学联合推出的开源语音合成工具，主模型仅有 0.45 亿参数，具备高度轻量化优势。此外，MegaTTS3 还引入了口音强度控制功能，用户可以通过调整参数生成带有不同程度口音的语音，为个性化语音应用提供了更多可能性。

注意：为防止滥用，此工具暂不支持自定义音色，如需增加音色文件，则需要上传到官方仓库，等待官方生成npy文件方可使用（上传的文件所有人均可查看并下载，请勿上传敏感信息）

开源地址：https://github.com/bytedance/MegaTTS3

☞☞☞☞☞☞ 一键启动包在右侧下载 ☞☞☞☞☞☞

配置要求：

电脑满足以下配置：

操作系统：Windows 10/11 64位
内存：20G以上
显卡：至少8G及以上显存的英伟达（NVIDIA）显卡，显卡性能越好，生成速度越快
CUDA：显卡支持的CUDA版本大于等于12.8版本（如不知道显卡支持的CUDA版本，可点击此链接查看：https://aiyy.info/supported-cuda-versions/）
整个包解压完约14.5G，要留足硬盘空间

如何查看显卡品牌型号和显存：

打开任务管理器
点击“性能”
点击“GPU”
右上角可以看到显卡型号，下方可以看到显存大小

使用教程：

① 打开下载页面（https://aiyy.info/megatts3/）点击页面右侧下载按钮，下载整合包之后解压，建议使用winrar解压（解压软件在文件包中，或者可以自己下载安装，下载地址：https://www.winrar.com.cn/）

不要用Windows自带解压！！不要用360解压！！

注意：文件夹路径和文件名称（包括音频、图片、视频等文件名称）不要出现中文字符，否则部分软件会因识别不出而报错

② 双击“一键启动.bat”，稍等片刻会在浏览器中自动打开操作界面

③ 直接使用：

选择示例音频，选择对应音色文件，再输入需要合成的文本，最后点击“合成”，等待生成完毕，生成结果位于右侧

如下方所示：

音频示例：

生成结果：

可以播放试听，点击右上角下载按钮可以保存至指定文件夹

在文件包中的“outputs”文件夹中也能找到生成结果

④ 增加音色：

点击“音频及npy文件仓库”按钮可跳转进入官方音频文件及npy文件仓库，将音频示例及对应的npy文件下载到文件包中的“assets”文件夹中即可使用（需要科学上网）

点击“上传音频文件仓库”按钮可进入上传音频文件仓库，将需要生成npy文件的音频上传到此仓库中，等待官方生成npy文件，即可在“音频及npy文件仓库”中下载使用（需要科学上网）

这里也给大家下载好了仓库中截止2025年4月10日的所有示例音频及音色文件，已打包放在网盘中，解压之后将里面的音频示例及对应的音色文件放置到文件包中的“assets”文件夹中即可使用

将音频示例及对应的音色文件放置到文件包中的“assets”文件夹中之后，在操作界面点击“刷新文件夹”，即可在“音频文件选择”及“潜在文件选择”下拉框中选择音频示例及对应的音色文件

声明： ① 本站所有资源版权均属于原作者所有，这里所提供资源均只能用于参考学习用，请勿直接商用。若由于商用引起版权纠纷，一切责任均由使用者承担。更多说明请参考赞助计划。 ② 本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

MegaTTS3：声音克隆及语音合成

请先查看下方配置要求，确认电脑能使用再下载，如果不知道什么是网盘、什么是压缩包以及什么是电脑配置，请勿下载

☞☞☞☞☞☞ 一键启动包在右侧下载 ☞☞☞☞☞☞

配置要求：

使用教程：

相关文章

DiffMorpher：一键生成两张图片平滑变形视频

Hi3DGen ：图片生成3D模型

Sonic: 图片生成说话/唱歌数字人

FramePack：低显存可用的AI图生视频

近期文章