FireRedTTS3是什么?24语言+21中文方言开源TTS语音克隆系统完整介绍

发布时间:2026/10/11 19:20:18
FireRedTTS3是什么?24语言+21中文方言开源TTS语音克隆系统完整介绍 【免费下载链接】FireRedTTS3FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing项目地址https://gitcode.com/gh_mirrors/fi/FireRedTTS3点击查看免费下载FireRedTTS3是一个开箱即用的开源TTS 语音克隆系统一套模型同时搞定24 种语言21 种中文方言的零样本声音克隆还支持用自然语言设计全新音色、对已有录音做内容级编辑。基于 Apache-2.0 许可免费使用本文带你从零部署到实战附完整功能、架构与源码导读。 FireRedTTS3 核心功能一览克隆 设计 编辑FireRedTTS3 提供两个变体覆盖绝大多数 TTS 场景变体能力适用场景FireRedTTS3-Base24 语言 21 方言零样本语音克隆有声书、多语种配音、方言内容FireRedTTS3-Instruct语音克隆 自然语言音色设计 语音编辑定制音色、后期改词、调语速✨四大亮点24 种语言中文、英语、日语、韩语、粤语、阿拉伯语、法语、德语、俄语、西班牙语、泰语、越南语、印地语……覆盖全球主流语种️21 种中文方言四川话、粤语、闽南话、上海话、天津话、辽宁话、湖北话、广东福建等地道方言腔调自然语言音色设计无需参考音频一句温柔的年轻女声、语速稍慢即可生成全新音色✂️自由语音编辑对录音插入/删除/替换词句或调整语速、音高、音量️ 技术架构揭秘连续语音表示驱动语音克隆FireRedTTS3 的核心创新是语义富集的连续语音表示RedAE Tokenizer。与传统离散 token路线不同它把 24kHz 音频压缩成 25Hz 的连续潜变量再由Qwen3-1.7B主干 Transformer DiT扩散 Transformer解码头逐块自回归还原波形兼顾自然度与可控性。上图左半为RedAE Tokenizer连续语音编码器 语义蒸馏中间是FireRedTTS3-Base克隆管线右侧是FireRedTTS3-Instruct指令驱动管线。主干模型细节可参考 fireredtts3/llm/fireredtts3_base.py 中的 Qwen3-1.7B 配置以及 fireredtts3/redae/redae.py 的连续表示编码器。 快速开始3步部署开源TTS语音克隆系统第一步克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/fi/FireRedTTS3.git cd FireRedTTS3 pip install -r requirements.txt第二步下载预训练模型将模型下载到pretrained_models/目录约需数 GB 磁盘空间pip install huggingface_hub[cli] hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/第三步启动 Gradio 图形界面最易上手pip install gradio # 零样本语音克隆 python gradio_base.py --host 0.0.0.0 --port 7860 # 音色设计 语音编辑 python gradio_instruct.py --host 0.0.0.0 --port 7860浏览器打开http://localhost:7860即可拖入音频、选择语言、一键合成。️ 零样本语音克隆实战24语言21方言一句话生成克隆效果的关键参考音频的语种/方言最好与目标一致。合成四川话就用四川话参考音频合成日语就用日语参考音频。import torchaudio from fireredtts3.core import FireRedTTS3 tts FireRedTTS3(pretrained_models, use_wetextTrue) prompt_audio, prompt_audio_sr torchaudio.load(prompt.wav) gen_audio, gen_audio_sr tts.generate( languageChinese, # 传 None 可自动检测语种 prompt_text参考音频对应的文字, prompt_audioprompt_audio, prompt_audio_srprompt_audio_sr, text今天天气很好我们一起去公园散步吧。, ) torchaudio.save(gen.wav, gen_audio.cpu(), gen_audio_sr) 系统会自动完成文本清洗 → 语种判定 → 长文拆句 → 逐句合成 → 淡入淡出拼接长文本无需手动切分。完整前端逻辑见 fireredtts3/core.py。 Instruct 高级玩法自然语言音色设计与语音编辑FireRedTTS3-Instruct 用一个入口统一了四类任务方法作用示例指令generate_tts零样本克隆参考音频 文本generate_voice_design自然语言音色设计温柔的年轻女声语速稍慢generate_semantic_edit内容级编辑把 cats 换成 dogsgenerate_acoustic_edit声学编辑adjust the speed to 0.5xfrom fireredtts3.core import FireRedTTS3Instruct instruct FireRedTTS3Instruct(pretrained_models, use_wetextTrue) # 音色设计无需参考音频 gen_audio, gen_audio_sr, plan instruct.generate_voice_design( instruction一个年轻女性的温柔嗓音语速稍慢带一点俏皮。, text今天天气很好我们一起去公园散步吧。, ) print(音色规划:, plan) 声学编辑需遵循训练模板语速adjust the speed to X、音高shift the pitch by N steps、音量adjust the volume to X。API 细节见 fireredtts3/core.py。️ Gradio 图形界面体验多语种方言TTS在线演示左侧是Base 多语种/方言克隆界面选语言、上传参考音频、输入文本右侧是Instruct 音色设计与语音编辑界面可切换 Semantic / Acoustic 两种编辑模式。界面脚本位于 gradio_base.py 与 gradio_instruct.py。 性能表现语音克隆质量评测对比FireRedTTS3 在主流评测集上表现领先Seed-TTS-eval克隆质量平均 WER/CER3.04%、平均说话人相似度78.8%双双第一MiniMax-MLS-Test24 语言多语克隆平均 WER/CER3.75%、平均相似度84.8%均为最优相比 CosyVoice3、IndexTTS2、VoxCPM2 等开源方案在准确率与音色相似度上均有明显优势。 项目结构与源码导读路径说明fireredtts3/core.py合成主入口含文本前端 4 类任务fireredtts3/llm/fireredtts3_base.pyBase 克隆模型fireredtts3/llm/fireredtts3_instruct.pyInstruct 指令模型fireredtts3/llm/dit.py扩散 Transformer 解码头fireredtts3/llm/patch_encoder.py块级编码器fireredtts3/redae/redae.pyRedAE 连续语音表示fireredtts3/campp/campp.pyCAM 说话人嵌入提取fireredtts3/utils/text_normalize.py文本规整前端wetext / LLM TN依赖清单见 requirements.txt许可见 LICENSEApache-2.0。⚠️ 常见问题与使用注意事项 克隆效果不理想优先选择与目标语种/方言一致的参考音频并使用清晰干声 其他语言的文本规整默认 wetext 只支持中英/粤语多语种可开启use_llm_tnTrue需配置 LLM API️ 合规提示零样本克隆能力仅限学术研究请勿用于任何非法用途总结FireRedTTS3 把24 语言 21 方言的语音克隆、自然语言音色设计、自由语音编辑收敛到一个开源模型里Apache-2.0 许可、提供 Gradio 界面与 Python API是个人开发者与研究者快速上手多语种 TTS 的完整方案。赞分享【免费下载链接】FireRedTTS3FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing项目地址https://gitcode.com/gh_mirrors/fi/FireRedTTS3点击查看免费下载相关推荐如何快速搭建F5-TTS语音克隆系统从安装到集成的完整指南如何快速搭建F5 TTS语音克隆系统从安装到集成的完整指南 F5 TTS是一款基于流匹配技术的语音合成模型能够生成流畅自然的语音支持多语言语音克隆功能。本语音人工智能音频预训练OpenVoice跨语言克隆实战中文语音克隆英语发音示例OpenVoice跨语言克隆实战中文语音克隆英语发音示例 引言打破语言壁垒的语音克隆技术 你是否遇到过这些场景录制多语言教学视频时需要专业配音跨境电商广人工智能语音音频OpenVoice跨语言语音克隆实战中文转英语发音完整指南OpenVoice跨语言语音克隆实战中文转英语发音完整指南 引言突破语言边界的语音克隆技术 在全球化日益深入的今天跨语言语音合成技术正成为连接不同文化的重人工智能语音音频创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考