最能揭示 FireRedTTS3 能力的命令,比起“克隆这个声音”,更接近文字处理器里的查找与替换:取一段现有录音,要求系统替换其中一个短语,得到一段新生成的话语,同时尽量保留说话者身份和未经编辑的词语。同一次发布还涵盖语音插入与删除、语速音高音量调整、根据文字描述设计新声音,以及参照音频片段模仿声音。[1][2]
这组能力随之改变了处理语音时的基本单元。工作范围从依照脚本生成合成声音,扩展到了录制话语本身;其中的词语和声学属性都可以在同一模型界面内修改。
小红书 FireRed 团队把发布拆成了两周内的几个阶段。现有模型卡将 Base 的发布日期标为 2026 年 8 月 5 日,Instruct 模型和 PyTorch 代码随后于 8 月 13 日发布,技术报告则在 8 月 18 日上线 arXiv。[1][2][3] 整套发布包还包含连续语音 tokenizer,并采用 Apache 2.0 许可证。对于一个新语音系统,这样的开放程度相当少见,也清楚展示了“开放模型”与“完备的语音产品”是两项不同主张。
封面照片让这一区别落到现实地点。画面中的上海复兴广场 SOHO 被 Commons 标注为小红书所在的建筑群,公司官网的联系页面则列出了 C 座地址;封面取材于办公场所,没有采用波形、合成人像或模型示意图。[7][9] FireRedTTS3 是一家公司的研究发布,代码与权重均已实际公开。这些产物之外,产品层面的约定仍有待补齐。
两个检查点,两种不同承诺
Base 模型负责零样本声音克隆。用户提交参考音频及其转写文本、新文本和语言设置后,系统会生成新文本对应的语音,声音特征由参考样本决定。团队列出 24 种语言,其中包括中文和粤语;另行列出的还有 21 个中国方言标签,包括四川话、上海话、闽南语、温州话、吴语等。README 建议参考提示音频采用目标语言或方言,以取得最佳效果。[1][2]
Instruct 模型扩展了能力范围。一个 Python 类即可调用四类任务:不提供参考音频的声音设计、语义编辑、声学编辑,以及基于参考音频的声音克隆。以“温柔的年轻女性,语速稍慢,语气活泼”为例,声音设计请求会先生成文字形式的声音方案,再据此合成语音。语义编辑请求会改写转写文本,并预测需要改动区域的掩码。声学编辑则直接处理录音的语速、音高或音量。[1][2]
这样的划分很重要,因为标题所列的各项能力分别落在不同路径上。多语言、多方言主张属于 Base 检查点及其显式语言标签路径;Instruct 检查点覆盖更广的编辑任务,它从经过指令微调的文本模型初始化,并接受声音设计与编辑训练。采用方需要测试最终上线的具体检查点和调用路径;把“FireRedTTS3”当成一套各处表现一致的能力,会掩盖其中的差别。
发布内容也被拆成独立组件。Hugging Face 分别托管 Base、Instruct 和 RedAE 检查点文件,代码库则提供推理代码和文本前端。[3] 这种发布方式条理清晰:tokenizer 没有藏在 API 后面,检查模型家族时也省去了逆向分析托管服务的环节。
相较 FireRedTTS2,这是一次产品能力重心的转移
2025 年发布的 FireRedTTS2 强调另一组任务:七种语言的长文本生成、多说话者对话、流式推理,以及作者报告的最低 140 毫秒首包延迟,测试硬件为 Nvidia L20。FireRedTTS3 扩大了语言与方言的覆盖面,并通过 Instruct 检查点加入声音设计、语义编辑和声学编辑。[1][2][8]
因此,TTS3 显示的是方向转移,现有证据还不足以证明它在各方面全面接替 TTS2。论文和 README 均未公布可比的流式延迟、实时率、显存占用、长文本或多说话者结果。[1][2] 评估实时对话的团队仍会关注 TTS2 的交付约定;开发修订工具的团队则能从 TTS3 得到更切合需求的新能力。
中间方案是这套产品构想的核心
FireRedTTS3 的技术论述,起点是连续自回归语音生成中的一个问题。连续表征能够留住精细声学细节,其中一部分在离散语音 token 中容易流失,因此很适合在编辑时维持声音特征。随着模型接连生成潜变量分块,细小的预测误差也存在逐步累积的风险,最终造成音色漂移或韵律崩塌。[1]
团队给出的答案是 RedAE:一种在冻结音频编码器指导下训练的连续语音表征。作为教师的编码器已经学习过语音识别、说话者验证等语音理解任务,其特征会引导 RedAE 保留语言含义与说话者线索,自编码器同时学习重建声音。tokenizer 训练结束后,教师编码器便被移除。在下游环节,以 Qwen3 初始化的骨干网络预测序列,再由扩散 Transformer 生成音频潜变量。[1]
真正有用的构想超出了“增加训练量”:模型会先把含混的指令转换成范围明确的方案,再渲染输出。声音设计把文字描述映射为 12 项声学属性;语义编辑把指令转换为目标转写文本和文本编辑掩码。意图与波形之间由此多出一层开发者可读的信息:输出中应有哪些词、转写文本的哪一段被选中,以及模型认为用户要求了哪些声音属性。[1]
训练规模可观,相关披露则全部来自团队一方。论文报告称,RedAE 使用 500,000 小时混合音频;Base 第一阶段使用 260 万小时中英文语音;多语言与方言阶段使用 560,000 小时;Instruct 使用 330,000 小时声音设计与编辑数据。RedAE 还在 32 块 H800 GPU 上训练了 550,000 步。[1] 这些数字表明团队内部投入了一项严肃的工程计划,但没有披露说话者层面或权利层面的语料构成,外部团队也无法依靠公开数据复现其训练。
API 中的“自由形式”在不同位置收束
发布页面把该系统称为自由形式语音编辑器,这个描述在一条重要路径上准确成立:语义编辑可以用普通指令完成插入、删除和替换。论文同时评测了模板式语义请求和开放式语义请求。[1][2][5]
声学编辑的范围更窄。公开 API 明确说明,该路径不支持自由形式的措辞。语速请求必须采用训练过的模板,数值从 0.5 到 2.0,以 0.1 为间隔;音高采用 -6 到 +6 的整数偏移,0 除外;音量采用 0.3 到 2.0 的数值,同样以 0.1 为间隔。[2] “让声音稍微温暖一点,语气别那么匆忙”可以落入声音设计的范围,文档所列的声学编辑命令却没有这一表达。生产界面需要把宽泛的用户语言转换成离散控制项,并把转换结果清楚地列给用户,以便修正。
多语言文本前端也有类似的接缝。FireRedTTS3 可以接收显式语言标签,也可以选择下载 FastText 的语言识别模型。默认的本地文本规范化器支持中文和英文。其他语言只经过基础清理;若要增加处理能力,运营方需要启用 LLM 规范化器,并连接外部 OpenAI 兼容端点,示例配置指向 DeepSeek。[2]
这项限制出现在运行环节,语音模型本身的质量需要另行评估。不过,日期、货币、缩写和数字能否正确读出,本就是一套可用文本转语音系统的组成部分。因此,“支持 24 种语言”不能等同于“随附覆盖 24 个地区、可完整离线运行的文本前端”。处理私密脚本或隔离网络媒体的团队需要自备规范化路径,避免文本在无提示的情况下送往另一项模型服务。
计分表衡量的是组件,完整听感仍在范围之外
论文评测了四类任务,并交代了几项重要设置。Seed-TTS-Eval 覆盖英语、中文和一个难度更高的中文子集;可懂度由 Whisper 或 Paraformer 的转写结果衡量,WavLM 则用于估算说话者相似度。MiniMax-MLS-Test 把比较范围扩展到 24 种语言。在这些由作者报告的测试中,FireRedTTS3-Base 在参评系统里取得最低的平均错误率和最高的平均说话者相似度。[1]
理解这些平均值需要结合具体结果。在多语言测试中,FireRedTTS3 的平均 WER/CER 为 3.75%,仅比 MiniMax 的 3.77% 低 0.02 个百分点;其平均说话者相似度得分为 84.8%,在所列系统中居首。可懂度成绩进入第一或第二名的范围,只覆盖 24 种语言中的 8 种。作者还特别标出粤语字符错误率 40.32%,并提醒 Whisper 的粤语识别能力有限,因此该数值同时混入了评测器的误差,难以只归因于合成器。[1] 单一平均值会遮蔽整体差距很小和各语言差异很大这两层事实。
声音设计采用 InstructTTSEval,这套 6,000 项中英文基准覆盖声学参数、描述性风格和角色扮演。[4] 官方工具包以一个 Gemini 预览版模型充当自动评审;由于该版本已经无法使用,FireRed 团队改用 Gemini 2.5 Pro,对所有参评系统重新打分。[1][4] 这样处理能维持论文表格内部的一致性,但评测协议已经改动,判断仍由另一模型给出。面向目标用户的听测依然不可替代,方言是否地道、情绪、社会语域和意外出现的身份相似性尤其需要真人判断。
编辑能力的评测采用蚂蚁集团的 Ming-Freeform-Audio-Edit 基准。语义任务衡量词语插入、删除或替换是否正确,ASR 能否继续识别未编辑的词,以及说话者相似度是否保留;声学任务则测试语速、音高和音量。[1][5] FireRedTTS3 的报告平均分领先 Ming-UniAudio-Edit,但分项结果有升有降。以开放式插入为例,FireRed 的输出词错误率更高,未编辑词语的 ASR 错误率也更高,同时在英语测试中提升了说话者相似度和编辑准确度。[1] “最佳编辑器”的外延过宽。现有证据能够支持的说法是:在论文选用的识别器、说话者编码器、自动评审和参评系统范围内,这次发布在两套基准上表现强劲。
缺少的产物是一份来源追溯记录
语音编辑带来了普通文本编辑所没有的身份问题。一次干净的替换,能让真人看起来说过从未出口的话。被克隆的音色也会脱离参考音频录制时的具体情境或授权范围,继续流传。
FireRed 代码库承认了滥用风险:README 表示声音克隆功能仅供学术研究使用,警告用户不得从事违法活动,并要求用户举报欺诈行为。这些文字属于免责声明,并未在 Apache 2.0 许可证之外增加限制;代码和检查点仍按该许可证开放。README 和模型卡都没有说明说话者授权流程、输出水印、身份阻止名单或签名的来源追溯清单。[2][3] 警告确立了一项重要规范,却没有带来执行或验证层。
针对缺失层中的一部分,现有技术已经给出了相应术语。C2PA 2.4 规范支持音频来源追溯清单,区分新建资产与衍生资产,定义 c2pa.changedSpeed、c2pa.edited 和 c2pa.dubbed 操作,并加入 c2pa.ai-disclosure 声明,其中包含模型身份和人工监督字段。[6] C2PA 对说话者是否同意无从证明,元数据也可以被移除。不过,导出工具至少可以签名记录模型与检查点身份、现有录音曾被打开这一事实、选中的时间区段、用户要求的操作,以及输出属于生成资产还是衍生资产。
对于真正用于配音、无障碍服务、播客或本地化的工具,发布约定还应增加三份凭据。第一份是授权:谁拥有源声音,哪些变换已经获准。第二份是沿袭关系:哪一段音频、哪份转写文本、哪个模型版本和哪个编辑掩码共同生成了输出。第三份是质量:由真人听测实际采用的语言或方言,并检查未编辑片段、姓名、数字和情感意图是否得到保留。
FireRedTTS3 的吸引力,在于它把一种困难的抽象概念落到了具体操作上。语音如今可以进入由指令引导的修订循环。系统依然会解码一条完整的新生成波形;转写文本和编辑掩码描述的是模型意图修改之处,无法证明哪些音频采样点原封未动。此次公开发布呈现了足够多的循环环节,外界可以据此研究和开发。下一项真正有意义的升级,应让编辑后的声音携带自身历史;再增加一个平均分,价值有限。
来源
- Feiyu Shen 等,《FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations》,arXiv:2608.17492v1(2026 年 8 月 18 日;架构、训练、评测设置与结果)。
- FireRed Team / 小红书,
FireRedTTS3官方 GitHub 代码库(2026 年 8 月 13 日发布;代码、API、文本前端行为、控制范围、免责声明与 Apache 2.0 许可证)。 - FireRed Team,
FireRedTTS3官方 Hugging Face 模型库(模型卡时间线将 Base 和 Instruct 的日期分别标为 8 月 5 日与 8 月 13 日;Base、Instruct 和 RedAE 检查点包;模型卡元数据)。 - Kexin Huang 等,《InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems》,arXiv:2506.16381(2025 年 6 月 19 日;6,000 项基准设计与自动评审方法)。
- inclusionAI,
Ming-Freeform-Audio-Edit官方基准代码库(语义与声学编辑任务、开放式与模板式指令集,以及评测脚本)。 - 内容来源与真实性联盟,C2PA Technical Specification 2.4(音频支持、衍生资产操作记录与 AI 披露声明)。
- Wikimedia Commons,“SOHO Fuxing Plaza (20250610160414).jpg”(N509FZ 于 2025 年 6 月 10 日拍摄;页面将这座建筑群标为小红书总部;CC BY-SA 4.0)。
- FireRed Team,
FireRedTTS2官方 GitHub 代码库(这项 2025 年前代发布对七种语言、长文本、多说话者、流式处理和延迟的主张)。 - 小红书,官方版权联系页面(中文;公司地址位于上海复兴 SOHO 广场 C 座)。