客观指标能替代 MOS 吗:MCD 这类分数怎么看

2026-08-24

做一次可信的 MOS 测试,要凑够足够多的听众、随机化呈现顺序、放锚点样本、还要剔除乱点的作答者。 一轮下来时间和成本都不小,而模型迭代是每天甚至每小时发生的。于是几乎每个做 TTS 的团队都会问同一个问题:能不能找几个机器算得出来的分数,把人耳这一环省掉?

答案分两半。客观指标确实能承担相当一部分工作——但不是”替代 MOS”这个工作,而是”在两次 MOS 之间守住底线”这个工作。 想把这件事想清楚,得先知道常用的那几类分数各自在测什么。

四类客观指标,一张表看清边界

指标衡量什么需要什么前提能顶替 MOS 的哪部分盲区在哪
MCD(梅尔倒谱失真)合成音频与参考音频的频谱差异必须有一段对齐的参考录音”复现某段特定录音”的保真度自由合成的自然度完全测不了
字错误率回测把合成音送进 ASR,看识别错多少一套稳定的 ASR 系统 + 原文可懂度,能抓读错字、吞字、断句崩坏不衡量自然度,机器腔照样满分
说话人相似度声纹嵌入之间的余弦相似度目标说话人的参考音频克隆像不像本人只答音色,不答好不好听
自动 MOS 预测用模型预测人类会打几分一个预训练好的打分模型大规模回归筛查,找异常样本训练分布之外的音频,预测未必可靠

表里最值得停下来的是后两列的错位:每个指标能顶替的都只是 MOS 的一个切片,而它们的盲区加起来,恰好盖住了”好不好听”这个最核心的问题。下面逐条拆。

MCD 的前提最苛刻,也最容易被误用

MCD 衡量的是合成音频与参考音频在梅尔倒谱域上的距离,数值越小代表越接近。听起来像一个通用音质分——但它有一条硬前提:必须存在一段与合成结果对齐的参考音频。

这条前提直接框死了适用范围。你让模型合成”今天天气不错”,MCD 要算出来,就得有一段真人念同一句话的录音,两段时间轴还要对齐。这在复刻某位配音演员某段录音这类任务里是成立的,参考就是原录音。

但绝大多数实际使用是自由合成——用户输入任意文本,世界上根本不存在对应的”标准答案录音”,MCD 无从算起。

更隐蔽的误用是:同一句话的不同念法都可能很自然。 重音放在”今天”和放在”不错”,人听都舒服,但与参考录音的频谱距离不一样,MCD 会惩罚那个和参考不同、但同样自然的版本。把 MCD 当通用音质分,本质上是把”和某段录音像不像”偷换成了”好不好听”——这两件事只在复刻任务里重合。

字错误率回测:测得准,但测的是另一件事

这个方法很朴素:把合成出来的音频送进一套 ASR 系统,拿识别结果和合成用的原文比对,算错误率(中文通常按字算 CER)。错误率高,说明这段音频连机器都听不清楚,人多半也够呛。

它的优点是自动化程度极高:不需要参考录音,只要有原文;可以跑全量测试集,不用抽样。它抓得住的问题也很具体:

  • 读错字——多音字消歧失败,“银行”读成”银 xíng”。
  • 吞字漏字——长文本切分不当,接缝处的字被吃掉。
  • 断句崩坏——韵律预测出错导致停顿离谱,把一句话切成两句不相干的。

但必须把口径说死:它衡量的是可懂度,不是自然度。 一段听起来完全像机器、语调平得像念条形码的音频,只要每个字都清清楚楚,这个指标会给它接近满分。反过来,一段真人录音里带了自然的换气和轻微迟疑,识别错误率反而可能更高。

还有两点要留神。第一,分数里混着 ASR 自己的错误,绝对值没有意义,只有同一套 ASR、同一批文本下的版本间对比才可信——这和 WER 只适合做同测试集相对比较 是同一个道理。第二,ASR 自身的准确率也容易被高估,别拿被高估的准确率当基准。

说话人相似度:只回答”像不像”

做声音克隆时,最关心的问题是”这个音色像不像本人”。对应的客观做法是用声纹模型分别提取参考音频和合成音频的说话人嵌入,算两个向量的余弦相似度。

它的边界很清楚:只回答音色的相似性,不回答音质好不好、韵律自不自然。 一段音色高度贴合但断句混乱的音频,在这个指标上依然漂亮。主观侧与之对应的是 SMOS(相似度 MOS),测的是同一个维度,一个用模型一个用人耳。

它还有个和 MCD 类似的依赖:结果受参考音频质量的牵制。参考音频有噪声、录音条件和合成音差异大,相似度会偏低,这未必是模型的问题。原理见声音克隆是怎么做到的

自动 MOS 预测:适合筛查,怕分布外

这一类是直接用模型预测”人类会给这段音频打几分”。它的诱惑力最大——输出的就是一个 MOS 形态的分数,看上去可以无缝替换掉主观评测。

它真正擅长的是大规模回归筛查:几千条样本跑一遍,把分数明显偏低的挑出来人工复听,效率远高于全量听。

但它有一个绕不开的固有问题:它是在特定数据上训练出来的模型。 训练时见过的是某一批系统、某一类合成范式产出的音频,以及对应的人类打分。当你送进去的是训练分布之外的音频——比如一种新的合成范式、一种它没见过的失真类型——它的预测未必可靠,而且不会告诉你自己不可靠,照样吐出一个看着挺正常的分数。

另外还得记住 MOS 本身的性质:MOS 不是绝对值,是相对值。 不同批次、不同听众、不同耳机、不同语料下的 MOS 不可直接比较。预测模型学的是某种特定条件下的打分习惯,它输出的分数继承了同样的相对性。完整展开见MOS 到底怎么打

一个能落地的工作流

把上面四条合起来,结论是清楚的:客观指标适合做回归监控、卡住明显的退化;最终的自然度判断仍然需要人耳。 落到日常操作上,可以这么排:

日常迭代(每次改动)——机器筛查

  1. 字错误率回测,守住可懂度底线。字都读不对的版本,不用往下看了。
  2. 克隆类任务加跑说话人相似度,确认音色没漂。
  3. 自动 MOS 预测,把分数掉得明显的样本捞出来人工复听。
  4. 复刻类任务(有对齐参考录音的)才跑 MCD

这一层的定位是卡门槛,不是评优劣:任一项比上一版明显变差就拦下来;都没变差,也不等于变好了。

关键节点(发版前、选型决策)——人耳评测

按 MOS 的正规流程做一轮:足够的听众、随机化顺序、加锚点样本、剔除不认真的作答。要对比两个版本孰优孰劣,用 CMOS 做两两比较比各测一次 MOS 更稳。

最后提醒一句:客观指标全绿、听起来仍然”像机器”是常态——那些让人出戏的原因(韵律平、停顿不当、高频损失、缺少换气声、语气与内容不匹配)大多不在任何一个客观指标的射程内,具体成因见为什么合成语音听着像机器

常见问题

问:能不能把几个客观指标加权成一个总分,用它替代 MOS?

可以做成一个看板,一眼看出哪个维度退化了,但别当 MOS 的替代品。权重本身没有客观依据,而且加权会把盲区一起平均掉——四个都不测自然度,加权之后仍然不测。当”退化告警”用,别当”质量判词”用。

问:MCD 一点用都没有吗?

不是。在有对齐参考录音的任务里它很有用:复刻某段特定录音、验证声码器改动是否引入频谱损失、回归测试确认输出没有整体漂移。问题只出在把它挪用到自由合成的自然度评价上。

问:自动 MOS 预测模型选哪个?

我们没做过横向实测,所以不给推荐。给一条可自查的原则:先用它给你已知好坏的样本打分,看排序是否符合你的人耳判断。 如果连你手上的已知样本都排不对,它在你的场景就是分布外的,别用。

相关阅读


本文讲的是语音合成评测领域的通用概念与方法边界,不绑定某一个具体实现。 我们没有对任何模型或打分工具做过实测,因此全文不给任何指标的具体数值、速度、排名或价格。 各类客观指标的计算细节与适用条件因实现而异,请以你所用工具的官方文档为准。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。