技术专题

语音技术:ASR 与 TTS

本专题共 40 篇,讲的是跨实现通用的语音技术: 识别与合成各自由哪些环节构成、指标该怎么读、管道每一段解决什么问题、上线时要算哪几笔账。 它和站内那些逐个仓库拆参数的专题是互补关系—— 那边回答「这个参数管什么」,这边回答「这类问题为什么存在」。 原理部分为语音领域的通用知识;涉及具体开源项目时, 仓库地址、许可证与能力范围依据各仓 README 与 GitHub 元数据核对,核对日 2026-08-24。 我们没有对文中任何项目做过性能实测, 因此全专题不给显存、速度、准确率一类的数字, 这类指标随版本与硬件变化很大,请以官方文档和你自己的实测为准。

ASR 入门与原理

从声波到文字要经过哪四个环节,端到端和传统混合系统的分工差在哪,以及一个新手常问的问题:为什么模型吃的不是原始波形,而是梅尔频谱。也包括流式与整段识别的取舍。

ASR 准确率与评测

WER 怎么算、为什么它能超过 100%、中文为什么改用 CER。还有一组更实用的内容:怎么建自己的业务测试集,以及识别准确率被高估的三种典型情况。

2026-08-24

识别准确率被高估的三种常见情况

报告里的准确率好看,拿业务音频一试就崩,落差多半来自评测方法的口子。这篇讲清测试集重叠、评测前归一化、音频裁剪三种情况的机制,外加只报平均值的陷阱,并给出一份追问清单。

2026-08-24

中文语音识别为什么看 CER 不看 WER

中文书面语没有天然词边界,换一个分词器就能让同一次识别算出不同的 WER,指标因此不可比。这篇讲清楚中文为什么改按字算 CER、中英混说该怎么定口径,以及 CER 自己掩盖了哪些差异,并给一张检查清单:拿到一个错误率数字时,你该追问哪几件事才能判断它值不值得信。

2026-08-24

自建 ASR 测试集:数据怎么选、标注怎么做

用公开数据集给自己的业务打分,几乎一定会得到虚高的成绩。这篇讲怎么用真实业务录音搭一个能指导决策的 ASR 测试集:按真实分布采样、规模够不够怎么判断、必须先定死的标注规范清单、双人标注的质控流程,以及建好后怎么用才不会失效。

2026-08-24

WER 怎么算:一个公式说清语音识别的准确率

WER 是衡量语音识别错误率的标准指标,公式看着简单,真正容易出错的是分母取谁、三类错误怎么对齐出来、以及它为什么能超过 100%。这篇带你手算一遍完整例子,把替换、删除、插入逐个标出来代入公式,同时讲清这个单一数字掩盖了什么。

ASR 上下游管道

识别模型只是中间一环。前面要 VAD 断句、要不要降噪,后面要 ITN 把「二零二五年」变回「2025 年」、要补标点、要给时间戳。这一组把每个环节的职责和坑说清楚,包括热词那个最常被误解的问题。

2026-08-24

标点恢复:ASR 输出没有句号该怎么办

语音识别的声学模型通常不吐标点,标点得靠一个独立的后处理模型补。这篇讲清它常见的序列标注建模方式、流式场景里"标点要看后文、输出却要立刻给"的根本矛盾,以及中文逗号用法宽松带来的评测困难,并附一张断句错误的排查表。

2026-08-24

降噪和回声消除,该放在 ASR 前面还是交给模型

回声消除必须放在管道最前面,因为它要拿到设备正在播放的参考信号;但降噪不一样,它未必是净收益,用力过猛会削掉语音本身的谐波结构。这篇讲清两者的摆位逻辑、四类噪声的不同对策,并给出一张"要不要降噪"的判断表和一份先测再降的验证清单。

2026-08-24

热词怎么配:让 ASR 认出你的专有名词

日常对话识别得挺好,一到公司名、产品名、人名就翻车,这是语音识别落地最常见的痛点。本文讲清热词(上下文偏置)改的到底是什么、三类做法的适用面、热词表怎么整理与验证,以及权重开太大导致误触发的副作用。

2026-08-24

长音频怎么切:切分点选错会吃掉哪些字

两小时的会议录音不能整段丢给识别模型,必须先切成片段。这篇讲为什么必须切、按什么切、切坏了有哪些症状:切点落在语音中间会吞字,重叠区不去重会重复,漏了回加时间戳偏移会让字幕整体错位。附流程与故障对照表。

2026-08-24

字级时间戳是怎么来的:ASR 的对齐机制

字幕跟不跟得上嘴、点一句能不能跳到对应位置,靠的都是时间戳。这篇讲清楚字级时间戳的三种来源——CTC 峰值定位、强制对齐、注意力权重推断,各自的原理、前提和精度差异,以及工程上最容易踩的那个偏移坑。

2026-08-24

ITN 逆文本规范化:把「二零二五年」变成「2025 年」

ITN 是语音识别最后一环里的文本改写步骤,方向是口语形式转书面形式。这篇讲清它和 TTS 前端 TN 的镜像关系、规则与神经网络两条实现路径,以及为什么歧义是它最难啃的骨头——还有一个容易被忽略的事实:ITN 出错常被误当成识别不准。

2026-08-24

VAD 是什么:ASR 前面为什么总要挂个断句器

VAD 判断音频里哪些段有人在说话,把连续音频切成语音片段。这篇讲清它的三个职责、静音时长阈值与前后 padding 各自管什么、能量阈值型和神经网络型的边界,并给出一张调参后果表,看到吞字、切碎、粘连这类症状时知道该动哪个旋钮。

说话人:分离、声纹与重叠

说话人分离和声纹识别不是一回事——前者回答「谁在什么时候说」但不知道谁是谁,后者才需要先注册。这一组还讲两个真实会议里绕不开的问题:多人分轨的顺序怎么选,以及两个人同时说话时系统到底会怎样。

2026-08-24

多人会议分轨:先分离说话人还是先识别

会议转写要的不只是文字,还得知道每句话是谁说的。说话人分离和语音识别谁先谁后,是两条工程路线的分岔口。这篇讲清 diarization 的经典流程、两种顺序各自的代价、为什么边界问题谁都躲不掉,以及说话人数未知时聚类会怎么出错。

2026-08-24

两个人同时说话,语音系统怎么办

真实会议里抢话、附和、插话时时刻刻在发生,但多数说话人分离系统的聚类假设是"同一时刻只有一个人"。这个假设被打破时,重叠段会被硬指派给其中一人,另一人的话直接消失——转写读起来依然通顺,你根本不知道少了东西。这篇讲清重叠语音难在哪,以及检测、分离、产品降级三条处理路径各自的代价。

2026-08-24

声纹识别的两个阶段:注册与验证

声纹识别不是"听一段就知道是谁",它必须先注册后比对。这篇讲清注册阶段采集了什么、验证阶段比的是什么、1:1 验证和 1:N 辨认为什么难度不同,以及最关键的那个工程决策——相似度阈值该调高还是调低,两个方向各自会付出什么代价。

2026-08-24

说话人分离和声纹识别,不是一回事

说话人分离、声纹识别、语音分离,这三个词在中文里被混用得很厉害,但它们回答的是完全不同的问题。这篇用一张对照表把三者钉死,讲清楚为什么分离给出的只是"说话人1、说话人2"这种匿名标签、为什么认出"这是张三"必须先注册,以及在会议纪要这类真实场景里它们是怎么串成一条链的。

ASR 工程化与部署

RTF 怎么读、多快才算够快,GPU 和 CPU 的账怎么算,端侧离线为什么在手机上跑得动。还有一个容易算错的地方:流式请求是长连接,容量要按并发路数算,不是按每秒请求数算。

2026-08-24

端侧离线语音识别:手机上为什么跑得动

端侧 ASR 靠更小的模型结构、量化和算子融合压缩计算量,再配合专为端侧优化的推理引擎与 NPU 加速跑起来。这篇讲清它换来的三样真收益——隐私不出设备、无网可用、无按次费用,以及必须接受的代价:精度与词表受限、模型更新只能随 App 走。

2026-08-24

ASR 服务的并发与批处理:请求该怎么排队

流式语音识别是长连接,一路对话从接通到挂断始终占着资源,容量模型和 Web 服务那套按每秒请求数估算的方法完全不同。这篇讲清楚为什么要按并发路数算容量、实时与批量两类请求为什么必须分开调度、攒批在两边的取舍差在哪,以及并发打满时为什么明确拒绝远好过让所有人一起卡顿。

2026-08-24

ASR 用 GPU 还是 CPU:模型规模与并发的账

很多团队上语音识别的第一反应是先买卡,但 GPU 并不总是更划算。这篇不给硬件推荐,只给一套决策框架:按峰值并发、请求到达分布、延迟要求、模型规模、能不能攒批这几笔账去算,再对照一张场景对照表选型,最后说清为什么建议先用 CPU 把全链路跑通再谈优化。

2026-08-24

RTF 实时率怎么读:多快才算够快

RTF 等于处理耗时除以音频时长,是衡量语音识别快慢最常被引用的指标,也是最容易被误读的一个。这篇讲清 RTF 能回答什么、不能回答什么:为什么从 RTF 推出的并发数只是理论上限,为什么流式场景真正该盯的是首字延迟而不是 RTF,以及看到一个 RTF 数字时你必须追问哪几件事。

TTS 原理与前端处理

文本到波形的三段流水线,声学模型和声码器各干什么、为什么要拆成两段。中文这边的重头戏在前端:多音字消歧、数字读法依赖语义、英文缩写没有通法。

TTS 音质与评测

MOS 怎么打分,以及一个常见误读:不同论文之间的 MOS 不能直接比。客观指标能替代人耳吗,合成语音听起来「像机器」到底是哪几个具体原因造成的。

TTS 可控性与合规

声音克隆的零样本与微调两条路怎么选,情感语气用什么方式控,语速停顿多音字怎么精细调。以及一篇绕不开的:声音克隆的授权边界在哪里。

2026-08-24

声音克隆的授权与合规:哪几条线不能碰

声音克隆的技术门槛已经很低,真正的门槛变成了"你有没有权利用这个声音"。这篇从本人授权、用途限定、可识别性、平台条款四条原则出发,给出一份动手前的自查清单,帮你在开工之前把该问的问题问清楚。

2026-08-24

声音克隆是怎么做到的:零样本与微调两条路

声音克隆的技术核心是把音色和内容解耦——模型从参考音频里抽出说话人嵌入,再用这个音色去说任意文本。这篇讲清解耦为什么让零样本成为可能,零样本与微调各自的输入、优点、代价和适用场景,以及实践中最容易被忽略的两件事:参考音频的缺陷会被一起学走,"像"和"好听"根本不是一回事。

2026-08-24

语速、停顿、多音字:合成结果怎么精细调

合成音大体能听,但语速偏赶、某处该停没停、一个专名读错——这篇讲拿到一段不满意的音频后,怎么一处处调回来。含一张「不满意的地方 → 优先试哪个手段 → 还不行试什么」的分级修法表,以及调不动时的务实退路。

2026-08-24

语音合成的情感和语气怎么控

让合成语音带上情绪,工程上主要有三条路:选预设标签、给参考音频、用一句话描述。这篇讲清三者的可控粒度、稳定性与适用场景,并把最容易被忽略的那条规律说透——控制信号给得越硬,语音越容易僵,可控性和自然度往往此消彼长。

TTS 工程化与部署

为什么首包延迟比总合成时长更值得盯,音频格式和码率怎么选,长文本按什么切才不毁韵律,哪些句子值得缓存,端侧和云端怎么取舍。

2026-08-24

端侧 TTS 和云端 TTS 怎么选

语音合成放在设备上跑还是调云端接口,取决于隐私、网络、音质与音色数量、成本结构、更新方式这五件事里哪一件是你的硬约束。这篇把五个维度摊开对比,重点讲清 TTS 的隐私风险和 ASR 完全不同,以及为什么大多数成熟产品最后都走了端云混合。

2026-08-24

流式 TTS:首包延迟为什么是最该盯的指标

很多人拿"合成一段话要几秒"来衡量 TTS 快不快,这个口径在流式场景下会把你带偏。这篇讲清首包延迟由哪几段构成、为什么它比总耗时更决定体验、生成速率跟不上播放速率时会发生什么,以及压缩首包的五个具体着手点和一套自己就能做的测量方法。

2026-08-24

长文本合成怎么切:按章节、句子还是标点

一本书不能一次性丢给 TTS。这篇讲长文本合成的切分策略:为什么必须切、按句子边界还是按固定字数切、跨片段的音色漂移与拼接爆音怎么缓解、段落停顿为什么必须自己插静音。附一张拼接故障与成因的排查表。

2026-08-24

TTS 缓存策略:哪些句子值得缓存

最快的语音合成是不合成。但缓存不只是"把结果存下来":哪些句子存了有用、拼接式缓存省下的成本要拿什么体验来换、缓存键漏掉一个字段会引发怎样的生产事故,这篇一次讲清楚。

2026-08-24

TTS 音频格式和码率怎么选

语音合成接口都会让你选输出格式,很多人随手选了 MP3,然后发现流式播放怎么调都不顺。这篇讲清 PCM、WAV、MP3、Opus 各自在解决什么问题,为什么流式场景要看"能不能边收边播",采样率为什么不是越高越好,以及选格式之前该先问自己的四个问题。

想把语音能力接进自己的产品,而不只是跑个 demo?

从 AI 编程实践到 Agent 工程落地,站内有成体系的教程与课程。

看 AI Agent 学习路线