语音大模型
—从语音识别到全双工语音交互
洪青阳
厦门大学智能语音实验室
CONTENTS
目录
背景介绍1
端到端对话模型3
语音识别大模型2
全双工语音交互4
落地应用5
1. 背景介绍—世界语种
n 根 据 世 界 人 口 数 据 库
Ethnologue第26版,目前
世界上现存有7168种语
言,142个语系。
[1] Eberhard, David M, Gary S F, et al. Ethnologue: Languages of the world[M]. 26th ed. Dallas, Texas: SIL International, 2023
世界语系分布图[1]
1. 背景介绍—中国方言
n根据教育部2019年《中国语言文字概况》介
绍,汉语方言通常分为十大方言:官话方言、
晋方言、吴方言、闽方言、客家方言、粤方
言、湘方言、赣方言、徽方言、平话土话。
表格和图片来源:中国语言地图集,第2版,汉语方言卷,商务印书馆,2012.
1. 背景介绍—多语种识别
基于端到端的多语种语音识别
多语种语音识别
模型
I think so
普通话音频 1
英语音频 2
日语音频 3 は風がとてもうるさいです
音频
今天天气真不错
级联式多语种语音识别
语种识别
语种A语音识别模型
语种B语音识别模型
…
语种C语音识别模型
今天天气真不错
确定语种
1. 背景介绍—GPT-4o语音模式
• 2024年5月,OpenAI团队率先提出了一个结合多模态的端到端实时交互大模型——
GPT-4o。该模型在GPT-4的基础上,增强了文本、视觉和音频处理能力,能在最快
232毫秒内响应音频输入,平均响应时间为320毫秒,已接近人类水平。
1. 背景介绍—豆包语音交互
• 豆包—动态判停
1. 背景介绍—豆包语音交互
• 豆包—动态判停
1. 背景介绍—级联式对话模型
• 最基础的语音对话系统包含三个核心模块:语音识别、LLM和语音合成模型。
级联式SpeechLMs存在以下问题:
• 信息丢失。语音信号不仅包含语义信息(即语音的含义),还包含副语言
信息(如音高、音色、音调等),这是文本所不具备的。
• 错误累积。级联式模型很容易导致整个流程中出现累积性错误,尤其是在
ASR-LLM阶段。
• 高延迟。由于数据需要在多个模块间传递,系统响应时间较长,复杂性高,
不利于实时语音交互。
1. 背景介绍—端到端对话模型
• 为实现更好的人机交互体验,需要真正实现一个端到端语音对话模型,如图所示,
通过语音编码器将语音离散化,由语言模型直接处理语音数据,实现多个模态实时
输入输出。
本报告来源于三个皮匠报告站(),由用户Id:1181721下载,文档Id:1242758,下载日期:2026-05-20
1. 背景介绍—全双工语音交互
单工通信。数据仅沿一个方向流动。说话者可
以发送数据,而听者只能接收数据。
半双工通信。数据在两个方向上流动,但不同
时流动,类似对讲机。
全双工通信。允许双方同时发送和接收数据。
全双工不一定是端到端对话模型!
1. 背景介绍—全双工语音交互
• GPT Realtime采用WebRTC协议进行语音
交互,使得音频以连续流的形式到达,
更重要的是,该协议本身支持全双工通
信。
• 关键挑战--打断和判停:用户打断时,
语音助手应停止回复;同时,语音助手
需要准确识别用户是否讲完了,即意图
判断。
报告聚焦两个关键问题
• 如何通过大模型,实现多语种语音识别?
• 如何通过大模型,实现全双工语音交互?
目录
语音识别大模型
PART TWO
2. 语音识别大模型
语音识别过程
语音识别发展史
Transformer
Conformer
大语言模型(LLM)
开源模型
• 语音识别的任务为,找到对应观察序列�的最可能的词序列�。
按贝叶斯准则:
� = ���max
�
� �|� = ���max
� �|� � �
� �
� = ���max
�
� �|� � �
• 要找到最可能的词序列,必须使上式右侧两项的乘积最大。第
一项由声学模型决定,第二项由语言模型决定。
语音识别过程
特征序列
状态序列
音素序列
�� �� �� �� ⋯⋯⋯ 声学模型
� �|�
语言模型
� �
词序列 今天 天气 很 好
今天天气很好
j in1 t ian1 t ian1 q i4 h en2 h ao3
语音识别过程
语音识别过程
�1
j in1 t ian1
今天 天气 很 好
t ian1 q i4 h en2 h ao3
�� �� �� �� �� �� �� �� �� ��
�2�3�4 ��⋯⋯⋯⋯⋯�5 �6�7�8
今天天气很好
⋯⋯⋯HMM
人的发音包含双重随机过程:
• 说什么不确定
• 怎么说不确定
词典:
今天 j in1 t ian1
天气 t ian1 q i4
很 h en2
好 h ao3
语音识别过程—系统框架
解码器特征提取
声学模型 语言模型
识别结果
发音词典
语音数据 文本数据
语音识别过程—系统框架
解码器
声学模型 语言模型
识别结果
发音词典
语音数据 文本数据
解码器 识别结果
E2E模型
语音识别发展史
20世纪
50年代
20世纪
70年代
20世纪
80年代
模型
模板匹配
Audry-识别
10个英文数
字
GMM-HMMDTW
VQ
2006年
End-to-End:
CTC
RNN-T
Attention
Transformer
Conformer
DNN-HMM
大规模连续语音识别孤立词识别
第一阶段
模板匹配
第二阶段
统计模型
第三阶段
深度学习
时间
复杂场景/多语种/方言识别
DNN
2012年 2015年
LLM
2024年以来
第四阶段
大模型
Transformer
前馈层
自注意力
位置编码
层归一化
层归一化
前馈层
掩蔽注意力
输出嵌入
位置编码
层归一化
层归一化
交叉注意力
层归一化
线性层
Softmax
N╳ ╳N
输出(迭代右移)
编码器输出
输出概率
编码器 解码器
卷积下采样
输入语音特征
Conformer
识别结果
Encoder
Encoder
Encoder
Encoder
Encoder
Encoder
Decoder
Decoder
Decoder
Decoder
Decoder
Decoder
卷积下采样
前馈模块
+
多头自注意力模块
+
卷积模块
+
前馈模块
+
层归一化
输入语音特征
Conformer Block
输出(迭代右移)
流识别机制
chunk chunk chunk chunk
Conformer
编码器
CTC输出
Transformer
解码器
FST解码器
识别结果
识别结果
语音片段(chunk大小可自己设置,如320ms)
CTC输出经贪婪搜索(Greedy Search)或前缀
剪枝搜索(Prefix Beam Search),后续可接两
种解码器:
• 接Transformer的解码器,进行二次解码
得到识别结果。
• 接带语言模型的FST解码器,进行重打分
得到识别结果。
贪婪搜索
前缀剪枝搜索
卷积下采样
流识别以chunk输入,位置需要加入偏移
(offset)信息。 pos_emb
(+offset)
大语言模型(LLM)
大语言模型 (LLM)
编码器
适配器
Hello world <eos>
<sos> Hello world
• 接入LLM,需把连续语音转化为离散编码,
并通过适配器(Adapter)与文本对齐。
• 语音编码器(Encoder)可采用Transformer
或Conformer Encoder,而解码器直接用
LLM,即Decoder-only Transformer,实
现next token预测。
前馈层
带掩码的多头注意力
输入嵌入
位置编码
层归一化
层归一化
线性层
Softmax
╳N
输出(迭代右移)
输出概率最高的结果
<sos> Hello world
<eos>
next token预测
离散编码—Token
Token是对文本进行分割和编码的最小单元,它可以是以下形式:
• 字符,如’h’;
• 单词,如“hello”;
• 子词
• BPE(Byte-pair Encoding),如“ello”;
• BBPE(Byte-level Byte-pair Encoding):UTF-8编码+BPE,可以跨语言使用。
文本 token token 文本
tokenize
generate
map
Token化(编码为BPE)
First Citizen:
Before we proceed any further, hear me speak.
All:
Speak, speak.
First Citizen:
You are all resolved rather to die than to
famish?
All:
Resolved. resolved.
First Citizen:
First, you know Caius Marcius is chief enemy to
the people.
All:
We know't, we know’t.
……
原始文本(莎士比亚):
train has 301,966 tokens
val has 36,059 tokens
以Tiktoken GPT2 BPE为分类单元:
对字符串采用Tiktoken GPT2 BPE进行分词并编码,例
("hello world")
[31373, 995]
多语种与方言识别
多语种建模:BBPE Tokenizer(GPT、Whisper)
l Tokenizer是大模型非常重要的概念。
l 基于Unicode编码后使用 byte 建模可以打破语言的限制,
所有的语言都可以共用建模单元。
l 英语字符本身在ASCII码中,因此天然就是BBPE。其它语言
字符需要多个字节进行编码。
_ãģĵ _ãĤĵ _ä» Ĭ _天
_Tuesday
ãģĵ ãĤĵ ä»Ĭ 天
Tuesday
开源模型—Whisper
Whisper: 大规模数据多任务训练的端到端Transformer模型
A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, and I. Sutskever, “Robust speech recognition via large-scale weak supervision.” arXiv preprint arXiv: (2022).
Model Layers Width Heads Parameters
Tiny 4 384 6 39M
Base 6 512 8 74M
Small 12 768 12 244M
Medium 24 1024 16 769M
Large 32 1280 20 1550M
Whisper的模型尺寸
Ø 使用68万小时弱标签数据进行训练;
Ø 模型结构使用Transformer结构;
Ø FBank特征(80维,large-v3 128维);
Ø 使用基于GPT2的tiktoken;
Ø 通过prompt的方式包含语种标签;
Ø 通过设计prompt的方式进行多任务训练。
开源模型—小红书FireRedASR
2025年1月,小红书发布FireRedASR,包括AED和LLM版本,其中语音编码器(Encoder)采用Conformer,LLM基于
Qwen2-7B-Instruct(冻结),采用LoRA微调Encoder和Adapter。
Kai-Tuo Xu, Feng-Long Xie, Xu Tang, Yao Hu, "FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to
LLM Integration," arXiv preprint arXiv:.
Ø 包含约7万小时高质量精标中文数据和万小时英文数据;
Ø 中文采用字符编码,英文采用BBPE编码。
开源模型—Qwen3-ASR
2026年1月,阿里巴巴发布Qwen3-ASR,包括和版本。采用,预训练语音编码器—AuT(采用AED框架),然后
接入Qwen3 LM(基模为Qwen3-Omni)。
Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang
Lin, "Qwen3-ASR Technical Report," arXiv preprint arXiv:.
Ø 支持30个语种和22个中国方言;
Ø 约4000万小时伪标签数据(中英为主);
Ø 支持流式输入,支持语种识别;
Ø 采用5万条数据和组序列策略优化(GSPO),进行强化学习。
目录
端到端对话模型
PART THREE
3. 端到端对话模型
• 如何实现语音Token化?尽可能保留原始语音的声学和语义信息。
• 语音文本如何对齐?以接入LLM,统一建模。
• LLM输出的Token如何转化为语音输出?
3. 端到端对话模型
• 语音编码器(Speech Encoder/Tokenizer)
• 大语言模型(LLM)
• 语音解码器(Speech Decoder/Detokenizer)
Speech Tokenizer (Encoder)
• 语义Token/特征
• 优先捕捉语音中的内容,即语义(Semantic)信息,适合与识别、翻译模块结合。
• 一般采用Wav2Vec、HuBERT、Whisper等预训练模型。
• 声学Token (离散空间)
• 聚焦语音压缩与高保真重建,携带更多声学(Acoustic)信息,如语气、风格、情感等,离散
化表示,更适合语音合成、音频生成等任务。
• 典型模型包括SoundStream、EnCodec、TiCodec等。
• 统一Token
• 兼顾语义和声学信息。
• 典型模型包括Mimi、SpeechTokenizer、X-Codec等。
Speech Tokenizer (Encoder)
• 编码器(Encoder): Whisper, HuBERT, …
接入LLM需要增加一个适配器(Adapter),和额外的训练阶段,以实现模态对齐。
语义Token/特征
Speech Tokenizer (Encoder)
• 编码器(Encoder) + 有限标量量化(FSQ):CosyVoice2、CosyVoice3
CosyVoice2由阿里巴巴团队推出,其设计的Supervised speech tokenizer,是在语音识别模型SenseVoice-
Large的Encoder插入FSQ,实现量化表征。CosyVoice3替换了Encoder,并进行多任务训练。
语义Token/特征
[1] Zhihao Du, Yuxuan Wang, Qian Chen, et al., "CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models,“ arXiv preprint arXiv:, 2024.
[2] Zhihao Du, Changfeng Gao, Yuxuan Wang, et al., "CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training," arXiv preprint arXiv:, 2025.
CosyVoice2[1] CosyVoice3[2]
Speech Tokenizer (Encoder)
• 音频编解码器(Codec) + 向量量化(VQ)
通过Neural Audio Codec(如SoundStream、EnCodec),将连续的语音信号经过Encoder输出连续隐
向量,然后做向量量化(VQ),最后编码为离散的语音Token序列。VQ码本采用K-mean生成,会带
来量化误差,改进版包括残差向量量化(RVQ)、有限标量量化(FSQ)等。
声学Token
Speech Tokenizer (Encoder)
• 关键技术—残差向量量化(RVQ)
RVQ通过逐步分解数据的残差来进行量化。首先将输入向量通过第一个量化器量化,得到一个较为粗略
的近似值,然后计算原始数据和近似值之间的差异(即残差)。接着对残差应用第二个量化器,得到更
精确的近似,并继续计算残差。这个过程可以重复多次,通过多个量化器逐层逼近原始数据,减少量化
误差,其流程如图所示。
声学Token
Speech Tokenizer (Encoder)
• 典型例子:SoundStream
采用RVQ的方式实现音频数据的高效压缩,由重建损失(Reconstruction Loss)、对抗损失(Adversarial
Loss)等共同优化模型。
Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, Marco Tagliasacchi, "SoundStream: An End-to-End Neural Audio Codec," arXiv preprint
arXiv:, 2021.
声学Token
Speech Tokenizer (Encoder)
• 典型例子:EnCodec
由Meta AI提出,结合卷积神经网络、RVQ、多尺度对抗训练以及Transformer熵编码,突破了传统编解码
器的性能上限。
Alexandre Défossez, Jade Copet, Gabriel Synnaeve, Yossi Adi, "High Fidelity Neural Audio Compression," arXiv preprint arXiv:, 2022.
声学Token
Speech Tokenizer (Encoder)
• 声学+语义信息
音频编解码器(Audio Codec)最初是为音频压缩而设计的,其产生的离散化Token包含丰富的声学信息,
但是缺乏语义信息,当LLM与离散化Token结合的时候,这些编解码器可能导致LLM产生的音频Token缺
乏语义信息,从而导致产生的音频质量下降。
通常采用蒸馏(如SpeechTokenizer、Mimi)或者语义特征融合(如X-Codec)来丰富Codec产生的离散
Token的语义信息,增强Codec在下游任务的表现。
X-CodecSpeechTokenizer
统一Token
Speech Tokenizer (Encoder)
• 典型例子:Qwen3-TTS Tokenizer
Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, Xiong Wang, Zhifang Guo, Ziyue Jiang, Hongkun Hao, Zishan Guo, Xinyu Zhang, Pei Zhang, Baosong Yang, Jin
Xu, Jingren Zhou, Junyang Lin, "Qwen3-TTS Technical Report," arXiv preprint arXiv:, 2026.
统一Token
LLM
• -8B-Instruct
• Helium-7B
• GLM-4-9B
•
• -7B-Instruct
• -7B
• ……
Linear
RMSNorm
Transformer Block
LayerN
Transformer Block
Layer...
Transformer Block
Layer1
Input Embedding
SoftMax
RMSNorm
Linear
Q VK
RoPE RoPE
SoftMax
Mask
Linear
RMSNorm
Linear
●
Linear
Linear
SiLU
Attention
FeedForward
Speech Detokenizer (Decoder)
离散Token通过Decoder生成梅尔谱,然后通过
声码器转成波形。
LLM 声码器Encoder文本
文本 Tokens
Decoder
语音 Tokens
Flow Matching(流匹配)
Speech Detokenizer (Decoder)
• Speech Tokenizer:
• 实现波形到Token的转换,支持端到端训练;
• Text-to-token LM:
• 将语音生成转化为语言模型的离散Token预测任
务,继承大模型的强大序列生成能力;
• Flow Matching:
• 通过概率流实现从语义特征到声学特征的映射,
从而完成对声学细节的补充。
Zhihao Du, Qian Chen, Shiliang Zhang, Kai Hu, Heng Lu, Yexin Yang, Hangrui Hu, Siqi Zheng, Yue Gu, Ziyang Ma, Zhijie Yan, "CosyVoice: A Scalable Multilingual
Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens," arXiv preprint arXiv:, 2024.
典型例子—CosyVoice
Speech Detokenizer (Decoder)
GLM-TTS的生成分为两个阶段:
阶段一:语义建模
输入Prompt文本和音频,生成对应的Whisper-VQ语义
Token;
阶段二:声学建模与波形重建
基于条件流匹配(Conditional Flow Matching, CFM)模型
预测梅尔频谱,然后通过声码器转为波形。
Jiayan Cui, Zhihan Yang, Naihan Li, Jiankun Tian, Xingyu Ma, Yi Zhang, Guangyu Chen, Runxuan Yang, Yuqing Cheng, Yizhi Zhou, Guochen Yu, Xiaotao Gu, Jie Tang,
"GLM-TTS Technical Report," arXiv preprint arXiv:, 2025.
典型例子—GLM-TTS
Speech Detokenizer (Decoder)
• 目标:学习一个连续时间的向量场,使简单分布逐步演化为真实数据分布。
给定初始分布 为标准高斯分布,目标分布为 ,构造连续路径
Lipman, Yaron, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel and Matt Le. “Flow Matching for Generative Modeling.” The Eleventh International Conference on
Learning Representations, 2023.
样本随时间的演化由可由微分方程描述:
流匹配目标是用一个神经网络去逼近这个真实的向量场:
关键技术—Flow Matching(流匹配)
Speech Detokenizer (Decoder)
实际问题中采用条件流匹配(CFM):以真实样本作为条件,将全局建模问题转化为单样本的轨
迹建模问题。
采用最优传输流匹配(OT-CFM):在噪声样本和真实样本之间做线性插值
对时间求导可得对应的条件速度场:
在语音生成中,常对梅尔频谱分布进行建模,并额外引入文本 c 作为外部条件。
OT-CFM训练目标为:
对ODE求解
高斯噪声(t=0) 真实梅尔频谱(t=1)
关键技术—Flow Matching(流匹配)
开源模型—端到端对话
• Moshi:
作为GPT-4o之后较早发布的开源模型,在参数量较小的情况下具备类似功能,理论延迟仅为160毫秒,并支持70多
种情绪和说话风格,以及英语和法语的实时交互。
• GLM-4-Voice:
端到端中英语音对话模型,能够直接理解和生成中英文语音,并根据用户指令灵活调整语音的情感、语调、语速和
方言等特征。
• Freeze-Omni:
在完全冻结LLM的情况下,为LLM接入语音输入和输出,具备低延迟的双工对话能力。
• Qwen-Omni系列:
多模态大模型,专为全面的多模式感知设计,可以无缝处理包括文本、图像、音频和视频的各种输入,同时支持流
式的文本生成和自然语音合成输出。
• Kimi-Audio:
在一系列音频基准测试中(包括语音识别、音频理解、音频问答和语音交互)达到了较为先进的性能。
• Step-Audio2:
主打副语言理解,涵盖了 11 个维度的深度理解,包括音色 (Timbre)、音高 (Pitch)、节奏 (Rhythm)、语速 (Speed) 和
说话风格等
Moshi
Défossez A, Mazaré L, Orsini M, et al. Moshi: a speech-text foundation model for real-time dialogue[J]. arXiv preprint arXiv:, 2024.
• Moshi建模两路音频:一路对应Moshi说话,另一路对应用户说话。同时,Moshi预测自己语音的文本。
• 小的Depth Transformer建模每个时间步的码本依赖,大的7B参数的Temporal Transformer建模时间依赖。
• Mimi采用Neural Codec,第一个VQ从WavLM蒸馏学习语义信息,其它7个为RVQ。
• Moshi在L4 GPU运行,实际延迟可低于200ms。
Speech Tokenizer LLM Speech Detokenizer
Mimi Encoder Hellium-7B & Depth Transformer Mimi Decoder
GLM-4-Voice
GLM-4-Voice由三个部分组成:
• GLM-4-Voice-Tokenizer: 通过在Whisper的Encoder部分增加Vector Quantization并在ASR数据上有监督训练,将连续的语音输入转化
为离散的Token。每秒音频平均只需要用个离散Token表示。
• GLM-4-Voice-Decoder: 基于CosyVoice的Flow Matching模型结构训练的支持流式推理的语音解码器,将离散化的语音Token转化为连
续的语音输出。最少只需要 10 个语音Token即可开始生成,降低端到端对话延迟。
• GLM-4-Voice-9B: 在GLM-4-9B的基础上进行语音模态的预训练和对齐,从而能够理解和生成离散化的语音Token。
Aohan Zeng, Zhengxiao Du, and et al. GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot, arXiv preprint arXiv:.
Speech Tokenizer LLM Speech Detokenizer
Whisper Encoder+VQ GLM-4-9B Flow Matching+HiFi-GAN
Qwen-Omni系列
• 首创Thinker-Talker架构
• TMRoPE 位置编码
• Thinker-Talker 升级为 MoE
• 自研2000wh预训练AuT音频编码器
• Hybrid-Attention MoE架构
• 自适应速率交错对齐
• 沿用Thinker-Talker,两者都升级为 Hybrid-
Attention MoE,效率和性能均有显著提升。
• 提出ARIA(自适应速率交错对齐,Adaptive
Rate Interleave Alignment)技术,语音输出的
稳定性和自然度也进一步改善。
• 在音频/音视频的理解、推理和交互任务上共
取得了 215 项Benchmark 的 SOTA 成绩。
-Omni
Kimi-Audio
主要特点:
• LLM是用-7B初始化,并扩展了词表;
• 采用的音频tokenizer,相当于80ms一帧;
• Whisper做为音频编码器,生成语义Token(离散化),并与声学
Token结合;
• 预训练数据超过1300万小时音频,包括语音、声音和音乐,通过
ASR模型生成标注;
• 音频合成采用Flow Matching模型结构;
• 采用chunk-wise的流解码方式,减少延迟;
• 分块边界存在间断问题,引入前瞻机制。
KimiTeam and et al., Kimi-Audio Technical Report. arXiv preprint arXiv:arXiv:, 2025.
Speech Tokenizer LLM Speech Detokenizer
Whisper Encoder+Audio Tokenizer -7B Audio Detokenzier
Step-Audio2
• 端到端语音生成集成:模型将离散音频token的生成直接
整合到语言建模中,显著增强对副语言信息(如语气、
风格、情感)的响应能力。
• 以推理为中心的强化学习 (RL):引入了思维链 (CoT) 推理
和多阶段强化学习(RL)策略(包括PPO和 GRPO),显
著提升了模型在复杂音频环境下的理解、推理和实时交
互效率。
[1] Wu B, Yan C, Hu C, et al. Step-audio 2 technical report[J]. arXiv preprint arXiv:, 2025.
[2] Huang A, Li B, Wang B, et al. Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model[J]. arXiv preprint arXiv:, 2025.
Speech Tokenizer LLM Speech Detokenizer
Linguistic & Semantic Tokenizer Step-Omni (130B) CosyVoice
目录
全双工语音交互
PART FOUR
4. 全双工语音交互
• 语音大模型必须以一种全双工的形式运行,即模型可以同时具有听和说的能力,实
时处理两条音频流,如图所示,包含模型输出的音频和用户的指令音频。
一般来说,可以通过以下方式实现插话打断:
• 采 用 声 音 活 动 检 测 ( Voice Activity Detection ,
VAD),即声学VAD,配合WebSocket通信协议,实
现插话打断的功能。
• 额外训练一个语义判停模块,相当于语义VAD,判
断用户是否讲完,若用户语义不完整,可适当延长
麦克风收音时间。
• 端到端建模用户流和系统流,如Moshi,语音大模型
可自己判断用户是否在进行插话打断、语义是否完
整。
4. 全双工语音交互
节点 典型值 备注
节点 延迟 备注
VAD 尾端延迟 300-800ms
等待静音确认,判断用户"说话
结束",不能太小,否则会误切
上行网络 20-100ms
ASR 延迟 200-800ms 可以通过本地流式 ASR降低延迟
全双工模块判断 100-500ms 通过vllm部署可加速
LLM首token 100-500ms 通过vllm部署可加速
文字积累等待 0-300ms
TTS 首包延迟 100-400ms 本地流式 TTS可降低该部分延迟
下行网络+缓冲 20-150ms 可使用WebSocket优化延迟
合计 840-3550ms
TYXiP7zlHm33elDsMa0FZuhX-Dc25VYqVxIGfQ5f7-wWX1mWfR3HCgs920nMm*uSOuUBQBY04cE&new=1
级联式全双工交互链路由五个模块组成:
• 声学VAD
• 语音识别(ASR)
• 全双工模块
• 大语言模型(LLM)
• 语音合成(TTS)
这种范式可控性高,但存在延迟高、声学信息丢失的问题。
语义VAD—EasyTurn
Guojian Li, Chengyou Wang, Hongfei Xue, Shuiyuan Wang, Dehui Gao, Zihan Zhang, Yuke Lin, Wenjie Li, Longshuai Xiao, Zhonghua Fu, Lei Xie, "Easy
Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems," arXiv preprint arXiv:.
• 基于-Instruct微调,同时发布1145h训练数据。
• 集成声学和语言学信息,面向全双工语音交互,预测四种对话变换状态:语义完整(complete)、语义
不完整(incomplete)、“嗯”“对”等简短回应(backchannel)、等待(wait)。
语义VAD—Phoenix-VAD
创新:
ü 结合滑动窗口策略,模型同时支持无需ASR转录、流式、语义感知、
即插即用等特点。
ü 提出一种超时机制,减少语音交互场景中的误中断。
ü 在仅采用合成数据训练的情况下,Phoenix-VAD在合成测试集和真实
测试集都取得较好效果。
Wu W, Guan W, Wang K, et al. Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction[J]. arXiv preprint arXiv:,
2025.
语义VAD—SoulX-Duplug
Yan, Ruiqi, et al. "SoulX-Duplug: Plug-and-Play Streaming State Prediction Module for Realtime Full-Duplex Speech Conversation." arXiv preprint
arXiv: (2026).
• 统一流式架构:不同于传统级联方案将VAD、ASR、
对话轮次检测作为独立模块串联(导致延迟累积且
缺乏语义感知),SoulX-Duplug首次将三者统一在
单一流式模型中。
• 采用三阶段训练(非流式ASR预训练→流式ASR适
配→状态预测微调),推理时使用轻量外部ASR模
型进行Teacher forcing,兼顾端到端训练的优势和
实时部署的准确性。
• 发布双语评测基准SoulX-Duplug-Eval:扩展了Easy
Turn测试集和Full-Duplex-Bench,补充了中英双语
测试数据,填补了跨语言全双工对话评估的空白。
全双工模型—Moshi
Défossez A, Mazaré L, Orsini M, et al. Moshi: a speech-text foundation model for real-time dialogue[J]. arXiv preprint arXiv:, 2024.
• post-training:训练模型的multi-stream能力。使用Pyannote对unsupervised audio dataset进行说话人分割,
随机抽取一名发言者作为主要发言者,并基于说话人分割生成一个二进制掩码波形,当发言者活跃时掩码
值为1,否则为0。
• finetuning:在Fisher数据集上训练让模型学习真实的多流交互。
全双工模型—FreezeOmni
Xiong Wang, Yangze Li, Chaoyou Fu, Yunhang Shen, Lei Xie, Ke Li, Xing Sun, Long Ma, "Freeze-Omni: A Smart and Low Latency Speech-to-speech
Dialogue Model with Frozen LLM," arXiv preprint arXiv:, 2024.
• 基于Qwen2-7B-Instruct训练,冻结其参数,避免文本生成能力灾难性遗忘。训练过程仅需要语音-文本配
对数据以及少量文本模态的问答数据,降低数据规模要求。训练包含三阶段,其中第三阶段采用多轮问答
数据集。
• 语音编码器支持流式输入,通过多任务训练实现用户随机插话的全双工对话能力。定义三种状态,其中状
态1表示用户打断对话,状态2表示语音结束。
全双工模型—PersonaPlex
• Nvdia开源的实时全双工语音对话模型,基于Moshi架构和权重开发,可以同时听和说,允许用户灵活定义
角色。
• 模型在合成和真实对话数据(Fisher英文)训练,能产生自然流畅、低延迟的语音回应,包括类似真人的反馈,
如“嗯哼”、“哦”等。
Rajarshi Roy, Jonathan Raiman, Sang-gil Lee, Teodor-Dumitru Ene, Robert Kirby, Sungwon Kim, Jaehyeon Kim, Bryan Catanzaro, "PersonaPlex: Voice and
Role Control for Full Duplex Conversational Speech Models," arXiv preprint arXiv:, 2026.
全双工模型—Covo-Audio
Tecent, "Covo-Audio Technical Report," arXiv preprint arXiv:, 2026.
• Covo-Audio基于-7B-Base构
建,加入Audio Encoder和Adapter,
并进行了两阶段预训练,累计采用2T
tokens。
• 全双工(Full-Duplex)模型针对半双
工模型做了改进,采用分块chunk流
的方式,支持实时用户输入。模型可
以同时听和说。
• 为增强鲁棒性,进行了大规模预训练,
然后用半双工和全双工数据微调得到
Covo-Audio-Chat-FD模型。
目录
落地应用
PART FIVE
落地应用—声云语音转写(各大应用市场可下载)
网页版演示::58120/integrated_features
演示系统—语音翻译
网页版演示:
演示系统—StepAudio Realtime
总结与展望
总结:
• 语音识别大模型:多语种/方言,BBPE编码,AED/LLM框架。
• 端到端对话模型:Speech Tokenizer/Encoder,LLM,Speech Detokenzier。
• 语音Token:语义、声学、统一Token。
• 关键技术:RVQ,Flow Matching。
• 端到端对话模型:Moshi、GLM-4-Voice、Qwen-Omni系列、Kimi-Audio、Step-Audio2等。
• 语义VAD:EasyTurn、Phonex-VAD、SoulX-Duplug。
• 全双工语音交互:流式打断,Moshi、PersonaPlex、Covo-Audio等。
展望:
• 全双工端到端对话模型
• 语音思维链(CoT)
• Voice Agent
致谢
• 感谢王恺迪、吴炜杰、陈培杰同学对部分资料的贡献。
• 感谢余洪涌、陈斌、叶峻彤等人对演示系统的支持。
• 感谢杨学锐(阶跃星辰)提供了演示支持。
厦门大学智能语音实验室
知识星球 行业与管理资源
知识星球 行业与管理资源