发布时间:2026-07-25阅读(1)

文 | 王洲,王强强
1. 背景口语环节正在语言类教育课程中获得更多重视,一对一的师生交流和指导是提高口语水平最有效的方式,但该方式很难满足数量众多的口语学习者需求。得益于计算机技术和语音评测技术的突飞猛进,计算机辅助语言学习(Computer Assisted Language Learning)技术应运而生,各种基于人工智能技术的口语评测方案相继落地。包括朗读,背诵,复述,自由表达等多种方式,它为学生提供了额外的学习机会和充足的学习材料,能够辅助或者替代教师指导学生进行更有针对性的发音练习,指出学生的发音错误,提供有效的诊断反馈信息,并评估学生的整体发音水平,从而切实提高学生的口语学习效率和口语水平。
2. 语音评测技术简介2.1 评价指标发音评测维度包括发音的准确率,流畅度,完整度,韵律,语调等
准确度:体现用户的发音水平。
流利度:体现用户朗读流畅程度,和语速、停顿次数相关。
完整度:体现用户发音正确的单词占比。
单词得分:句子中每个单词的得分。
句子得分:段落中每个句子的得分。
总分:评测整体得分,综合上面分数获得,准确度对总分影响最大。
口语好坏的评价是主观的,人工专家根据自身的专业知识及经验,在各个维度按照优、良、中、差、劣等级进行打分,不同的专家会得出不同的结果。评价机器口语评测系统是否靠谱,一般采用相关系数(Pearson correlation coefficient),一致性(kappa coefficient)等指标来衡量打分系统的性能。与专家打分越接近,系统越靠谱。但有多靠谱,需要有参照物,通常会用平均的人与人之间的相关性来作为参照,目前的人机相关性、一致性已经超过了人与人之间的平均相关性,一致性。语音评测技术已被普遍使用在中英文的口语评测和定级中。
2.2 技术框架语音评测目前的主流方案是基于隐马尔科夫-深度神经网络(Hidden Markov Model,HMM,Deep Neural Networks, DNN)模型获得语音后验概率,与评测文本强制对齐(force alignment)后,使用 GOP(Goodness of Pronunciation)方法进行打分,流程如下图所示。

1) 声学特征提取:语音信号在一帧(frame)观察窗口内平稳,将切分后的时域片段信号转换到频域,获得 MFCC(13 维或 40 维),Fbank(80 维)等特征,一帧是语音序列的最小单元。在 GMM(Gaussian Mixture Model)模型中,使用 MFCC 特征,是因为 GMM 的协方差估计使用了对角矩阵,输入特征需要保证每一帧的元素之间相互独立。DNN 模型中,特征可以是 MFCC 或 Fbank 特征;
2) HMM-GMM 无监督聚类:该过程用来获取帧标签(Frame-wise label)进行后面的 DNN 训练。HMM 对语音的时序约束、依赖进行建模,GMM 属于生成模型,对 HMM 的观察概率(属于各个音素的概率)进行建模。语音的标注通常是单词序列,每一帧对应哪个音素提前是不知道的。GMM 通过相似度聚类,同一个音素的相邻各帧归为同一类,获得音素的 duration、边界信息。目前语音信号中对齐算法主流依旧是 HMM-GMM,其它算法 ctc,attention 对齐都有各自的问题,ctc 的尖峰,attention 的时序无约束问题。
3) DNN 判别学习: GMM 聚类效果尚可,但 GMM 对音素建模能力有限,无法准确的表征语音内部复杂的结构。通过 DNN 取代了 GMM 来进行 HMM 观察概率的输出,可以大大提高准确率。DNN 模型的最后一层使用 softmax 进行软分类,交叉熵 loss 进行训练,DNN 的输出称为后验概率 (phonetic posteriorgrams,PPG)。
用一个例子来说明 DNN 的输出,假设有 5 帧语音特征, 发音内容为“er_3 d uo_0”, 取[sil,er_3,d,uo_0,uo_3]PPG 如下:
Copyright © 2024 有趣生活 All Rights Reserve吉ICP备19000289号-5 TXT地图HTML地图XML地图