小张临近期末复习,突然手受伤了,写字打字都不是太方便,小张很着急,如何高效复习呢?小张在使用微信发语音过程中,突然想到了可以利用语音技术帮助自己
复习备考,于是他网购了当下流行的小度智能屏,复习过程中遇到不懂的就问小度,重点知识还用手机进行了录音并转成文字整理到一起,大大减少了写字打字的工作量,让我们一起来看看语音技术是如何帮助我们
高效学习的吧
2.1 语音信号采集
小度可以通过内置麦克风设备,把小张的语音信号转化为电信号,请选择以下哪个最有可能是“小度小度”的语音信号
我们可以想象经过特征提取后,计算机系统确定了每个字的读音特征,并把特征进行数字化向量化。我们想象用一个图形象化展示每个字的语音特征。
2.2 预处理及特征提取
在一项语音识别任务中,我们需要做的第一件事就是数据预处理,不论是开源数据集还是业务数据集,在送入模型真正训练之前必不可少的一步就是将纷繁冗杂的数据整理成特定的文件格式并处理成计算机可识别的二进制特征向量形式储存在指定文件夹下。
这一阶段主要是去除噪音、回声等干扰因素,将不清晰的语音信号变得清晰。此外,预处理阶段还包括分帧操作,即将连续的语音信号分割成一个个短的帧,这样可以更方便地提取语音特征。
我们可以想象经过特征提取后,计算机系统确定了每个字的读音特征,并把特征进行数字化向量化。我们想象用一个图形象化展示每个字的语音特征。
2.3 声学模型
声学模型相当于一个大字典,记录了每个字的发音特征,系统自动计算需要识别的语音每个字的语音特征与库里哪个字的发音匹配度最高,一般一个字可能匹配到库里1-3个匹配度最高的字符
2.4 语言模型与语言处理
系统识别出匹配度最高的字符之后,需要把识别出的字组成一句话,这就需要语言模型与语言处理,根据语义结构、语法规则、语言的数学描述模型,结合
上下文,最常用的词汇组合等,输出一句话。比如针对“语音识别技术”,系统会根据库中常用词汇组合把“技术”作为一个词汇,而不会输出“语技”这类没有意义的词汇。
请根据上述系统内置的音频,进行语音识别(可用微信的语音转文字功能),输出文字:
3.1 语言处理:模拟人对自然语言的理解过程——文本规整、词的切分、语法分析和语义分析,使计算机能够完全理解文本,并给出所需要的发音提示。这相当于去
库里根据文字字符去找对应的发音。汉语按音素的发音特征分类分为辅音、单元音、复元音、复鼻尾音四种,按音节结构分类为声母和韵母。并且由音素构成声母或韵母。有时,将含有声调的韵母称为调母。由单个调母或由声母与调母拼音成为音节。汉语的一个音节就是汉语一个字的音,即音节字。由音节字构成词,最后再由词构成句子。
请标出以下文字的拼音:
3.2 韵律处理:为合成语音规划出音段特征,如高音、音长和音强等,使合成语音能正确表达语意,听起来更加自然。
比如发音不标准的外国人讲汉语,虽然每个字都不算完全读错,但是整体听起来会觉得一时理解不了,没法正确表达语意,这就是因为声调、读音等的不同导致的。
请选择“我爱中国”的标准配音。
3.3 声学处理:根据前两部分处理结果的要求输出语音,即合成语音。现在的语音合成可以让用户选择采用男声或者女声,是要欢快的,大气的,温情的等等各种风格,
合成的语音也越来越接近人的自然表达。
请把下面这段文字合成语音:
人工智能的应用领域非常广泛。在医疗领域,人工智能可以辅助医生进行诊断和治疗决策,帮助解决疾病预防和医疗资源管理等问题。在金融领域,人工智能可以用于风险评估、欺诈检测和智能投资等方面。在交通领域,人工智能可以优化交通流量、减少交通事故并提高交通效率。在制造业中,人工智能可以实现智能化生产和预测性维护,提升生产效率和产品质量。
声音的“三要素”指的是响度、音调和音色。
响度:指人耳感觉到的声音强弱,即声音响亮的程度,根据它可以把声音排成由轻到响的序列。响度的大小主要依赖于声强和频率,振幅越大响度越大,人和声源的距离越小,响度越大。
音调:声音的高低由频率决定,它代表了发声物体在1s内振动的次数,频率越高音调越高,人耳听觉范围20—20000Hz;20Hz以下称为次声波,20000Hz以上称为超声波。
音色:音色是人们区别具有同样响度、同样音调的两个声音之所以不同的特性,音色与声波的针对波形有关,或者与声音的频谱结构有关。人发出的声音的音色也因人而异,所以我们闭着眼也能听出是哪位熟人在讲话,同样的,
我们也可以听出胡琴、钢琴、笛子、古筝等不同乐器发出的音调、响度都相同的声音。
语音技术是指在计算机领域中的关键技术有自动语音识别技术(ASR)和语音合成技术(TTS)。
让计算机能听、能看、能说、能感觉,是未来人机交互的发展方向,其中语音成为未来最被看好的人机交互方式,语音比其他的交互方式有更多的优势。
最早的语音技术因“自动翻译电话”计划而起,包含了语音识别、自然语言理解和语音合成三项非常主要的技术。语音识别的研究工作可以追溯到20世纪50年代AT&T贝尔实验室的Audry系统,此后研究者们逐步突破了大词汇量、连
续语音和非特定人这三大障碍。
让计算机说话需要用到语音合成技术,其核心是文语转换技术(Text to Speech),语音合成甚至已经应用到汽车的信息系统上,车主可以将下载到系统电脑中的文本文件、电子邮件、网络新闻或小说,转换成语音在车内收听。
语音识别技术
语音识别技术是一项重要的人工智能技术,能够将人类的语音转化为文本或命令。随着人工智能和机器学习的发展,语音识别技术取得了巨大的进步,为人们提供了更智能、便捷和自然的交互方式。
语音识别技术的实现原理及框架如下:
1. 语音采集
语音识别系统的第一步是采集语音。语音采集设备可以是手机、麦克风,或者其他的音频输入设备。采集的语音信号被转化为数字信号,供后续处理使用。
2. 预处理
预处理是语音识别的关键步骤之一。这一阶段主要是去除噪音、回声、静默等干扰因素,将不清晰的语音信号变得清晰。此外,预处理阶段还包括分帧操作,即将连续的语音信号分割成一个个短的帧,这样可以更方便地提取语音特征。
3.声学特征提取
模拟的语音信号进行采样得到波形数据之后,首先要输入到特征提取模块,提取出合适的声学特征参数供后续声学模型训练使用。好的声学特征应当考虑以下三个方面 的因素。第一,应当具有比较优秀的区分特性.以使声学模型不同的建模单元可以方便准确的建模。其次,特征提取也可以认为是语音信息的压缩编码过程,既需要将信道、说话人的因素消除保留与内容相关的信息,又需要在不损失过多有用信息的情况下使用尽量低的参数维度,便于高效准确的进行模型的训练。最后,需要考虑鲁棒性,即对环境噪声的抗干扰能力。
4.声学模型
如今主流语音识别系统都采用隐马尔科夫模型(HMM)作为声学模型,这是因为HMM具有很多优良特性。HMM模型的状态跳转模型很适合人类语音的短时平稳特性,可以对不断产生的观测值(语音信号)进行方便的统计建模;与HNN相伴生的动态规划算法可以有效地实现对可变长度的时间序列进行分段和分类的功能;HMM的应用范围广泛。只要选择不同的生成概率密度,离散分布或者连续分布,都可以使用HNM进行建模。HMM以及与之相关的技术在语音识别系统中处于最核心的地位。自从HMM的理论被提出以来(Baum and Easo,1967),它在语音信号处理及相关领域的应用范围变得越来越广泛,在语音识别领域起到核心角色的作用,它还广泛活跃精音的参数合成、语言理解、 机器翻译等其他领域。
以汉语为例:
汉语按音素的发音特征分类分为辅音、单元音、复元音、复鼻尾音四种,按音节结构分类为声母和韵母。并且由音素构成声母或韵母。有时,将含有声调的韵母称为调母。由单个调母或由声母与调母拼音成为音节。汉语的一个音节就是汉语一个字的音,即音节字。由音节字构成词,最后再由词构成句子。
汉语声母共有22个,其中包括零声母,韵母共有38个。按音素分类,汉语辅音共有22个,单元音13个,复元音13个,复鼻尾音16个。
目前常用的声学模型基元为声韵母、音节或词,根据实现目的不同来选取不同的基元。汉语加上语气词共有412个音节,包括轻音字,共有1282个有调音节字,所以当在小词汇表孤立词语音识别时常选用词作为基元,在大词汇表语音识别时常采用音节或声韵母建模,而在连续语音识别时,由于协同发音的影响,常采用声韵母建模。
基于统计的语音识别模型常用的就是HMM模型λ(N,M,π,A,B),涉及到HMM模型的相关理论包括模型的结构选取、模型的初始化、模型参数的重估以及相应的识别算法等
5.语言模型与语言处理
语言模型包括由识别语音命令构成的语法网络或由统计方法构成的语言模型,语言处理可以进行语法、语义分析。
语言模型对中、大词汇量的语音识别系统特别重要。当分类发生错误时可以根据语言学模型、语法结构、语义学进行判断纠正,特别是一些同音字则必须通过上下文结构才能确定词义。语言学理论包括语义结构、语法规则、语言的数学描述模型等有关方面。目前比较成功的语言模型通常是采用统计语法的语言模型与基于规则语法结构命令语言模型。语法结构可以限定不同词之间的相互连接关系,减少了识别系统的搜索空间,这有利于提高系统的识别
语音识别流程如下所示

标准的语音预处理流程

FBank特征
Mel刻度,这是一个能模拟人耳接收声音规律的刻度,人耳在接收声音时呈现非线性状态,对高频的更不敏感,因此Mel刻度在低频区分辨度较高。Mel滤波器组就是一系列的三角形滤波器,把低频区的声音更好的提取出来,同时对高频区的声音进行一定的降噪。
一个例子
input: 一段3秒长的音频 ,8K的采样率

原始语音向量 shape (3.5*8000, )
output:FBank特征

经过预处理后的向量 shape (350, 40)
语音合成技术
在讲语音合成之前,我们首先要弄清楚一个问题:什么是语音,语音是由哪些成分构成的?
语音就是人说的话,它的记录形式是一段一段的波形。
语音有三大关键成分:信息音色和韵律。如果能将语音的成分充分自由地拆解和组合,将是对语音的巨大解放,未来将有无限的想象发展空间。
下面我们将它做一个拆解,先来看下语音信息,语音信息是指说话人说了什么内容。
语音作为信息的载体,是最自然便捷的沟通手段,在信息播报、人机交互上有着大量刚性需求,现在如此未来更是如此。
语音的音色是指这段话是谁说的,有一句俗语:未见其人先闻其声。
有时候说什么并不重要,更重要的是谁在说。班主任和大家分享一个伤感又有点温情的故事,一位身患肺癌的父亲在他生命的最后阶段联系了讯飞,他想把自己的声音做成一个音库,放置在智能音箱里面。在他逝世后,可以让智能音箱陪着他孩子长大,让孩子还能听到爸爸的声音。
韵律就是我们说话的方式,说话时我们声音的高低、快慢等。
借用某位非著名相声演员的话来说:人人都会说话,为什么你还要花钱来听我说话?
自然是因为你说的好,那【说得好】到底是一种什么概念呢?
举个例子,每次看《动物世界》除了被节目里各种新奇的动物吸引之外,还会被赵忠祥老师富有磁性的声音所吸引。
这就是他比旁人【说得好】,声音的惯性和魅力是无穷的,当某个熟悉的声音响起,人们就会自然而然的沉浸其中。
在未来,优质的声音IP将会作为重要的内容生产能力,受到重视和追捧,将语音从信息获取升级为艺术享受。
语音合成核心技术原理
1、单元挑选波形拼接技术
语音合成技术的本质是将文本信息转化成语音信息,在了解这项技术之前,我们先来看一个案例,现在有一句待合成文本:外交部评日本首相国会演说。
如果我们要将这句文本信息变成语音信息,首先需要在语音合成数据库里面挑选出这句文本信息所包含的元素,比如:外交部、日本等。
挑选完元素之后将这些元素按照一定的顺序组合排列,最后再输出我们想要合成的那句语音信息。

以上这些就是一个简单的单元挑选波形拼接技术实现过程。
单元挑选和波形拼接的关键技术点有2点:语料库设计和标注;目标代价和连接代价计算
2、基于HMM的参数语音合成
基于HMM的参数语音合成技术相比于单元挑选波形拼接技术,在操作层面上会更加流程化。
我们来看下基于HMM的训练流程图,主要包括训练流程和合成流程。

将录制好的音库,提取出相应的语音参数,然后将标注数据和声学提取数据一同构建HMM的训练模型,通过上下文属性和问题集的决策树模型,构建训练后的HMM模型,这
就是训练流程。
合成流程中我们通过对输入文本的分析,来进行上下文相关HMM训练的序列决策,再将生成后的语音送入参数合成器中,最后输出合成之后的语音。
基于HMM的参数语音合成的关键技术有高质量语音声码器,以及基于上下文的决策树模型。