跨国巨头猛攻语音识别技术

程序员文章站 2022-04-01 22:41:19

语音识别已经不再遥不可及！近日，微软新推出的Windows Vista就安装了语音识别系统。不懂鼠标和键盘操作的人，有了此软件的帮助，问题就能迎刃而解。这也是这一操作系统的一大亮点...

语音识别已经不再遥不可及！

近日，微软新推出的Windows Vista就安装了语音识别系统。不懂鼠标和键盘操作的人，有了此软件的帮助，问题就能迎刃而解。这也是这一操作系统的一大亮点。

从上世纪50年代开始，语音识别作为重要的研究对象，引起了科学家的广泛兴趣。今天，半个多世纪过去了，语音识别技术已经发生了突飞猛进的变化，IBM、苹果和微软等公司甚至已经把它应用于自己的部分产品中。

目前，语音识别软件主要运用于法律和医药领域，但随着软件的日趋完善，将被更多领域采纳和运用，并帮助人们解决疑难问题。

不过，语音识别软件目前或多或少存在缺陷，如抗干扰差、语音识别误差较大、易受黑客攻击等。因此，要想短期内取代手工操作还不现实。

备受青睐

其实，自电脑诞生以来，让电脑听懂人们的说话，就是科学家们奋斗的目标。几年前，这方面还仅局限于实验室内的演示。不过现在不同了，电脑的语音识别功能已经有了质的飞跃，并被广泛运用到各个领域。

微软和福特汽车正在进行一项有趣的工作，他们希望人们能向汽车发出口头指令，这让人觉得有些不可思议。不过，人们通过芯片进行口头交流，早已成为现实，只是目前还没有被广泛应用到日常生活中，所以大家对此感到陌生。可以肯定的是，随着技术的日趋成熟，今后人们和芯片的交流的机会将越来越多。

前不久，在拉斯维加斯举行的国际电子消费品展览会上，比尔·盖茨和福特汽车的高管们，展示了微软的Sync软件，它可让驾车者们如何通过口头指令，在车内播放音乐和拨打电话。但是，通过口头指令驾驶汽车还难以被广泛运用，至少目前还不行。

IBM在语音识别技术上，一直走在最前沿。以它的ViaVoice软件为例，这种软件可以帮助人们通过麦克风用语音向字处理软件输入文字，能识别英语、意大利语、德语、法语、日语、汉语等语种。由于大量的无线上网设备的使用，语音识别软件的销售前景看好，特别适用于医生、律师和作家等职业。

从去年9月1日开始，该语音识别软件已经开始降价销售，其中最便宜的一款只需30美元。据估计，目前，全世界已有1000多万人在使用ViaVoice软件。

微软新版的Windows操作系统Vista，也配置了先进的语音识别软件。用户可以通过语音和计算机交流——对于无法操作键盘和鼠标设备的人们，这是一个很重要的功能。经过训练，Vista能识别用户的语音。这样，用户就可以通过口述来“书写”信件或电子邮件。一言以敝之，用户可以通过语音来执行大多数常见任务。

不过，目前世界上最先进的语音识别软件，既不是微软生产的，也非IBM制造，它的名字叫做Naturally Speaking，出自于Nuance Communications公司。

Naturally Speaking已经得到了大多数用户的认可。用户对着麦克风说话，屏幕上就显示出说话的内容，很容易识别和纠正错误。久而久之，该软件就会适应用户的说话风格，当然，用户如果在说话过程中发现软件无法识别的，也相应地作出调整，这样一来，语音识别的正确率就会逐渐提高。

用途广泛

在语音识别软件领域，比尔·迈森很有发言权，他是这方面的专家。他指出：“目前该软件主要用于法律和医学等特定领域。例如，放射线学者们越来越多地通过语音识别软件口授诊断报告和结果，而不再由录音机录下口头报告，再加以转录。”

语音识别软件是利用非常复杂的统计方法，把人们的讲话与单词相对应起来的。如今，语音识别技术在一些领域已经得到广泛应用，如呼叫中心。采用这项技术，可以省去不少麻烦，目前已有不少电脑查询服务采用了Nuance公司的技术，来处理客户的需求。

可以看出，语音识别技术的特点就是使工作变得自动化。但也有人指出，语音识别技术发展到足够强大并得到普遍应用的时候，在给人类带来方便的时候，同时也会使更多的人失去工作。比如，现在很多公司都设置咨询室，将来有可能被机器取代，人们可以通过公司的电脑发出口头指令来完成各项咨询。

迈森预言：“接下来，语音识别技术将被用于网络搜索。”不久的将来， Google和雅虎将推出面向手机用户的语音搜索服务，用户只要说出自己要找什么，就可以听到电脑的自动答复。这2家公司都已聘请了语音识别技术专家。Nuance还与雅虎对簿公堂，因为雅虎挖走了Nuance的13名工程师。

IBM也不甘步人后尘，此前它在语音识别一直处在领先位置。目前，IBM正在实施一个超前的计划——研制一种能监听4-5个人参加的小型会议的语音识别软件，用以提供准确的书面记录。这一步迈得很大，不知道何时能取得成功。

此外，负责IBM的语音识别技术开发的戴维·那哈莫还表示，该公司已经开发出了其他一些应用软件。其中一项能自动翻译外语广播——该软件首先通过语音识别技术记录下说话者所说的话，然后通过翻译软件把外语翻译成英语。

尽管这一软件目前还不成熟，不过它已经能够翻译出说话者的要点。这一软件的卖点不错，尤其受缺乏外语人才的机构和部门欢迎，比如情报机构。当然，该软件也适合缺乏人手的电视台，为听觉有障碍的观众提供字幕服务。

正视缺陷

当然，语音识别软件还没有发展到能够取代键盘和鼠标的程度，还有很多不完善的地方，这也是所有语音识别软件目前普遍存在的问题。比如抗干扰，这类软件还无法分辨出哪是人的发音，哪是音响的发音。

在语音识别上，目前也存在差错。在一家公司的一次演示中，与会者大跌眼镜。这家公司的工作人员试图让自己开发的软件识别“Dear Mom”这个短语的发音，然而，让人哭笑不得的是，语音识别软件却把它理解为“Dear aunt”，也就是著名的“认母为姨”。

此外，语音识别还可能被黑客利用，不久前就传出Vista的语音功能存在缺陷，容易遭致黑客利用进行远程语音攻击。微软对此表示，安全人员此前公布了该漏洞，影响微乎其微。

微软安全响应中心的发言人宣称，攻击者利用此漏洞仅能获得当前用户的权限，并不能绕过用户帐户控制系统的监管运行任何管理员级别的命令。黑客要想成功发动攻击，前提条件是目标系统已经设置好语音识别功能，并且启用话筒和音箱，此时他们可以通过音频文件的播放执行复制、删除、关机等命令。因此微软方面建议不要一直同时开启麦克风和音箱。如发现有执行命令的音频文件播放，要关闭媒体播放器和语音识别，重启电脑。

安全响应中心的程序经理Adrian Stone称：“我们对该问题十分重视，经过调查，我可以自信地说，没有必要担心该问题。”

苹果公司在语音识别上也曾经存在漏洞，不过，发现后他们很快修复了漏洞。

上一篇：不拿人开涮,怎么能开心呢?

下一篇：一对搞笑的小夫妻

跨国巨头猛攻语音识别技术

语音识别进化简史：从造技术到建系统

普通人咋用上AI技术？语音交互与人脸识别可试试

语音识别进化简史：从造技术到建系统

语音识别技术的应用及发展

语音识别技术,语音识别技术是什么意思

什么是语音识别技术(软件) GG语音翻译软件