爱吧机器人网 » 技术 > 模式识别 > 正文

谷歌等语音识别技术水平或超人类 暂未投入使用

彭博社发表分析文章称,现在的 语音识别 技术还不够成熟,较为机械,一些模糊不清的词汇难以辨别,也不能通过语境理解用户的真正意图。但是,近期 语音识别 和 人工智能 领域取得的突破让一项数十年前就已问世的数字 神经网络 技术获得重生。谷歌正在此 神经网络 技术的基础上开发可以整合其海量数据的语音系统,其能够让 语音识别 更为智能,大幅改善了识别质量。未来,市场上或将出现准确率与人类相当或水平更高的 语音识别 系统。

以下是文章全文:

与数字语音助手聊天产生的乐趣大概就像你努力与一个顽固的孩子讲道理一样。如果你曾经对着你的Xbox大吼,或者咒骂Siri,那说明你可能已经对 语音识别 失望了。

技术突破

但是研究人员称,人类近期在 语音识别 和 人工智能 领域取得的突破将很快会大幅提升设备的理解能力。谷歌著名工程师约翰·沙尔克维克(Johan Schalkwyk)表示,只需一到两年,这种性能强大的新型设备就会问世。它不仅能够听懂人们说话的意思,还明白上下文的关联与细微差别。

沙尔克维克正在谷歌从事一项野心勃勃的研究项目,开发能够整合公司海量数据的语音系统。他表示,目前正在实验室测试的一个项目能够使计算机听懂并在本质上“思考”人们向谷歌设备输入的语音。

语音和 机器学习 领域近期的创新应该会大幅提升 语音识别 的能力,缓解人们的不满情绪。Siri开发团队中有人表示,工程师们都在狂热地开发 语音识别 技术,令其足够智能,以实现设备与用户真正地对话。“ 语音识别 技术对所有地区口语的理解能力已取得长足的进步,”Siri底层础技术的开发公司SRI International(后被苹果收购)副总裁威廉·马克(William Mark)称,“这种对话式互动现在成为了一种前沿技术。”

蒂姆·图特勒(Tim Tuttle)对 语音识别 技术的飞跃等待已久。他在1997年取得了麻省理工学院的博士学位,并在该校 人工智能 实验室任职。过去10年,他先后在多家硅谷公司工作,并最终在2010年创建了自己的公司Expect Labs。图特勒的公司去年开始从事一个系统研发,将复杂的语音指令加入到移动应用中。这款应用能够允许用户进入一家商店后向手机询问要买的扫帚在哪一条货架走道。

“一年前,我们做了一次基准测试,得出的结论是难以实现这一功能。但是现在,一切都已经发生了改变。我们公司对 语音识别 进行了加倍投资,主要得益于我们所看到的这些技术进步,”图特勒表示,“你将发现,那些在准确率上与人相当、或比人更高的 语音识别 系统实现商业化。”

旧技术获重生

先来迅速回顾一条历史教训:两年半前,谷歌和多伦多大学的研究人员发表了一篇颇有影响力的论文,内容关于使用“深度 神经网络 ”在电脑中模拟语音。几个月后,微软和IBM合作发表了另外一篇论文。谷歌工程师杰夫·迪恩(Jeff Dean)将这两篇论文称之为“语音研究领域20年来取得的最大的一次进步”。

新发现让一项问世数十年的数字 神经网络 技术创新获得了重生。该技术在上世纪80年代在预测和分析 大数据 方面表现优异,但发展受制于当时过慢的计算机速度。 神经网络 在近期才成为一个可行的选择,这要归功于计算机处理速度的大幅提升和新软件技术的发展。

谷歌的实验室项目就是基于 神经网络 研究。6个月前,谷歌团队放弃了一种名为前馈 神经网络 的旧方法,转而使用递归 神经网络 。这一转换使得系统能够存储更多信息,处理更长、更复杂的序列。谷歌的创新成果在于对底层代码的简化,允许软件在相同系统中存储更多观点和概念,使之易于问出复杂的问题和得出合理答案。“系统构建得复杂会损害其长期发展,”沙尔克维克说。

谷歌系统现在使用上下文、物理定位及其它了解到的说话者信息对谈话的场所和真正含义进行预测,就像人在谈话时大脑所做的一样。谷歌的新网络技术应该会更高效,从而能够处理比以往更多的数据,回答更为复杂的请求。

为了解释未来 语音识别 技术的工作原理,沙尔克维克使用了距离谷歌加州山景城总部几英里之外的高级越南餐馆作为例子。这家餐馆名为Xanh Restaurant。沙尔克维克称,对于典型的 语音识别 系统来说,识别出这个餐馆名字的发音是个挑战,因为Xanh的发音为“zahn”,识别起来十分困难。“如果我能使用地图,然后说‘这是一家餐馆,它位于加州’,那么可供参考的餐馆数量就会立刻减少很多,”他说,“使用这种语义知识,我们能够大幅改善 语音识别 的质量。”

这听起来简单,但对于计算机来说,听到一个词汇,从句子中识别上下文,然后根据地理位置分析信息是一件极为困难和耗费时间的事情。如今,谷歌语音搜索能够正确识别餐馆,也许就是因为其开发者是餐馆老顾客的原因。沙尔克维克称,未来谷歌将能处理其他同样存在语音模糊不清的众多问题。

沙尔克维克表示,在谷歌内部, 语音识别 取得了“数量空前多”的技术进步。尽管谷歌取得的重大进步还需要一到两年时间才能在手机上体现出来,该项目已经催生出了可用于谷歌其他业务的技术。“你开发一些技术准备登月,与此同时,你也开发出了另外100项有用的技术,”沙尔克维克说。

沙尔克维克称,三年前,谷歌 语音识别 技术或许仅能识别3/4的单词。而如今,图特勒称,得益于创新速度的加快,谷歌手机 语音识别 应用能够准确猜中12/13的单词。“未来,我们将会生活在一个设备没有键盘的世界里,”图特勒说。


上一篇:人机交互技术:2015指纹识别将大爆发
下一篇:消灭键盘:谷歌语音新设备两年内面世
精选推荐
Crossbar将电阻式RAM推入嵌入式AI
Crossbar将电阻式RAM推入嵌入式AI

[2018-05-17]  电阻RAM技术开发商Crossbar表示,它已与航空航天芯片制造商Microsemi达成协议,允许后者在未来的芯片中嵌入Crossbar的非易失性存储器。此举是在先进制造业节点的领先代工厂选......

人工神经网络技术解码人类行为和想象时的大脑活动信号
人工神经网络技术解码人类行为和想象时的大脑活动信号

[2017-08-23]  为搜索引擎过滤信息,棋盘游戏对弈,识别图像 人工智能在某些任务中远远超过了人类智能。来自弗莱堡由神经科学家私人讲师Tonio Ball博士领导的几个杰出的BrainLinks-Bra......

南加州大学机器人学家:机器人更适合粗暴的爱
南加州大学机器人学家:机器人更适合粗暴的爱

[2019-11-07]  图片来自JOHN MADERE GETTY IMAGES打是疼骂是爱,当人类粗暴的将物体从机器人手中敲掉,看似残忍,实际上却能帮助机器人找到最好的握持物 ...

美国Natilus公司试飞水上无人货机 设计简单成本降低
美国Natilus公司试飞水上无人货机 设计简单成本降低

[2017-12-28]  Natilus创业公司成立于2014年,其梦想是建造大型无人机,以半价提供比船舶快得多国际货运。在十二月份,Natilus计划在旧金山湾测试一个9米翼展的小型原型无人机的水上滑行能力......

人工智能民主化能否实现取决于科技巨头
人工智能民主化能否实现取决于科技巨头

[2017-12-29]  我们经常听到像谷歌和微软这样的公司说他们希望人工智能民主化。这是一个很好的词,民主化。 但这些公司如何界定“民主化”还不清楚,像AI本身一样,它似乎有点炒作的味道...

揭秘达芬奇手术机器人
揭秘达芬奇手术机器人

[2018-04-19]  达芬奇手术系统是由美国Intuitive Surgical公司制造的机器人手术系统。美国食品和药物管理局(FDA)于2000年通过该标准,旨在利用微创手段 ...

智能机器人困惑的时候知道该问什么问题
智能机器人困惑的时候知道该问什么问题

[2017-03-20]   照片:Nick Dentamaro 布朗大学 上周,我们提到了麻省理工学院的一些研究,即通过链接人的大脑来帮助机器人在他们将要犯错误的时 ...

集群机器人领域最新研究:一种用于探测未知环境的微型无人机群
集群机器人领域最新研究:一种用于探测未知环境的微型无人机群

[2019-10-26]  (图:无人机扩散至不同方向来探索环境。当一个无人机注意到另一个无人机在它的首选方向,它将试图飞到另一个方向。若首选方向冲突,低优先 ...

本周栏目热点

在移动互联网上,图像识别Face++可以做什么?

[1970-01-01]   在互联网上,没人知道你是一条狗。这是1993年《纽约客》杂志关于互联网匿名性的经典论述。时光荏苒,二 ...

人脸识别技术是信息安全的新未来?

[1970-01-01]   你走到一家自助银行前,摄像头通过刷脸,自动识别你的身份为你开门;你站到ATM机前输入密码,再在摄像 ...

谷歌语音识别想超过人类,方法是借助神经网络

[1970-01-01]   导语:彭博社今天撰文称,谷歌正在 语音识别 领域展开野心勃勃的尝试,希望通过技术手段实现超越人类的 语 ...

[1970-01-01]   生物特征识别技术是目前最为方便、 安全 的身份识别技术,它辨识的是人身的固有特征,不需要身外的其他标 ...

生物特征识别技术实现原理与前景分析

[1970-01-01]   指纹识别 技术前言与传统的身份鉴别方法相比,生物特征识别技术更加 安全 、保密。这是因为生物特征在某种 ...