据行业预测,中国智能语音产业规模将达到101.4亿元。而智能语音产业的快速发展,将带动智能家居、智能汽车以及智能穿戴设备等相关领域市场规模增长上千亿元。
智能语音市场规模得以如此神速扩张,并且应用到多个领域,这必然离不开智能语音技术的不断突破。那么,我们当前的语音技术达到了什么地步?换句话说,能够实现什么样的人机互动效果呢?
以欧拉蜜团队为代表,我们一起来看看这些年国内智能语音行业的技术突破。
技术门槛高,首先得保证语音识别准确率
中国的语音识别研究起始于1958年,由中国科学院声学所利用电子管电路识别10个元音。虽然与国外语音识别研究起步时间同步,但由于当时条件的限制,随后一段时间内技术的进展较为缓慢。
最初,我国语音技术的研究一直以学术界为主,随后才有企业逐渐涉足这个领域。由于语音识别技术准入门槛高、人才稀缺,经过多年研究与探索,一些国内企业终于在这个行业冒头,形成了“一超多强”的局面。
欧拉蜜团队在智能语音方面的研究已达5年。初期,欧拉蜜以设计出一个中文理解能力超越Siri 的智能语音助理为目标,开始投入人工智能相关研究领域,而长远的目标则是致力于提供全方位的人机交互解决方案。
这5年里,欧拉蜜攻破了不少技术难关。首先要解决的,就是语音识别的精准度。
语音人机交互面临着多重技术难题。例如,人声距离不能过远、发音要标准、环境要安静、不能持续对话、不能被打断……
(欧拉蜜开发套件拾音测试视频截图)
欧拉蜜团队重点解决了这些语音识别方面的问题。目前,欧拉蜜的人声识别准确度高达90%,并且可实现超远距离识别(最远可准确识别距离8米的人声)。
同时,欧拉蜜团队研发了具有强抗噪能力的语音识别技术与核心算法,包括语音活性检测(Voice Activity Detection | Speech Activity Detection),回声消除算法(AcousticEcho Cancellation ),噪声处理算法(Noise Reduction & Cancellation),混响处理算法(Reverberation)等多项专利技术。
欧拉蜜还为企业用户提供深度定制服务,比如对儿童声音、嘈杂环境声音进行训练,可达到特殊要求下的语音识别高准确度。
难点在于自然语言语义理解和处理
“能穿多少穿多少”,这句话的意思,到底是要你“多穿”呢,还是要你“少穿”呢。同样的,中文语境下,类似的歧义句还不在少数。
例如,“中国队大败德国队”,不知是中国赢了德国,还是德国赢了中国;“小王跟我请了假”,不知是小王向我请了假,还是小王和我都请了假……那么,在这种歧义的语境下,我们需要更多的信息来明确原句的意思。
比较常见的 NLP/NLU 现有技术与方案有这么几种。一是基于关键词和简单规则,但这样误抓率高、歧义多,无法精准抓取参数;二是基于ASR语法的扩展,但这种方式描述能力有限,可扩展性较低;三是基于统计的句法分析算法,这种算法准确率与性能不够高,且不易处理上下文问题;最后呢,是处理语法扩展的编程,但这种程序复杂度很高。
那么,欧拉蜜是怎么解决这个问题的呢?
欧拉蜜团队自主研发的语法描述语言(Syntax Language),可用灵活的规则来描述说法。同时,依托可全文检索的结构化知识库,辅助确定语法参数的合法性,消除歧义。
欧拉蜜采用了结合规则和统计的有机算法、时间和数字识别技术、以编译器技术动态解析和匹配规则,能够实现多维度的上下文支持能力,准确理解用户的表达意图。
(上图为欧拉蜜语音助手截图)
例如,当用户连续输入“今天上海的天气”,“北京呢”,“买一张去那里的机票”。经过算法处理以及数据库检索,欧拉蜜能够结合上下文,准确将“北京呢”理解为“北京今天的天气如何”,并给出当天北京的天气状况。
同样的,欧拉蜜也能获取最后一句中的“那里”指代的是“北京”,并为用户反馈当地去北京的机票信息。
以视觉行为侦测技术为辅助的语音人机交互
如果人机交互可以更加“智能”,那么它应该拥有哪些能力呢?欧拉蜜团队进一步改进了语音机器人的唤醒功能,使人机交互更加流畅。
市面上主流的智能音响,目前使用的都是语音唤醒。由于智能音响没有屏幕,一切功能都是通过语音来操控,唤醒功能也不例外。往往会用一句唤醒话术(通常是产品的名称)来作为启动标志,当人们对着智能音响说出这句话时,智能音响就会进行答复并开始接收你传递给它的信息。
你可能会说,语音唤醒已经很方便了,难道还能有什么改进余地吗?
试想一下,日常生活中,当我们想要对另一人说话时常常会面向他,这时候,不需要叫对方的名字,对方也知道我们正在与他对话。如果机器也能做到这样,那么“语音唤醒”都可以省略掉了。
(欧拉蜜人脸与视线追踪视频截图)
欧拉蜜正是想赋予语音机器人这样“人性化”的功能。因此,欧拉蜜团队使用声源定位并结合视线检测(Eye Gaze Detection)技术,来帮助机器人确认用户的说话对象。这样一来,机器人们除了知道你在说话,还能够判断出你是否是在跟它说话,并自动唤醒。
-
智能语音
+关注
关注
10文章
789浏览量
48940
发布评论请先 登录
相关推荐
AI赋能边缘网关:开启智能时代的新蓝海
半导体材料市场规模不断增长 国产化持续推进
全球半导体市场规模预测
无人叉车的市场规模怎么样?适合使用agv的企业有哪些共同点?
![无人叉车的<b class='flag-5'>市场规模</b>怎么样?适合使用agv的企业有哪些共同点?](https://file1.elecfans.com/web2/M00/01/86/wKgaomawdueAFwy8AAe5JpAqqGA461.png)
液压市场规模稳健增长,博科测试IPO上市迎发展良机
2024年全球芯片市场规模将达6298亿美元
SoC芯片,市场规模大涨
![SoC芯片,<b class='flag-5'>市场规模</b>大涨](https://file1.elecfans.com/web2/M00/E5/D3/wKgaomZBeIyADEqiAACsZ19UYWk044.png)
全球MCU市场规模持续增长,中国OEM厂商崛起
![全球MCU<b class='flag-5'>市场规模</b>持续<b class='flag-5'>增长</b>,中国OEM厂商崛起](https://file1.elecfans.com/web2/M00/09/F2/wKgaomcEps-AKdG_AABbuE2srr4590.png)
浅析2024-2030中国RFID市场规模及未来发展趋势
GaN技术引领功率电子产业新风潮,预估2030年市场规模将突破43亿美元
![GaN技术引领功率电子<b class='flag-5'>产业</b>新风潮,预估2030年<b class='flag-5'>市场规模</b>将突破43亿美元](https://file1.elecfans.com/web2/M00/02/B1/wKgZoma9almACc5UAAAqUJ9wcCQ462.png)
功率半导体市场迎飞跃,预测2035年市场规模将增4.7倍
![功率半导体<b class='flag-5'>市场</b>迎飞跃,预测2035年<b class='flag-5'>市场规模</b>将增4.7倍](https://file1.elecfans.com/web2/M00/EA/A9/wKgaomZVRq2AaeLHAAA2Q4EJSBI158.png)
智能算力存在缺口,AI服务器市场规模持续提升
英飞凌2023年全球汽车半导体市场规模增长16.5%,首次实现领跑
人形机器人领域六维力传感器市场规模将达138.40亿元
![人形机器人<b class='flag-5'>领域</b>六维力传感器<b class='flag-5'>市场规模</b>将达138.40亿元](https://file1.elecfans.com/web2/M00/C7/70/wKgaomYKcPaAK8TVAAAsrXb4NDo796.png)
评论