深圳市新厚泰电子科技有限公司
Banner
首页 > 新闻动态 > 内容

盘点传声器技术及市场,远场语音交互如何选型传声器

智能语音交互市场的火热逐渐辐射到产业链的供应商,其中最直接受益就是作为声音的传感设备——麦克风。特别是麦克风阵列的兴起,未来可以让麦克风厂家的销量翻倍增长。在此之前,由于受制于智能手机和平板电脑的增长速度下滑,楼氏、歌尔和瑞声等麦克风厂商的股票相继在2016年中旬左右创下了低谷。

2017年的语音交互局势趋于明朗,资本市场专注研究智能语音交互的投资机构也明显多了起来。那么,这就有必要深入了解一下麦克风这个行业以及技术的趋势。

什么是麦克风?有哪些种类和指标参考?

麦克风作为业界通俗的一种叫法,是英文Microphone的音译名称,国内的称呼乱一些,有时候也简单称作话筒,香港和台湾地区也会称作微音器、拾音器。麦克风的中文学术名称正式是译作传声器,这是一种将声音转换成电子信号的换能器,即把声信号转成电信号,这其实和光电转换的原理是完全一致的。

消费级市场的麦克风基本都是标量麦克风,也就说只能采集单一的物理量信息——声压。声压是指声波通过媒质时,由振动所产生的压强改变量,也可以理解为声音的幅度或者强度。声压常用字母"p"表示,单位是帕斯卡(符号Pa)。声压的帕斯卡单位由于不方便记忆(比如20x10-6Pa~20Pa),一般就以对数尺衡量有效声压相对于一个基准值的大小来表示,即声压级,其单位是分贝(符号dB)。

人类对于1KHz的声音的听阈为20 x10-6Pa,通常以此作为声压级的基准值。这样讲可能晦涩难懂,我们来简单的类比一下:人类的呼吸声压是60x10-6Pa左右,声压级大约10dB,火箭发射的声压是4000Pa左右,声压级大约165dB,闪光弹的声压超过1万Pa,声压级大约175dB。

分析上述这些晦涩难懂的数字,自然就引出麦克风的参数指标,其实我们关注的就是麦克风还原真实声音的能力,这是一个很难的挑战,因为声电转换即意味着失真。

为了描述麦克风的性能,有几个性能指标是非常关键的,这包括了灵敏度、指向性、频率响应、阻抗、动态范围、信噪比、最大声压级(或AOP,声学过载点)、一致性等。这几个指标其实都好理解,决定了麦克风的性能,而且每个指标都非常关键,缺一不可。当然这些指标相对于喇叭的T-S参数来说,真的是简单的了许多。

麦克风是典型的传感器产业,其技术迭代非常迅速,外观也发生了不少变化,估计很多人从下面的麦克风阵列中准确找到麦克风就很困难。

现在麦克风阵列主要使用的是数字MEMS麦克风,其最长尺寸仅有3.76MM。MEMS麦克风也是手机中大量使用的传感器件,一般手机至少有2个以上这类麦克风。MEMS麦克风实际上只是工艺上的改进,其原理依然属于电容式麦克风。与MEMS麦克风直接PK的,就是驻极体麦克风。

这两种麦克风是消费电子领域的主力军,比如亚马逊的Echo和声智科技的开发板主要是MEMS麦克风,科大讯飞的开发板则主要是驻极体麦克风。这两种麦克风从性能指标来看,没有实质性差别,驻极体麦克风的性能指标还更高,所以声智科技的单麦系列也是驻极体麦克风,但是,MEMS麦克风的优点是一致性比较好,更适合远场语音交互用的麦克风阵列。

电容式麦克风还有另外一个形状,就是录音棚常用的专业麦克风,这与我们KTV唱歌的麦克风是有本质区别的。KTV的麦克风一般都是动圈式麦克风,这种麦克风的性能不如电容麦克风,优点是适合人声收录,缺点是灵敏度低,这在KTV反而是优点,因为可以有效避免KTV环境的啸叫。

当然,还有带式麦克风和碳精麦克风,这两种麦克风已经不常见了,特别是碳精麦克风,以前主要在老式电话中使用,现在基本被淘汰了。这几种麦克风可以从图中对比一下,有时候就会慨叹,技术总是这样颠覆式发展。

当然,新型的麦克风还包括压电麦克风、光纤麦克风、激光麦克风等等,甚至可以直接把电视屏幕或者扬声器(喇叭)也当作麦克风使用。另外,国防领域也在研究部署矢量麦克风等更复杂的麦克风。事实上,声音的发展轨迹和雷达比较类似,麦克风阵列也是当前技术发展的一个阶段,传感技术的迭代是技术和市场迭代的重要原因。

全球麦克风的技术和市场的格局如何?

毫无疑问,在半导体生态体系中,MEMS正扮演着越来越重要的角色,其应用范围包含了消费电子、汽车工业、工业控制乃至生物医学、航空航天等领域,且仍在迅速扩大。随着消费电子市场的增长,消费类应用已经成为MEMS传感器市场的主要推动力。2014年MEMS传感器市场规模达到130亿美元,最大的消费类应用规模达到59亿美元,到2019年预计将超过250亿美元,年复合增长率约11.2%。

我们比对了最新的行业调研数据,从2013年到现在其市场格局变化并没有想象的变化,反而是这几年MEMS厂商集体进入了低速发展的时期,还好今年的语音交互市场火爆,也给MEMS麦克风市场带来了想象空间。

下面还是以互联网公开的数据来概况介绍下市场,已经公开报道了3年,相信很多质疑的声音也都消失了。这些数据并不能代表真实情况,特别是当前的市场状态,但是可以作为一个重要的参考。

根据IHS的统计数据,美国公司楼氏电子在2013年是全球最大的已封装MEMS麦克风(直接进行印刷电路板组装)供应商;而德国公司英飞凌则是MEMS麦克风裸晶(供应给MEMS麦克风制造商)的龙头厂商。楼氏的营收在已封装MEMS麦克风市场中占据59%的比例,英飞凌出货量则在MEMS麦克风裸晶市场占据78%。

全球已封装MEMS麦克风供应商营收排行榜(单位:百万美元)

全球MEMS麦克风裸晶供应商出货量排行榜

在已封装MEMS麦克风市场,排名第二的供应商为瑞声(AAC),营收市占率13%;排名第三的则是歌尔(Goertek),营收市占率7%。瑞声与歌尔都是中国厂商,其业务也重度依赖苹果和三星;

瑞声供应iPhone5三颗高性能MEMS麦克风中的一颗,也进驻了iPhone5S;歌尔则是iPhone专用的耳机MEMS麦克风主要供应商。瑞声2013年营收成长8%,歌尔则因为开始供应手机用高性能麦克风,2013年营收成长率高达35%。当然,经过这3年市场变化,楼市、瑞声和歌尔这三家的市场份额其实也发生了悄然改变,楼氏继续强化了其行业龙头的地位。

排名全球第四大已封装MEMS麦克风供应商的是韩国BSE,其业绩表现来自于拥有苹果最大对手三星这个大客户;BSE的2013年营收与2012年相较,成长率超过250%。紧追在BSE之后排名第五大的厂商则是欧洲业者意法半导体(ST),该公司的MEMS麦克风业务因为赢得了iPad设计案而持续扩张。


全球排名前50位MEMS厂商

国内包括台湾也有一些麦克风厂商,这些厂商主要依靠价格制胜,技术方面并没有建立起太高的壁垒。国内外也出现了一些创业公司,比如美国的Vesper MEMS,以压电麦克风作为主要技术特点,但是这些技术本身就是一线大厂掌握的技术,只是考虑市场因素而没有产线部署。所以这类创业公司当进入量产的时候压力还是非常大的,因为这个行业确实需要重资产和重投入。

如何选型适用远场语音交互的麦克风?

远场语音交互的概念其实是相对的。我们知道,语音交互涉及了非常复杂的技术链条,包括了声学处理、语音识别、语义理解和语音合成等核心技术。

  • 声学处理主要是仿真人类的耳朵,保证机器能够听得准真实环境下人的声音;

  • 语音识别则是把听到的人声翻译成文字;

  • 语义理解则分析这些文字的意义;

  • 语音合成就把机器要表达的文字翻译成语音。

这四项技术虽然独立发展,但实际上无法割裂,同时在其他技术的配合下,才能形成一次语音交互的完整链条。

这四项技术虽然独立发展,但实际上无法割裂,同时在其他技术的配合下,才能形成一次语音交互的完整链条。

以Siri为代表的近场语音识别已经发展了60多年,特别是在2009年以后借助深度学习有了实质性提高,但是正如扎克伯格所说的,当真正产品落地的时候,我们发现用户真正需要的却是类似Echo所倡导的远场语音识别。

显然,这又是一个崭新的技术领域,因为拾音距离的扩大带来的问题不仅仅是语音信号的衰减,而且还带来了复杂的真实环境以及复杂的用户习惯。

近场语音识别要求必须是低噪声、无混响、距离声源很近的场景,比如用户总是要对着手机讲话才能获得符合近场语音识别要求的声音信号,同时还要求用户满足标准发音,其识别率才有可能达到95%以上。

但是,若声源距离较远,并且真实环境存在大量的噪声、多径反射和混响,导致拾取信号的质量下降,这就会严重影响语音识别率。同样的,我们人类在复杂远场环境的表现也不如两两交耳的窃窃私语。

通常近场语音识别引擎在远场环境下,若没有声学处理的支持,比如麦克风阵列技术的适配,其真实场景识别率实际不足60%。而且,由于真实场景总是有多个声源和环境噪声叠加,比如经常会出现周边噪声干扰和多人同时说话的场景,这就更加重了语音识别的难度。因为当前的语音识别引擎,都是单人识别模式,无法同时处理多人识别的问题。

麦克风阵列是当前解决上述问题的主要途径,但是麦克风阵列也有诸多缺陷,其中之一就是对于硬件的要求较高,这包括了麦克风和芯片器件。因此麦克风阵列如何选型麦克风也是非常细致认真的一个工作。那么,如何选型智能语音交互的麦克风呢?

首先选型前我们要对产品有一个清晰的定义,比如产品销量、产品寿命、产品场景等等,这非常重要。即便性能指标完全一致的情况下,也需要考虑麦克风供应厂商的成本、生产工艺、供货能力等因素,因为传感器件厂商归根结底还是一个生产工艺的问题,比如国内的很多麦克风厂商其实就是直接购买国外英飞凌的MEMS麦克风方案直接封装,并不具有技术研发能力,其生产工艺和生产规模就是国内很多厂商的主要差异。

其次选型要重点评估麦克风的性能指标,这包括了灵敏度、指向性、频率响应、阻抗、动态范围、信噪比、最大声压级(或AOP,声学过载点)、一致性这几个指标,其中指向性、信噪比、AOP和一致性是麦克风阵列最主要考虑的指标。