在嘈杂的工厂、寂静的图书馆、或者需要保密沟通的军事场景中,我们常常渴望一种“不张口却能说话”的能力。如今,这一科幻般的设想正随着一项名为 “Silent speech with ultrasound” 的技术突破而走向现实。近日,北京大学信息技术学院与中科院声学研究所联合团队在国际顶级期刊《自然·通讯》上发表了最新成果:利用便携式超声波传感器,结合深度学习算法,能够在不发出任何声音的情况下,精准识别用户的舌位、唇形与下颌运动,并将其实时转换为可听的语音。这意味着,未来你只需“动动嘴型”,设备就能替你“说”出想说的话。
无声语音:为何需要“第三种交流方式”?
传统语音交互依赖麦克风拾取声波,在公共场所容易泄露隐私,在强噪音环境下又几乎失效。而手语或唇读虽可以替代,但学习门槛高、沟通效率低。近年来,基于表面肌电图(sEMG)、脑电图(EEG)甚至磁共振成像(MRI)的无声语音接口相继问世,但要么信号易受汗水、肌肉疲劳干扰,要么设备笨重昂贵,无法日常佩戴。超声波技术恰恰提供了第三条路径:它利用高频声波穿透皮肤,实时监测口腔内部软组织的运动状态,精度可达毫米级,且完全不受环境噪声影响。
技术原理:给舌头和嘴唇“拍电影”
研究团队研发的轻量化超声波探头仅有硬币大小,可贴附于用户下巴下方或脸颊两侧。工作时,探头发出频率超过2兆赫兹的微弱超声波,接收来自舌头、软腭、咽喉壁等结构的回波信号。每个人说话时,舌头的起伏、卷曲轨迹都具有高度独特性——比如发“啊”时舌位低平,发“一”时舌前部上抬。这些回波经过AI模型(基于Transformer架构的时序神经网络)处理后,能在50毫秒内解码出对应的音素、单词乃至完整句子。
在100名志愿者的实验中,系统对500个常用英文单词的识别准确率达到了92.3%,对中文单音节词的准确率也超过了88%。更令人振奋的是,由于超声波不依赖声音传导,即使志愿者在咀嚼食物或轻声哼唱时,系统依然能稳定输出语音。团队负责人李敏教授比喻道:“这就像给口腔内部装了一台高速摄像机,但它用的是‘声波镜头’。”
应用场景:从无声打字到无声通话
这项技术的商业前景十分广阔。在隐私敏感场景中,用户可通过无声语音在公共场合完成银行转账、输入密码,避免被旁人收音或摄像偷窥。在听障人士辅助领域,系统可将用户的无声口型直接转为文字或合成语音,帮助其与健听人无障碍沟通。而在工业与军事领域,工人可在85分贝以上的车间里“无声下达指令”,特种兵则能在潜伏时通过口型传递战术信息而不产生任何声响。
此外,该技术还可与AR/VR头显结合——用户只需做出说话的口型,虚拟化身便能同步发声,彻底告别手柄按键或触摸键盘的繁琐操作。研究团队表示,下一代原型机将把超声波模组集成进眼镜腿或口罩中,实现真正的穿戴式无声通信。
挑战与未来:从实验室到口袋
尽管前景诱人,该技术距离大规模商业化仍有距离。目前的实验要求用户提前录制一小段训练语料(约10分钟),以便AI学习每个人独特的口腔运动模式。此外,佩戴探头时需要紧贴皮肤,长时间使用可能会带来轻微不适。研究团队正尝试引入自监督学习算法,将训练时间缩短至30秒以内,同时研发更柔软的医用凝胶贴片以提高佩戴舒适度。
“Silent speech with ultrasound”不仅是一次技术革新,更在重新定义人与人、人与机器的交互边界。当声音不再是交流的唯一载体,这个世界的安静与喧嚣,都将拥有全新的表达方式。我们或许正在见证:未来十年,无声社会将从科幻走进日常。