2025年4月1日,千问大模型宣布正式升级其实时语音识别能力,推出全新流式语音识别大模型——Fun-ASR-Realtime。作为一款专为高实时性场景设计的语音识别模型,Fun-ASR-Realtime将首字延迟控制在百毫秒级别,识别准确率接近离线模型水平,并支持多达16种中国方言与30种全球语言。这一技术突破,标志着千问在端到端语音交互领域迈入“低延迟、高精度、多语种”的新阶段。
实时语音识别的“速度与精度”难题
在语音交互场景中,用户对“实时性”的感知往往始于“首字出现的时间”。传统在线语音识别模型往往需要在用户说完一整句话后才开始解码,导致明显的延迟卡顿。而流式(streaming)语音识别技术则要求在语音输入的过程中“边说边识别”,对算法延迟和模型推理效率提出了极高要求。
长期以来,流式识别模型往往面临“速度与精度”的平衡困境:追求低延迟,则容易因缺少未来上下文信息而导致语义误判;追求高精度,则不得不牺牲响应速度,影响交互流畅性。Fun-ASR-Realtime的核心突破正在于此——它采用创新的端到端流式解码架构,结合轻量级声学编码器与动态上下文预测机制,在保证首字延迟低于100毫秒的同时,将识别准确率推至接近离线模型的水平。
技术亮点:实时解码、多方言支持、跨语言适配
据千问官方技术文档显示,Fun-ASR-Realtime在模型结构上进行了系统性优化。它基于千问自研的语音-文本联合预训练框架,在训练阶段同时融合了大规模无监督语音数据和多语种文本数据,使模型能够更高效地捕捉语音与语义的对应关系。在推理阶段,模型采用“因果卷积+自注意力”的双流编码结构,仅使用当前及历史语音帧进行解码,同时利用声学边界检测算法动态调整输出粒度,实现了“边说边出字”的流畅体验。
方言和语言覆盖能力是Fun-ASR-Realtime的另一大亮点。目前,该模型支持包括吴语、粤语、闽南语、四川话、客家话等在内的16种中国主要方言,以及英语、日语、法语、阿拉伯语、泰语等30种全球语言。这意味着,无论用户来自何方,只要使用日常方言或通用语言,Fun-ASR-Realtime都能以接近母语识别的准确率进行实时转写。
此外,模型还内置了自适应口音校准模块,能够在数秒内对用户发音风格进行快速适配,进一步提升了对非标准发音、语速变化、环境噪音的鲁棒性。
应用场景:从智能客服到会议记录,从语言学习到多模态助手
低延迟、高精度、多语种三位一体的能力,使Fun-ASR-Realtime具备了广泛的应用潜力。
在智能客服领域,该模型可以替代传统的关键词触发式系统,实时理解用户语音输入并给出精准响应,大幅缩短用户等待时间。对于方言地区的用户,不再需要刻意切换普通话;对于跨国企业,则可实现多语言客服的无缝切换。
在实时会议记录场景中,Fun-ASR-Realtime的流式输出特性使其能够与会议系统同步,在演讲者说话的同时生成逐字稿,并支持实时翻译、关键词提取等衍生功能。其接近离线模型的准确率,意味着即便在专业术语密集的行业会议上,也可保持较低的转写错误率。
对于语言学习和国际交流场景,模型的多语种识别能力可提供原声转写、发音纠正、口音识别等交互式功能。用户只需说出目标语言的语句,系统即可实时显示文字并评估发音准确性。
而在多模态AI助手中,Fun-ASR-Realtime可以作为语音入口模块,为千问大模型的图文理解、知识问答、任务规划等能力提供实时语音支持,真正实现“边说边做”的交互体验。
行业意义:语音交互进入“零等待”时代
当前的智能语音助手市场,用户对“响应速度”的敏感度正在超过对“准确率”的单纯追求。Fun-ASR-Realtime将首字延迟压缩至百毫秒级,意味着机器几乎感觉不到“等待”的存在,语音交互将无限接近人与人之间的自然对话节奏。
从技术路线来看,千问此次升级也体现了端到端语音识别的成熟方向——不再依赖复杂的级联解码流程,而是通过单一神经网络的流式推理完成从语音直接到文字的映射。这不仅降低了部署门槛,也使得模型能够更灵活地适配不同硬件环境(从云端到边缘设备)。
更重要的是,多方言与多语种的支持,让这一技术具有了显著的普惠价值。在中国,不同地区仍有大量方言使用者在日常交流中更习惯用母语表达;在全球,跨语言沟通的障碍始终存在。Fun-ASR-Realtime的推出,本质上是在打破语言的壁垒,让语音交互变得更“懂”每一个用户。
结语
千问大模型升级实时语音识别大模型Fun-ASR-Realtime,不仅是技术指标的提升,更是对“智能交互应当无感、无阻、无界”这一理念的落地实践。从百毫秒级的响应速度,到16种方言、30种语言的广泛覆盖,一个更加流畅、包容、高效的语音智能时代,正在悄然到来。
据悉,Fun-ASR-Realtime目前已率先上线千问开放平台及部分企业级API接口,普通用户和开发者均可通过千问的在线实验室进行体验。未来,千问团队还计划推出轻量化的端侧版本,让这一实时语音识别能力进一步走入手机、耳机、智能家居等终端设备。