7月2日,一场持续100小时的极限直播挑战——影视飓风「重返荒岛」圆满落幕。在这场横跨昼夜、历经风浪的超级直播中,一个“隐形”的技术支撑者引发了行业关注:由阿里千问大模型团队升级的实时语音识别大模型Fun-ASR-Realtime,全程为直播提供实时字幕,累计识别字幕6万余条,总字数高达132万字。这意味着,平均每分钟就有超过220字被精准转录,且首字延迟被控制在百毫秒级别,几乎与直播画面同步。

百毫秒延迟:从“听清”到“秒懂”的技术跃迁

千问大模型官方发文宣布,正式升级的Fun-ASR-Realtime模型,是一款专为流式场景打造的语音识别系统。其核心突破在于:在保持接近离线模型识别准确率的前提下,将首字延迟压缩至百毫秒以内。传统实时语音识别常面临“延迟与精度不可兼得”的困境——为了快速响应而牺牲识别率,或为追求精度而加大延迟。Fun-ASR-Realtime通过创新的流式解码架构和上下文感知优化,实现了“又准又快”的平衡。

据披露,该模型支持16种中国方言以及30种国际语言。在「重返荒岛」直播中,面对户外风声、海浪声、多人对话等复杂声学环境,模型依然输出高质量字幕,未出现因环境噪音导致的全局卡顿或错误累积。100小时不间断运行,模型稳定性经受住了极限考验。

132万字背后的技术挑战

影视飓风「重返荒岛」直播旨在展示户外生存全流程,内容涵盖探险、搭建、烹饪、交流等多元场景。直播期间,主持人及嘉宾的语音风格自由,既有快速连珠炮式的解说,也有低语、方言甚至夹杂特殊术语。传统实时字幕系统往往因长时间运行导致延迟积累、错字率上升,最终需要人工干预。而Fun-ASR-Realtime凭借自适应的语音端点检测和动态语言模型调整,在100小时内持续维持低延迟输出。最终6万余条字幕、132万字的数据,不仅验证了模型的吞吐能力,更证明了其在长流式语音场景下的可靠性。

为什么是“接近离线模型”?

离线语音识别可以充分利用完整音频信息进行全局优化,准确率通常高于流式模型。Fun-ASR-Realtime之所以能与离线模型看齐,关键在于其采用了“流式自注意力+上下文压缩”技术。模型不是逐帧孤立处理,而是在保持因果约束的前提下,通过有限历史信息重构全局语义。此外,千问大模型团队还引入了针对直播场景的领域微调,使模型对常见户外用词、设备名词、临时缩略语等具有更高敏感度。

行业意义:实时字幕的“普惠化”加速

实时字幕技术过去主要集中应用于会议、直播等付费场景,且常因方言及多语言支持不足而受限。阿里此次升级,将16种方言和30种语言纳入支持范围,意味着即使是使用闽南语、粤语、四川话等方言的直播内容,也能被自动识别并生成字幕。对内容创作者而言,这降低了跨语言、跨地域直播的技术门槛;对听障用户而言,高质量的实时字幕进一步打通了信息获取的通道。

值得注意的是,Fun-ASR-Realtime并非孤立技术,而是阿里“通义”大模型生态的一部分。千问大模型团队表示,未来将持续优化模型在嘈杂环境、多说话人场景下的表现,并计划开放更多行业定制接口。

结语:从实验室到荒岛,技术终需落地

影视飓风「重返荒岛」直播中那132万字的实时字幕,不仅仅是冰冷的数字,更是技术从实验室走向真实世界的生动注脚。当观众在手机屏幕上看到与声音几乎同步弹出的字幕时,背后是百毫秒级的运算、方言数据库的匹配、以及大模型对上下文的理解。这场100小时的极限考验,既是对Fun-ASR-Realtime模型的压力测试,也向行业展示了:实时语音识别,正在跨越“可用”与“好用”之间的鸿沟。