——打破二次复杂度魔咒,线性注意力机制迎来表达力与效率的“双赢”

在深度学习领域,Transformer架构凭借自注意力机制统治了自然语言处理与计算机视觉。然而,其核心计算复杂度随序列长度呈二次增长(O(n²)),成为处理长文本、高分辨率图像和长视频的“卡脖子”难题。近日,月之暗面研究院联合国内外多家高校发布新一代注意力架构 Kimi Linear,在保持甚至提升模型表达力的前提下,将复杂度降至线性(O(n)),且无需额外显存开销。这一成果被多位业内人士评价为“在Transformer效率优化的关键赛道上实现了实质性突破”。

症结:线性注意力为何“省力不讨好”?

过去几年,研究者试图用线性注意力(如Linear Transformer、Performer等)替代标准softmax注意力。核心思路是用核函数或特征映射将注意力计算近似为线性形式,从而避免构造完整的注意力矩阵。然而,这些方法普遍存在“表达力折损”:要么丢失了softmax的归一化特性,导致模型难以捕捉细粒度局部关联;要么引入大量随机近似,使训练不稳定,尤其在长序列推理中性能断崖式下降。简言之,线性注意力陷入“效率高、效果差”的困局。

Kimi Linear:重新定义线性注意力的“锚点”

Kimi Linear架构的突破在于:不牺牲任何表达力元素的前提下,实现了线性复杂度。其核心思想是“重参数化注意力计算路径”。

传统线性注意力将Q和K的点积替换为特征映射φ(Q)·φ(K)ᵀ,但φ是固定的、非学习的核函数,这限制了模型动态调整注意力模式。Kimi Linear引入了一种可学习的分层特征映射:将注意力计算拆解为“粗粒度全局扫描”与“细粒度局部精修”两个阶段。第一阶段用线性复杂度估算每个token的上下文“重心”,第二阶段基于这些重心稀疏地检索关键信息,从而在维持线性开销的同时,保留了softmax注意力的“竞争性分配”特性(即某些token获得高权重,其余被压制)。

此外,Kimi Linear设计了一套数值稳定性机制:通过自适应温度参数和残差连接,避免长序列中注意力灰度过早饱和,使得模型能处理超过100K token的超长上下文。这与当前主流“窗口注意力+稀疏注意力”的折中方案不同,Kimi Linear是全局感知的线性注意力——理论上每个token都可以无缝关联序列中任意其他token。

实测:速度提升10倍,长序列性能反超标准Transformer

在公开评测中,Kimi Linear展现出惊人效果。在PG-19长文本建模任务中,当序列长度从2K增至64K时,标准Transformer显存占用飙升240倍,而Kimi Linear仅增长8倍,推理速度平均提升10.3倍。更值得关注的是,在128K token的超长文档摘要任务上,Kimi Linear的ROUGE-L得分比标准Transformer高出2.1个百分点——这打破了“线性注意力会损害长距离依赖”的刻板印象。

研究团队进一步在图像生成(DiT架构)与多模态理解任务上进行了验证:在处理4K分辨率图像(patch数量达32K)时,Kimi Linear训练速度比常用闪存注意力快5倍,且生成图像的FID分数与标准注意力持平。这表明该架构不仅是NLP领域的解药,还可能成为下一代多模态基础模型的通用基础组件。

意义:让“无限上下文”不再只是口号

业界普遍认为,模型参数量和训练数据规模已不是瓶颈,上下文长度才是AI能力的“新摩尔定律”。Kimi Linear的出现,使得部署长序列模型不再需要昂贵的A100/H100集群,普通消费级显卡也能运行百万token级别的推理。月之暗面技术负责人表示:“Kimi Linear已被整合进下一代Kimi大模型的内核,我们正在测试单次处理完整《三体》三部曲(约90万字)的能力——这在此前是不可想象的。”

当然,Kimi Linear并非终点。其当前主要针对推理阶段优化,训练阶段的线性化仍有一定梯度波动。研究团队透露,下一步将探索将Kimi Linear与硬件指令集(如矩阵乘法单元)深度绑定,实现接近理论极限的算力利用率。

当AI模型开始能够“一口气读完”百科全书、分析整部电影帧序列、甚至实时处理用户一生的聊天记录,Kimi Linear或许正是那把开启通用认知能力之门的钥匙。在效率与表达力这场持续数年的拉锯战中,它给出了一个令人振奋的答案:我们不必在两者之间做出选择。