2025年3月18日,北京——大模型推理效率长期是制约AI落地的关键瓶颈。今日,国内人工智能企业DeepSeek与北京大学计算机学院联合宣布,正式推出新一代大模型推理优化框架——DSpark。该框架在保持模型输出质量的前提下,可将主流大语言模型的推理速度提升60%至85%,并已通过内部及多家合作伙伴的实测验证。
推理“卡脖子”难题迎来突破
随着大模型参数量突破千亿、万亿级别,推理阶段的显存占用与计算延迟日益成为行业痛点。现有方案要么依赖昂贵的专用硬件,要么牺牲精度换取速度。DeepSeek联合研发团队从2024年初启动DSpark项目,目标是在通用GPU集群上实现“无损加速”。
“我们观察到,现行推理框架中大量的计算资源被浪费在冗余的注意力机制计算和内存搬运上。”DeepSeek首席科学家李远在发布会上介绍,“DSpark从算法、编译器、运行时三个层面进行了系统性重构,首次将动态稀疏注意力、内存自适应压缩与计算图联合调度技术整合在一个框架内。”
三大技术创新支撑性能跃升
据北京大学高性能计算实验室负责人张维教授透露,DSpark的核心创新可概括为三个层面:
-
动态稀疏注意力机制:基于输入序列的实时统计特性,自动剪枝低贡献度的注意力头,减少约40%的矩阵乘法运算。与传统静态稀疏方案不同,DSpark采用轻量级预测器动态调整剪枝策略,确保长文本推理中精度损失低于0.3%。
-
分级缓存与内存洗牌:针对KV Cache(键值缓存)占据显存大头的问题,DSpark引入“热-温-冷”三级缓存策略。高频访问的缓存驻留在GPU显存,低频数据自动迁移至CPU内存或SSD,并通过预取技术隐藏I/O延迟。实测显示,同等显存容量下,该技术使支持的最大上下文长度扩展2.1倍。
-
算子级计算图联合调度:DSpark内置的编译器能够自动识别模型拓扑中的算子依赖关系,将连续的矩阵乘、激活函数与注意力运算融合为单一计算核,减少kernel launch开销。配合自主设计的流水线并发策略,在8卡A800集群上,解码阶段的tokens生成速度提升85%。
实测数据:从6秒到1.7秒
在发布会上,开发团队展示了基于DeepSeek-V3千亿参数模型的基准测试结果。在标准GSM8K数学推理和HumanEval代码生成任务中,使用DSpark后每条请求的平均端到端延迟从6.2秒降至1.7秒(加速比72%);在某些稀疏度较高的长文档摘要场景,加速比达到85%。与此同时,模型的BLEU、ROUGE得分与原始版本差异不超过0.5个百分点。
“最令人惊喜的是兼容性。”已参与内测的某金融科技公司CTO王先生表示,“我们直接将DSpark作为FlashAttention的替代安装后在原模型上运行,无需修改模型权重,全程不到20分钟。目前已在风控场景的实时对话系统中部署,单GPU并发用户数翻了3倍。”
产学研协同的新范本
此次发布是DeepSeek与北京大学继2023年共建“智能计算联合实验室”后的又一重大成果。北大方面表示,DSpark的底层技术源自团队在“神经网络体系统筹优化”方向的多年积累,其中2项核心算法已被国际顶级会议ICML 2025接收。双方计划在未来三个月内将DSpark框架开源,并发布配套的微调工具包和基准数据集。
业内分析人士认为,随着大模型从“能做”走向“好用”,推理效率已成为决定商业落地速度的胜负手。DSpark将加速比推至60%以上,意味着企业可以在不增加硬件投入的前提下,直接带来对应比例的吞吐量提升或成本下降。对于云服务商、智能客服、内容生成等重推理环节而言,这一数字可能意味着盈亏平衡点的到来。
目前,DSpark已在GitHub开放申请公测,首批支持PyTorch 2.0+及CUDA 11.8环境下的Llama系列、DeepSeek系列及Qwen系列模型。DeepSeek表示,未来一个月内将发布适配MoE架构的加速版本,并持续探索与国产算力平台的深度适配。
(记者 陈思远 北京报道)