近日,由国内AI初创企业“深言智能”自主研发的开源大语言模型Kimi K3正式在GitHub及多家主流AI社区上线,随即引发开发者与行业用户的强烈关注。上线不足72小时,Kimi K3的GitHub Star数突破2万,Hugging Face下载量超15万次,多家科研机构和企业纷纷部署试用。然而,海量并发请求迅速涌入支撑Kimi K3推理调用的“超算互联网”平台,导致部分节点响应延迟。为保障服务稳定,超算互联网运营方于今日紧急发布《关于Kimi K3模型Token调度优化的公告》,宣布推出Token Plan(令牌计划),对免费调用配额进行动态调整,并开放付费加速通道。

性能突破引爆社区:Kimi K3凭什么“出圈”

Kimi K3是深言智能继Kimi系列前两代之后推出的第三代开源基座模型,采用MoE(混合专家)架构,拥有320亿总参数量,其中活跃参数约40亿。据官方技术报告,Kimi K3在MMLU、HumanEval、GSM8K等多个主流基准测试中成绩超越同级开源模型,尤其是在代码生成、逻辑推理与多轮对话场景下表现突出,接近GPT-3.5水平。更令社区兴奋的是,Kimi K3在训练中引入了“动态稀疏门控”与“自适应上下文压缩”两项创新技术,使其在低算力环境下仍能保持流畅推理,单张RTX 4090即可运行4bit量化版本。

“开箱即用、效果惊艳”是许多开发者的第一反馈。独立评测博主“AI手记”在实测后表示,Kimi K3在编写Python代码时的准确率与CoT(链式思考)能力明显高于Llama 3-8B和Qwen2-7B,且中文理解能力更强。这种“降维打击”式的性能表现,加上Apache 2.0开源协议的宽松授权,迅速吸引了从个人开发者到企业CTO的广泛关注。

超算互联网承压:免费Token调用激增300%

Kimi K3的爆火立竿见影地传导至下游算力服务层。作为深言智能官方指定的推理加速合作平台,超算互联网(China HPC Network)自上线日起便承担了模型权重下载、API代理和在线推理的流量入口角色。据平台监测数据,Kimi K3发布后的24小时内,平台新增注册用户数环比增长450%,单日Token消耗量突破2亿,是前一周日均值的300%。大量用户通过免费API接口进行批量测试,导致部分节点CPU/IO占用率一度达到90%以上。

超算互联网运营总监王浩在公告中解释:“我们低估了Kimi K3开源后的传播速度。虽然事先做了扩容预案,但峰值流量远超预期。部分用户反映的‘请求超时’和‘推理中断’问题,主要源于免费队列调度拥堵。我们对此深表歉意,并决定立即启动Token Plan。”

Token Plan详解:免费+付费分级调度

根据超算互联网发布的Token Plan细则,平台将自今日起实施三级调度策略:

  • 免费用户:每人每日可领取2万Token(约相当于2万字中文生成),超出部分自动排队,优先级降至最低;单次请求最大上下文长度限制为4K。免费队列节点数为原有的一半,剩余资源将调配给付费通道。
  • 轻度付费用户:推出“Token包月套餐”,月费99元获得200万Token配额,享有中等优先级,支持8K上下文,可开启流式输出。
  • 企业用户:提供专属资源池,按Token计费(0.03元/千Token),支持128K超长上下文,且可自定义服务等级协议(SLA),保障99.5%可用率。

同时,超算互联网宣布将在未来两周内新增200台A100节点,优先部署Kimi K3推理专用镜像,并从即日起开放“Token Plan”预约,7日内注册用户可获赠3万初始Token。这一举措试图在“开源普惠”与“商业可持续”之间寻找平衡。

行业观察:开源大模型的算力瓶颈再成焦点

Kimi K3的走红并非孤立事件。今年以来,Llama 3、Qwen2、DeepSeek V2等开源模型相继爆发,均引发了AI推理算力的短期挤兑。开源降低门槛,但“免费算力”的供给弹性始终是行业软肋。有分析指出,Token Plan的推出实则是平台被迫进行的需求管理,长远看,模型社区需要更高效的量化压缩与分布式推理方案,而算力市场也需要更灵活的定价机制。

深言智能首席科学家林诚在回应记者采访时表示,团队正与超算互联网合作推出“Kimi K3-Lite”版本,推理速度提升30%,内存占用减少40%,预计下周发布。“我们理解社区的痛点,也支持平台方理性调控,开源的生命力在于可持续的生态。”

截至发稿时,Kimi K3在Hugging Face的下载量已突破20万次,而超算互联网的新增注册量仍在持续攀升。Token Plan的落地效果如何,能否平息用户抱怨,或许将决定这款明星模型的开源之旅能走多远。但至少有一点可以确定:当“强大”与“免费”同时出现时,算力平台的应对永远不嫌太早。