在人工智能大模型竞争日益白热化的今天,Tokens(令牌)调用量作为衡量模型实际使用活跃度与商业落地程度的核心指标,正成为观察行业生态的“温度计”。根据最新发布的全球AI模型Tokens调用量数据,2024年前三季度,全球主要大模型的总调用量突破2.5万亿Tokens,同比增长超过180%。但更值得关注的是,在这一轮增长浪潮中,市场格局正发生显著变化:头部集中度下降,开源模型异军突起,国产大模型首次跻身全球第一梯队。

一、全球Top5:OpenAI依然领跑,但优势收窄

数据显示,OpenAI的GPT-4系列(含GPT-4 Turbo、GPT-4o等)以约9800亿Tokens的调用量继续稳居全球第一,占比约39%。但相比2023年同期超过55%的市场份额,其统治力已明显削弱。主要原因在于:一方面,越来越多的企业开始采用混合模型策略,将简单任务交给更便宜的轻量模型;另一方面,Meta开源的Llama 3.1 405B模型凭借近乎闭源顶级模型的性能,吸引了大量开发者。

排名第二的是Anthropic的Claude 3.5 Sonnet,调用量约4200亿Tokens,占比16.8%。该公司凭借在安全性和长上下文处理上的优势,在金融、法律等专业领域获得青睐。值得注意的是,Claude的每千Tokens平均价格仍高于行业平均水平,但用户粘性极强。

谷歌的Gemini 1.5 Pro以3900亿Tokens位列第三,占比15.6%。谷歌将Gemini深度集成到Workspace、Android等产品矩阵中,使其在内部生态中调用量持续攀升。不过,其API独立调用量增长相对平缓。

二、国产模型崛起:DeepSeek、通义千问进入前十

本次数据最引人注目的亮点来自中国厂商。深度求索公司的DeepSeek-V2以3100亿Tokens的调用量排名全球第四,占比12.4%。作为一款开源模型,DeepSeek凭借极低的API价格(每百万Tokens仅0.14元人民币)与接近GPT-4的推理能力,迅速占领了中小企业和学术研究市场。尤其在代码生成、数学推理等场景,其性价比优势显著。

阿里云的通义千问2.1以1900亿Tokens位列第七,占比7.6%。阿里通过“百炼”平台深度赋能电商、零售、物流等场景,企业级定制调用量增长迅速。百度文心一言4.0则以1100亿Tokens排名第九,百度强调其在搜索、智能客服等领域的垂直整合。

此外,智谱的GLM-4、月之暗面的Kimi(长上下文特性)同样进入全球前15名。国产模型合共占全球总调用量的约27%,较2023年的12%翻了一倍多。

三、行业趋势:小模型、多模态、垂直化成增长引擎

从调用结构来看,轻量级模型(70B参数以下)的调用量增速远超超大模型。例如,Meta的Llama 3.1 8B和Mistral的Mixtral 8x22B等模型,在移动端和边缘计算场景中调用量同比上升300%以上。这反映出行业正从“一味求大”转向“场景适配”。

多模态模型(支持图像、视频、音频输入)的Tokens调用占比从2023年的6%跃升至21%。GPT-4o、Gemini 1.5 Pro、通义千问VL等模型,在创意设计、内容审核、医疗影像分析等领域的应用加速落地。

垂直领域模型同样表现抢眼。例如,专为医疗设计的Med-PaLM 2(Google)、为金融服务的BloombergGPT在各自赛道的调用量占行业总调用量的8%和5%,尽管绝对值不高,但客单价和复购率远高于通用模型。

四、数据背后的隐忧与机遇

尽管整体欣欣向荣,但数据也揭示了一些结构性问题。首先,全球接近70%的Tokens调用量仍集中在API云服务模式(即通过闭源厂商的API接口),这意味着开源模型的实际落地渗透率与宣传热度存在差距。其次,部分厂商存在“刷量”嫌疑——通过免费额度、促销活动吸引开发者短期调用,但留存率不足三成。

对于国产模型而言,当前的优势主要体现在价格和中文场景优化上。但若要在基础能力(如数学、逻辑推理、多语言)上进一步缩小与GPT-4o和Claude 3.5的差距,仍需投入重金进行算力与数据训练。同时,海外市场的合规与品牌认知仍是挑战。

五、展望:2025年或迎来“应用爆发年”

分析人士指出,随着Tokens调用成本以每年约50%的速度下降,以及更高效的小模型不断涌现,2025年AI模型将从“可用”迈向“好用”,真正进入企业级应用大规模部署阶段。对于中国厂商而言,抓住开源生态、垂直行业与国内庞大的制造业、服务业需求,将是攀登下一阶段高峰的关键。

数据不会说谎。在Tokens调用量的榜单背后,是技术实力、商业策略与生态布局的全面较量。这场围绕智能生产力的竞争,才刚刚进入下半场。