
年初还有15%,5月缩到9%,如今只剩3%。
这组不断变小的数字,描绘的是中美顶尖AI模型之间的性能差距。彭博行业研究最新发布的报告显示,美国AI企业相对中国的性能领先优势,已经收窄至有记录以来的最低水平。
推动这一变化的关键力量,是中国AI公司深度求索在9月推出的新模型DeepSeek V4.1 Flash。
彭博行业研究高级分析师罗伯特·李在报告中指出,中国顶尖模型的基准测试得分如今仅落后美国对手约3%,这种性能提升将为中国AI企业带来更多市场份额。
一场被许多人认为美国稳操胜券的技术竞赛,正在变得越来越胶着。
这不仅是一组技术指标的变化,更牵动着全球资本、产业链布局与大国科技政策的神经。
从15%到3%,追赶速度超出预期
在全球知名的大模型评测平台LiveBench上,DeepSeek V4.1 Flash于9月拿下全球第六的位置,综合得分81.1分。

同期排名最高的是美国公司Anthropic的模型,得分为83.4分。两者之间只差2.3分,这在头部模型的激烈角逐中,几乎已是一步之遥。
这也是自2025年DeepSeek凭借推理模型R1一鸣惊人以来,中国模型在该榜单上取得的最高排名。
值得一提的是,这款模型的名字里带着“Flash”,意味着它主打轻量与高效,而非一味堆砌参数规模。
LiveBench的特点在于题目持续更新,以减少模型“背题”带来的分数虚高,因此被业内视为相对可靠的能力参照。
其他研究也印证了这一趋势。斯坦福大学发布的2026年人工智能指数报告显示,截至今年3月,中美顶尖模型的性能差距已缩小到2.7%左右。
不过,美国的整体优势依然存在。在LiveBench排名前15的模型中,来自中国的只有3个,头部阵营仍以美国模型为主。
换句话说,中国已经有选手冲到了领跑集团的身边,但整个梯队的厚度,美国依然占据明显上风。
打个比方,这像是一场马拉松,中国的头号选手已经追到领跑者身后几步远,但第二、第三梯队的选手仍然落后一截。
芯片封锁下的另一条路

中国AI为何能在算力受限的情况下持续追赶?报告给出了两个关键原因。
其一是技术能力的整体提升。中国团队在算法架构、训练效率和模型压缩等方面积累了大量经验,能够用更少的资源训练出更强的模型。
其二是针对国产硬件的深度优化。在获取先进英伟达芯片受到限制的情况下,中国企业越来越擅长让模型在本土芯片上高效运行。
这种“螺蛳壳里做道场”的能力,让有限的算力发挥出了远超预期的效果。
这一进展也让外界开始重新审视美国出口管制的实际效果。原本旨在拉开差距的芯片封锁,反而在一定程度上倒逼了中国AI产业的软硬件协同创新。
也有分析人士更进一步认为,深度求索与华为的组合,正在直接冲击英伟达在中国市场的护城河,而不只是影响它的股价。
如果国产芯片与国产模型形成稳定的闭环生态,英伟达在中国市场的话语权将面临前所未有的挑战。
对于华盛顿来说,这意味着单靠芯片管制拖慢对手的思路,可能需要重新评估。
从15%到9%再到3%,变化的方向本身才是这份报告最值得关注的地方。彭博行业研究明确预期,中国AI实验室还将继续扩大市场份额,而不是就此停滞。
追上了性能,还没追上利润
然而,技术上的追赶并不等于商业上的成功。
罗伯特·李在报告中同样指出,中国AI产业面临着严峻的商业化压力。他预计,这个行业至少要到2030年才可能实现整体盈利。
压力首先来自利润微薄的token供应。为了争夺用户,各家厂商纷纷压低价格,模型调用成本被一降再降,单位利润空间被大幅压缩。
其次是异常激烈的同质化竞争。据统计,中国市场上的大语言模型已超过1100个,众多玩家挤在同一条赛道上,彼此之间的价格战几乎没有尽头。
对企业来说,这意味着每一次技术突破带来的优势窗口都非常短暂,很快就会被下一轮降价所吞没。
在变现能力方面,目前表现最好的是字节跳动旗下的豆包。相比之下,深度求索和腾讯的聊天机器人仍然免费向用户开放。
这形成了一幅颇为矛盾的图景:中国AI在技术上越来越接近世界顶尖,却还没有找到一条可持续的赚钱之路。
如何把技术实力转化为商业回报,将是中国AI企业下一阶段必须回答的核心问题。
对美国AI巨头而言,这份报告的冲击可能首先体现在价格层面。当性能相差无几、价格却低得多的中国模型出现在全球开发者面前,美国企业的高定价策略将承受越来越大的压力。
3%的差距依然是差距,美国并没有失去领先地位。
美国企业在顶尖人才、资本规模和先进算力上的积累,仍然是短期内难以撼动的优势。
但当追赶者的速度明显快于领跑者,比赛的悬念就已经回来了。接下来几个月,无论是美国新一代模型的发布,还是中国厂商的下一次迭代,都可能改写这张排行榜。