V4 Pro 0813版的发布设立了一条新的“斩杀线”。短短几个月间,中美AI之间的差距从令人绝望到现在已经各领风骚好几周,Claude Fable 5遥遥领先的故事,在不到2个月的时间里优势已经消失殆尽!
8月13日,DeepSeek V4 Pro发布后不久,在Terminal-Bench 2.1测试上得分从72.1%跃升至87.9%,在CyberGym上从52.7%升至83.3%,在DeepSWE上更是从12.8%飙升至62.7%!
性能到底如何呢?有网友亲测后给出了一个答案:过去旗舰模型很难同时做到性能强、价格低以及速度快,一般最多只能兼顾其中两项,甚至只有一项!比如Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol,性能很强,但是价格贵,速度还慢!
而DeepSeek V4 Flash则是速度相当快,并且极其便宜,但在性能上往往和Claude Fable 5、GPT-5.6 Sol差一档,这也是事实。比如我们经常用大模型写程序,小微任务选DeepSeek V4 Flash简直就跟不要钱一样;而复杂任务还是会选GLM 5.2或者性能更好的模型。
但DeepSeek V4 Pro却同时做到了性能强、价格低,同时还速度快。价格方面,依然是DeepSeek一贯以来的“地板价”。比如Claude Fable 5的输入百万Token是10美元,输出是50美元;而DeepSeek V4 Pro的输入百万Token仅为0.43美元,输出是0.87美元,如果缓存命中则低至0.0036美元。
有X平台上的网友评价称,不要光看DeepSeek的缓存命中价格低,而是它的缓存命中率高到令人发指,这才是它性价比极致化的重要原因!它的缓存机制是将原本放在GPU显存里的KV Cache,进一步搬到了SSD上,这就是即将被普及的SSD KV缓存机制。
简单理解,DeepSeek的SSD KV Cache就是把本来只能放在GPU显存或内存里的KV Cache,搬到了SSD上,让它从“显存级缓存”变成了“磁盘级上下文记忆”。
这个缓存是什么意思呢?就像大模型阅读一本100万字的技术文档,它不可能把所有的内容都实时存下来,而是会把计算总结的内容放到缓存里。当你问它“刚才第三章提到的那个技术是什么”时,它会从缓存里读出来给你,这就是缓存命中!
过去用来存放缓存的是昂贵的显卡显存,现在则变成了便宜的磁盘阵列!因为这个操作相当于把需要天量级显卡来填充的缓存,直接变成了SSD磁盘阵列。大家可以想象一下,一张RTX 5090显卡需要2万元左右,用这2万块钱可以买多少SSD硬盘?都可以建个RAID10级别的磁盘阵列了,速度快还带冗余,这都是硬件玩家的梦想!
按照DeepSeek的操作,GPU和显存永远用来干更有价值的计算,而缓存则让便宜的SSD去完成,这就是DeepSeek的“惊天操作”。当然,这个操作也是被美国人逼出来的,毕竟我们拿不到高性能的显卡,数量也严重不足,只能逼着我们不断去优化模型。
MoE(混合专家)模型的架构也是同样的道理。这是一种稀疏激活架构,意思是总参数量很大,但每个Token只激活少量专家做计算,把模型容量和推理算力解耦。这个概念不是DeepSeek首创的,只不过DeepSeek解决了其致命缺点,现在它成了大部分开源大模型的首选架构。
DeepSeek利用这些优势,已经对坚持稠密大模型的Anthropic和OpenAI形成了费用上的碾压级优势。原本Anthropic和OpenAI还可以用“性能不如我来叙事”来应对,现在是性能拉平,单价与速度却没法比,DeepSeek V4 Pro把这些大模型拉进了一个“死亡三角”!
这就是DeepSeek V4 Pro发布后出现的新“斩杀线”:轻量级有DeepSeek V4-Flash,重量级有DeepSeek V4 Pro,而且还开源,随便下载部署,有硬件资源的几乎就免费了!美国那些动辄数万亿美元的叙事早就不灵光了,上个月底到这个月初API订阅费的疯狂降价就是他们的自救。
也是因为从7月中旬以来,中国各大开源模型轮番上阵,把美国各大闭源模型都打懵了。它们的上市计划不断推迟,估值不断缩水,华尔街的资本也搞明白了:再投钱下去不是要打水漂吗?
美国的那些闭源模型至今还未形成盈利模式,需要不断画饼让投资人加码才能维持发展。现在叙事逻辑崩溃,融资渠道不断收紧,未来前景可是大大不妙!