全网都在等蓝色大鲸鱼更新DeepSeek V4 正式版,看看梁文锋这回到底是梁圣、梁哥还是牢梁的时候,一个网传的闭门会记录刷屏了。我只能说,看完这场会议的文字记录,我还真想叫一声梁圣了。。
事情是这样的,在 DeepSeek 推进首轮外部融资期间,梁文锋开了一场三个多小时的投资人交流会。这几天会议内容在各种群里疯传,梁圣语录被各位弟子们疯狂记录,连《黑神话》的冯骥都下场点评“荡气回肠”。

具体的语录呢,咱就不复读了,大伙可以自行搜索。今天咱的主要目的是来拆一下,语录背后的一些重要的技术、商业逻辑,看完你就会明白,DeepSeek究竟想下一盘什么样的棋?
>/ TileLang?
据网传信息,DeepSeek正在尝试脱离英伟达的生态,而这可能和一个叫TileLang的编程语言有关。去年九月,DeepSeek 发布 V3.2-Exp 时,公告里就有一句不太起眼的话:"我们使用高级语言 TileLang 进行快速原型开发,以支持更深入的探索。"
外行人虽然看不懂吧,但那时候,行内人就可以注意到,V3.2-Exp 没用业界更常见的 Triton 来公开研究原型,而是选了 2025 年 1 月才开源的 TileLang。

这就相当于,那么多好用的GPT、智谱、Kimi模型不用,就非要用你那小众宝藏 Gemini 。。
但这当然是有道理的,不好用我肯定不用啊。差友们可能听过一个说法:芯片可以追,生态追不上。这里的“生态”主要就是指英伟达围绕CUDA搭起来一系列生态。CUDA 是英伟达 2006 年推出的 GPU 编程平台。全世界大量主流 AI 模型,都建立在英伟达GPU和CUDA生态上。
你买别家的芯片,硬件跑分可能不差,但一跑真实的训练任务就各种拉跨,就是因为围绕它的编译器、算子库、通信库和框架适配,远没有CUDA生态成熟。这是英伟达真正的护城河。
那这和 TileLang 有什么关系呢?

首先咱得讲清楚一个东西,GPU 算子。
大模型训练看起来高深莫测,拆到底层,其实就是反复做矩阵乘法等基础操作。而每一种反复执行的操作,都可以写成一个专门在GPU上跑的小程序,这玩意就叫算子。
英伟达二十年积累下来的 CUDA 生态里,就有大量已经写好、调好的高性能算子。再加上现成算子未必够用,很多还得自己手搓。只要这些新算子继续直接用CUDA写,代码资产越攒越多,和英伟达的绑定也越来越深,脱离CUDA的成本就非常高。
TileLang 瞄准的,正是这个写算子的方式。
简单讲,它在开发者和底层硬件之间,加了一层翻译器。
工程师可以先用更接近 Python 的方式,告诉它这个算子要干什么,再由编译器处理下面那些麻烦活。
在英伟达的卡上,它最后还是会走 CUDA。但以后换成别的芯片,虽然仍要重做后端和硬件适配,但上层的数据流和部分代码有机会继续复用,不必所有算子都从头手搓。

到这,再加上之前传出来的DeepSeek正在适配昇腾的消息,你就知道他们的真正意图了。
等到未来一声令下,直接拎包入住,难道不香吗?>/ 便宜,真没好货吗?
DeepSeek 的定价,一直是行业里最让人看不懂的事之一。梁圣真的只收个电费吗?但根据网传的说法,DeepSeek的利润还是有的,而且还不低,基本不到一年就能回本。
而且你可能想不到,DeepSeek反而是稳赚不赔,因为用的人太多了。
隔壁知危编辑部告诉我们,他们在与高性能计算相关的专家交流时了解到,模型产品的火爆,本身就是能提高性价比的,因为同样的机器,跑得越满,利用率肯定就越高,反过来,没流量的玩家,机器可能经常在空转,这不就浪费卡了嘛。

再加上海外模型没有把成本放在最关键的位置,因为不缺算力。而 DeepSeek 一直都缺算力,而且永远追求长期主义,所以有研究低成本模型的动力。
大伙从DeepSeek的架构里,就能看出来。众所周知,大模型本质上是个大号的词语接龙机器,你给它一段上文,它根据概率,猜后面最该接什么。
每次对话时,系统会把你前面说过的东西,一起塞进上下文里,让模型看起来像是有记忆的。
然而,上下文越长,模型要算的东西就越多。尤其现在是 Agent 时代,情况更夸张了。哥们随便说句 Hi,可能两万 Token 就直接没了。


Token这么多,再便宜也扛不住啊。所以,这就是DeepSeek下功夫的地方,缓存命中。模型读上下文时,会把读完的理解产出成一堆中间结果(术语叫 KV Cache)保留下来,和打游戏一样做个存档。
这样在用户下次提问的时候,就可以在存档的基础上,直接开始计算新的输入,这就是SL大法的魅力啊。

当然有人要问,说得这么简单,别人不能用吗?
当然能。就拿 Anthropic 来说,触发缓存命中后,API 的价格变成了原来的 1/10,看着是省了不少,但是人缓存命中只给保留 5 分钟。。。
想保存更久?那就是另外的价钱了。
因为缓存文件太大了呀,为了读取速度通常放在内存甚至显存里,而这俩现在比金子还贵,存不起。
然而DeepSeek这里,则是几小时到几天。

这,就是因为它的独门绝技——MLA,多头潜在注意力机制(Multi-Head Latent Attention)。简单来说,DeepSeek 干了一件事:在存 KV Cache 的时候,做了一层暴力压缩。
传统架构存缓存,是把模型读上下文产生的全部中间数据原样保存,一层不落,所以文件巨大。
MLA 干的事是暴力压缩:把这堆数据压成一个极小的摘要,用时再还原,效果几乎不损。
这样一压缩,缓存体积就降低了不少。
比如我们用KV Cache计算器模拟了下,当上下文干到 10 万的时候,DeepSeek V4 Pro 的缓存文件只有 0.4 个 G。而友商呢,会直接干到6个G。


正是有了 MLA 对缓存的巨额压缩,DeepSeek 才能用硬盘的价格,打出了内存的体验。
而且这玩意,DeepSeek V2 发布的时候就已经给搞出来了。。只能说它从架构设计的第一天就把效率当核心目标。MLA、MoE、TileLang,这些技术选择的出发点都不是“怎么做最强的模型”,而是“怎么用最少的资源,做出足够强的模型”。
真正的远见大师,不得不服。
>/ 以少胜多?
最后,我们来聊聊DeepSeek到底在坚持什么。
去年春节那波泼天流量,搁任何一家公司,剧本都是连夜融资、疯狂投放,把用户焊死在自己 App 里。DeepSeek 呢?不买量、不急着变现,连留存数据都懒得做,甚至你用得太猛了他还想把你踹出去。

其实它并不是不想赚钱,只是现在不想赚钱。这帮人心里装着个极其庞大的野心,那就是AGI。这也就解释了,为啥现在外面一堆人搁那儿狂卷C端 Agent、世界模型,DeepSeek 不动如山。因为在他们的视角里,这些玩意儿,也就是通往 AGI 大道上顺手的事儿。

在 DeepSeek 的账本上,把精力拿去变现,等于用摘西瓜的时间去捡芝麻,血亏。
他们信奉一条极其硬核的底层逻辑:AI 太大了,大到不可能被独占。
咱们简单算笔账,如果 AI 未来能吃掉全人类社会 GDP 的 10%,这块蛋糕哪怕打骨折再打骨折,也绝对没有任何一家科技巨头能一口吞下去。
而且历史早就证明了,盘子越大,想吃独食的人死得越惨。你前脚想垄断,后脚同行就合伙防你,监管部门拿着放大镜盯你,市场上还会分分钟手搓一个免费平替版出来瓦解你。

顺着这套逻辑,AI 的竞争最终会变成一场反向拍卖:想吃 5% 利润的,会被只要 1% 的卷死;占 1% 的,又会输给只要 0.1% 的。谁要得少,谁的价格就低、朋友就多、阻力就小,谁就能活到最后。
当然了,用爱发电也是不可能的,拿太少公司明天就得解散。这场反向拍卖的最后,一定会卡在一个极其精妙的均衡点。现在知道为什么鲸鱼喜欢降价了吧。
少拿一点、多让一点,换的是把 AGI 做成的概率。反正只要蛋糕真有那么大,你随便分一点,利益就非常大,现在抢芝麻干什么呢?
这,就是 DeepSeek 以少胜多的顶级阳谋。
总之,在这个大家都在急着做 C 端应用套现、卷流量商业化的时代,能有这么一家公司,专注于AGI的终极天花板,这本身就是一件非常吸引人的事儿。
反正,蓝色大鲸鱼已经在水下憋足了劲儿。至于 DeepSeek V4 正式版到底能不能再次刷新大伙的认知?咱们拭目以待就完了。