本文系基于公开资料撰写,仅作为信息交流之用,不构成任何投资建议。
7月16日晚间,月之暗面发布了Kimi K3。2.8万亿参数,开源,多模态,上下文窗口超过100万。7月27日将完整开放权重。
消息传到华尔街的时候,交易员们正在为一轮已经持续了好几天的科技股抛售寻找新的解释。K3来得正是时候。
Artificial Analysis智力指数排全球第3,Arena Frontend Code排全球第1。Terminal-Bench 2.1得分88.3,和GPT-5.6 Sol的88.8之间只隔着一层薄薄的空气。FrontierSWE得分81.2,仅次于Fable 5的86.6,把GPT-5.6 Sol的71.3甩在身后。
一家中国公司的开源模型,在编程和长程推理这两个最硬的指标上,同时够到了全球顶尖闭源系统的肩膀。
于是有人说,K3戳破了全球算力扩展的泡沫,打破了Antheropic与OpenAI的估值逻辑,并加剧了近期高位科技股的巨震。
逻辑链条很直接:如果在有限算力下,开源模型仍可取得如此突破,那此前市场给予AI基础设施天价资本开支的定价,是否建立在一种过度乐观的假设之上?如果一家中国公司能用更少的资源做出接近顶尖水平的模型,那英伟达的订单簿、Anthropic与O喷AI的高毛利叙事,是否都在同一瞬间被打上了一个问号?
总而言之一句话:都怪KIMI。
01
2.8万亿的重型基建
先看一个最容易被忽略的事实,2.8万亿参数。这个数字本身的重量,比任何BenchMark都更有说服力。
把这么多参数塞进一个模型,让它们在896个专家模块中各司其职,每次推理只唤醒其中16个。这从来不是省算力的技术路线,这是重型基建。
模型权重在4比特浮点精度下就需要超过1.5太字节的HBM显存容量,推理时要在64卡以上的超节点上才能跑起来。专家并行方案采用了极高稀疏度的WideEP架构,对scale-up域的容量和带宽要求极高。
K3之所以看起来“省”,是因为它在每一分算力上都压榨出了成倍的效能,而不是因为它不需要算力。K3不是一架只为了滑翔的纸飞机,它是一架装配了更先进引擎的重型战斗机。引擎效率越高,飞得越远,但对燃料的绝对需求只会更大,不会更小。
这是整个论证的底座,不把这件事讲清楚,后面所有推论都会飘在空中。
02
一架超级引擎
K3真正让人兴奋的地方是它的超级引擎价值。月之暗面在K3上落地了三项关键技术:KDA混合线性注意力、注意力残差和高稀疏度MoE。三项技术指向同一个目标,把算力转化为模型效果的效率推到极致。
第一,KDA混合线性注意力。
Transformer最吃算力的地方是注意力机制。标准注意力随着序列长度增加,计算量呈平方级增长。百万级上下文的任务,大部分算力都烧在了维持长序列的注意力矩阵上。KDA机制将大部分注意力层的计算复杂度从平方级降到了线性。
根据月之暗面此前发布的Kimi Linear技术报告,在48亿参数和3亿激活参数的实验模型上,采用3比1的KDA与MLA混合比例,KV缓存占用最高削减了75%,100万上下文长度下的解码吞吐量提升到了原来的6倍。
对开发者来说,这意味着同样的GPU集群,可以同时服务更多用户,处理更长的任务。
第二,注意力残差。
模型大到万亿级别之后,信息在层与层之间传递会衰减,浅层信号传到底层时已经模糊了。注意力残差允许模型在深层直接跳回浅层提取原始特征,再融合进当前推理。
这解释了为什么K3在FrontierSWE这种需要持续数十分钟的长周期软件工程任务上表现格外出色,它能在漫长的推理链条中保持方向感,不会走着走着忘了自己为什么要出发。
第三,高稀疏度MoE。
896个专家,每次只激活16个。这个极端比例意味着每个专家模块必须在自己的领域内做到极致,否则整个系统会崩。
支撑这套架构的是Stable LatentMoE,通过低维隐空间做专家路由,再用历史思维链保留训练来维持跨轮推理的稳定性。
叠加训练方法和数据配方的优化,K3相比上一代K2的整体扩展效率提升了约2.5倍。
本质上,三项技术砍的不是算力,更不是Scaling Law,而是粗糙的算法浪费。把每一分算力转化为模型能力的效率推到极致,不叫省,这叫更会花。
03
到底恐慌什么
从K2.6到K3,几个月时间,Arena Code榜单从第18名跳到第1名,部分观点研判认为,K3可能将国产模型与海外前沿的代际差距缩短到了3个月以内。一年前这个数字是12到18个月,两年前开源模型甚至不在讨论范围里。
这个加速度,才是改变定价逻辑的东西。
Anthropic的Fable 5每百万Token输入10美元,输出50美元。GPT-5.6 Sol分别是5美元和30美元。K3是3美元和15美元,缓存命中0.3美元,只有Fable 5的30分之1。
当开源模型以更低的价格提供接近的性能时,闭源的高毛利叙事就开始松动:Anthropic推理毛利率长期在75%以上,这是它高估值的核心支柱。如果开源追赶的速度继续加快,这根柱子需要重新审视。
但市场在恐慌时忽略了一件事。定价权的转移不是价值的消失,是价值从一层流向了另一层。就像当年电力从爱迪生的直流发电机里流出来,流进西屋公司的交流变压器,流进福特工厂里的独立电动机。每一次流动都没有减少电力的价值,只是改变了谁在收电费。
这一次也一样。
04
SuperApp的种子
迫近顶尖水平、抹平基础壁垒之后发生的事,不是算力过剩,反而是算力在另一个维度上爆炸。
当K3把顶尖编程和Agent能力以开源方式交给全球开发者时,它点燃的东西比任何一张BenchMark排行榜都要深远。一个编程Agent从零构建GPU编译器,一个设计师用自然语言生成完整的前端工程,一个研究员把两周的科研编程压缩进两个小时。
这些已经在K3上线后出现了。
SuperApp的种子埋在开源的土壤里。当模型不再是瓶颈,算力就会成为瓶颈。用户量每一次增长,Agent任务每一次深层调用,都会变成巨量推理需求。
还有一个被忽略的技术细节,K3在默认最高思考强度下的思维链偏长,实际Token消耗比常规模型更高。在Kimi Work Max的高强度思考模式下,任务反馈速度稍慢,推理深度却更深,Token消耗也更大。
这意味着应用越普及,Agent越复杂,单次调用的Token消耗就越惊人,推理计算的规模也将以远超训练计算的速度膨胀。
05
还在路上
当然,K3距离AGI还有很长的路。
它缓存保留只有10分钟,可能源自KDA快照缓存的架构特性。指令模糊时容易过度主动,行为边界尚不稳定。62TPS的输出速度低于同档模型中位数72TPS。
这些是工程问题,能解。但更大的问题不在技术,在场景。
K3需要部署在64卡以上的超节点才能运行,这意味着它还远远不是一款普通企业或个人能随意消费的基础设施。从实验室到大规模普及,中间还隔着成本、稳定性、生态工具链的一整套工程化鸿沟。
它证明了这条路能走通,但还没走完。这目前是对它最准确的定位。
K3是一个节点,还不是终点。规模法则再次被验证有效,更大参数、更复杂架构、更长上下文,仍然在产生更好的模型。
各家不仅不会收手,反而会因为看到对手的底牌而加速。算力侧在加速,算法侧也在加速,两个轮子同时高速转动,中间挤出来的,是一轮从基础设施到应用的繁荣。
有一个古老的哲学命题是这样的:如果一支箭在飞行途中的每一个瞬间都静止在某一个位置上,那它永远也到达不了靶心。芝诺用这个悖论证明了运动的不可理解,但现实中每一支箭都稳稳钉在靶上。
K3这支箭已经飞过了从K2.6到K3的这段航程,正在飞向下一段。它经过了每一个瞬间,但它从未静止。
都怪KIMI,这句话放在K3发布之后的语境里,最大的讽刺在于,它被当成了一句甩锅。就像老王说,都怪隔壁老张把围墙修得太高,害我也得加砖。
K3不是全球科技股暴跌的肇事者,它是下一轮AI繁荣的报信人。它打破了安卧在万亿美元估值之上的垄断叙事,却开启了一个更宏大、更公平、更具爆发力的竞争周期。
算力的下半场,应用的上半场,都开始了。