
家人们,我以后可能不会再写大模型本地部署相关的文章了

以我最喜欢的 Qwen3.6-27B 作为绝唱收官,也是天意
比英伟达会玩,本地部署 Qwen3.6 ,速度翻了 2.5 倍
刚刚,Kimi 兑现承诺了,K3 权重如约开源,2.8T 参数
这是全球最大开放权重模型,没有之一,权重文件来到惊人的 1.56 TB

先说结论:
-
K3 权重是 MXFP4 精度,实测 1.56TB(96 个 safetensors 分片),单台 8 卡 H200(1128GB 显存)连权重都装不下,单节点直接出局 -
最低两台 8×H200 起步,算上网络,约 730 万—800 万元,这只是入场券 -
官方明确建议 64 卡以上超节点部署,8 台 8×H200 的话,约 2900 万—3000 万元 -
再考虑 1M 上下文、并发和高可用,这就是一个几千万级别的 AI 基础设施项目
K3 有多强
K3 整体能力仍然落后于 Claude Fable 5 和 GPT-5.6 Sol 这两个最强闭源模型,但在开源阵营里是断档领先
Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2
Agent 能力:BrowseComp 91.2 分全场第一,JobBench、SpreadsheetBench、AutomationBench 都排在开源第一梯队

这已经是让闭源模型胆战的实力了

值得一提的是,Kimi 现在的订阅价格也追平 Claude 和 GPT 了。。。
Kimi 套餐价格分别是 49 元、99 元、199 元、699 元每月

ChatGPT 定价分别是 8 美元、20 美元、100 美元(Pro 5x)、200 美元(Pro 20x)

我都感觉 Kimi 是照着闭源旗舰模型定价直接乘汇率来的
缺点嘛,也很明显,消耗速度太快了,即便是 199 的套餐,也很难撑得住
模型尺寸
2.8 T参数的大模型,模型文件只有 1.56TB,这是因为 K3 从 SFT 阶段就开始做量化感知训练(QAT),权重原生就是 MXFP4、激活 MXFP8
MXFP4 是 4 bit 权重加块级缩放因子,折算下来每参数约 4.25 bit,也就是约 0.53 字节,估算一下:
2.8T 参数 × 0.53 字节 ≈ 1.5TB
注意,这个 1.56TB 已经是”压缩后”的状态了,别指望像 GLM-5.2 那样”换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化
前文:本地部署 GLM-5.2 要花多少钱?我认真算了一笔账

那篇文章的结论是:743B 的 GLM-5.2 原版模型私有化部署,350 万元只是入场券
那 2.8T 的 K3 本地部署要花多少钱呢?
占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留,参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:
1.56TB × 1.18 ≈ 1.84TB
好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现

坏消息是,这个显存需求,单机时代结束了
我了解到的数据,一台完整的 8×H200 SXM 服务器,今年内存硬盘大涨价,350 万元起步
看看长鑫科技这涨幅,这市值,未来内存依然是金子。。。

多机推理做张量并行和专家并行,卡数按 2 的幂次方规划最省心(16、32、64),这也是主流推理框架分片的舒适区

方案一:两台 16 卡,约 730 万—800 万元(入场券)
16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档
多机就绕不开高速网络,200G 起步的 RDMA 交换机、光模块、线缆:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
约 730 万—800 万元 |
方案二:四台 32 卡,约 1450 万—1550 万元(舒适档)
4512GB 显存,权重之外还有约 3TB 余量,长上下文和像样的并发才开始成为可能
方案三:八台 64 卡,约 2900 万—3000 万元(官方推荐姿势)
官方技术博客原话:推理效率受益于更大的高带宽通信域,建议在 64 卡以上的超节点配置上部署 K3
|
|
|
|---|---|
|
|
|
|
|
|
|
|
约 2900 万—3000 万元 |
到这个规模,机房也要跟着升级:单台整机功耗约 10.2kW,八台就是 80kW+,高密机柜、PDU、供电改造、散热全都要动,不过相比整机采购这都是小钱了
最后
前面提到长鑫科技,
刚刷了一个视频讲长鑫与合肥的故事有点感触多说两句
当年内存被三星、海力士、美光三家攥在手里,说涨价就涨价,说断供就断供,国内厂商连上牌桌的资格都没有。合肥掏出真金白银陪长鑫蹲了快十年冷板凳,从流片失败到良率爬坡,没人看好,直到今天——内存涨价周期里,长鑫成了那个别人绕不开的名字
这个剧本,正在大模型行业重演
看看现在用 Claude 的姿势有多拧巴:一边被 Anthropic 封号,一边在群里骂它霸道,骂完转头又找渠道求着续上——被人拿捏成这样,气不气?
气,但没办法,谁让人家模型确实强
长鑫的故事讲的没什么玄妙的道理,被卡脖子的行业,出路只有一条:自己造出来,而且造得足够好
GLM-5.2、Kimi K3 们正在走这条路,差距还有,但方向已经很清楚了:闭源模型的每一次封号、每一次涨价、每一次区域限制,都是在给国产开源模型送用户
内存我们熬了十年,大模型不用等那么久
到那天,封号就封吧,随便封

