Kimi K3开源了,本地部署,先准备好3000万

Image

家人们,我以后可能不会再写大模型本地部署相关的文章了Kimi K3开源了,本地部署,先准备好3000万Kimi K3开源了,本地部署,先准备好3000万

以我最喜欢的 Qwen3.6-27B 作为绝唱收官,也是天意

比英伟达会玩,本地部署 Qwen3.6 ,速度翻了 2.5 倍

刚刚,Kimi 兑现承诺了,K3 权重如约开源,2.8T 参数

这是全球最大开放权重模型,没有之一,权重文件来到惊人的 1.56 TB

Kimi K3开源了,本地部署,先准备好3000万

先说结论:

  • K3 权重是 MXFP4 精度,实测 1.56TB(96 个 safetensors 分片),单台 8 卡 H200(1128GB 显存)连权重都装不下,单节点直接出局
  • 最低两台 8×H200 起步,算上网络,约 730 万—800 万元,这只是入场券
  • 官方明确建议 64 卡以上超节点部署,8 台 8×H200 的话,约 2900 万—3000 万元
  • 再考虑 1M 上下文、并发和高可用,这就是一个几千万级别的 AI 基础设施项目

K3 有多强

K3 整体能力仍然落后于 Claude Fable 5 和 GPT-5.6 Sol 这两个最强闭源模型,但在开源阵营里是断档领先

Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2

Agent 能力:BrowseComp 91.2 分全场第一,JobBench、SpreadsheetBench、AutomationBench 都排在开源第一梯队

Kimi K3开源了,本地部署,先准备好3000万

这已经是让闭源模型胆战的实力了

Kimi K3开源了,本地部署,先准备好3000万

值得一提的是,Kimi 现在的订阅价格也追平 Claude 和 GPT 了。。。

Kimi 套餐价格分别是 49 元、99 元、199 元、699 元每月

Kimi K3开源了,本地部署,先准备好3000万

ChatGPT 定价分别是 8 美元、20 美元、100 美元(Pro 5x)、200 美元(Pro 20x)

Kimi K3开源了,本地部署,先准备好3000万

我都感觉 Kimi 是照着闭源旗舰模型定价直接乘汇率来的

缺点嘛,也很明显,消耗速度太快了,即便是 199 的套餐,也很难撑得住

模型尺寸

2.8 T参数的大模型,模型文件只有 1.56TB,这是因为 K3 从 SFT 阶段就开始做量化感知训练(QAT),权重原生就是 MXFP4、激活 MXFP8

MXFP4 是 4 bit 权重加块级缩放因子,折算下来每参数约 4.25 bit,也就是约 0.53 字节,估算一下:

2.8T 参数 × 0.53 字节 ≈ 1.5TB

注意,这个 1.56TB 已经是”压缩后”的状态了,别指望像 GLM-5.2 那样”换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化

前文:本地部署 GLM-5.2 要花多少钱?我认真算了一笔账

Kimi K3开源了,本地部署,先准备好3000万

那篇文章的结论是:743B 的 GLM-5.2 原版模型私有化部署,350 万元只是入场券

那 2.8T 的 K3 本地部署要花多少钱呢?

占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留,参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:

1.56TB × 1.18 ≈ 1.84TB

好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现

Kimi K3开源了,本地部署,先准备好3000万

坏消息是,这个显存需求,单机时代结束了

我了解到的数据,一台完整的 8×H200 SXM 服务器,今年内存硬盘大涨价,350 万元起步

看看长鑫科技这涨幅,这市值,未来内存依然是金子。。。

Kimi K3开源了,本地部署,先准备好3000万

多机推理做张量并行和专家并行,卡数按 2 的幂次方规划最省心(16、32、64),这也是主流推理框架分片的舒适区

Kimi K3 本地部署三档方案对比
Kimi K3 本地部署三档方案对比

方案一:两台 16 卡,约 730 万—800 万元(入场券)

16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档

多机就绕不开高速网络,200G 起步的 RDMA 交换机、光模块、线缆:

项目
预算
两台 8×H200 服务器
约 700 万元
高速网络及线缆
约 30 万—100 万元
合计
约 730 万—800 万元

方案二:四台 32 卡,约 1450 万—1550 万元(舒适档)

4512GB 显存,权重之外还有约 3TB 余量,长上下文和像样的并发才开始成为可能

方案三:八台 64 卡,约 2900 万—3000 万元(官方推荐姿势)

官方技术博客原话:推理效率受益于更大的高带宽通信域,建议在 64 卡以上的超节点配置上部署 K3

项目
预算
八台 8×H200 服务器
约 2800 万元
高速网络及线缆
约 100 万—200 万元
合计
约 2900 万—3000 万元

到这个规模,机房也要跟着升级:单台整机功耗约 10.2kW,八台就是 80kW+,高密机柜、PDU、供电改造、散热全都要动,不过相比整机采购这都是小钱了

最后

前面提到长鑫科技,

刚刷了一个视频讲长鑫与合肥的故事有点感触多说两句

当年内存被三星、海力士、美光三家攥在手里,说涨价就涨价,说断供就断供,国内厂商连上牌桌的资格都没有。合肥掏出真金白银陪长鑫蹲了快十年冷板凳,从流片失败到良率爬坡,没人看好,直到今天——内存涨价周期里,长鑫成了那个别人绕不开的名字

这个剧本,正在大模型行业重演

看看现在用 Claude 的姿势有多拧巴:一边被 Anthropic 封号,一边在群里骂它霸道,骂完转头又找渠道求着续上——被人拿捏成这样,气不气?

气,但没办法,谁让人家模型确实强

长鑫的故事讲的没什么玄妙的道理,被卡脖子的行业,出路只有一条:自己造出来,而且造得足够好

GLM-5.2、Kimi K3 们正在走这条路,差距还有,但方向已经很清楚了:闭源模型的每一次封号、每一次涨价、每一次区域限制,都是在给国产开源模型送用户

内存我们熬了十年,大模型不用等那么久

到那天,封号就封吧,随便封

本文由作者【老章很忙】,微信公众号:【Ai学习的老章】,原创/授权 发布于平台,未经许可,禁止转载。

行业动态

别再追着AI跑了:把它放进这3个每天必经的工作场景,效率至少提升80%

2026-7-28 11:13:00

行业动态

Opus 5上线后跑分爆了,Claude Code该减负了

2026-7-28 11:35:00

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧