本地部署 GLM-5.2 要花多少钱?我认真算了一笔账

周末轻松点,聊个老本行问题——大模型本地部署

自从 Qwen3.5 开始收窄开源模型后,我都很少关注了,现在 Qwen3.8 预览版都出了,我还在玩3.6,毕竟手里只有几张4090

比英伟达会玩,本地部署 Qwen3.6 ,速度翻了 2.5 倍
英伟达出手,Qwen3.6-27B 量化版来了,褒贬不一

刚好有朋友问,今天就聊聊 GLM5.2 本地部署要花多少钱?

先说结论:

  • FP8 版本,最低大约需要一台 8 卡 H200,350 万元左右
  • BF16 版本,最低需要两台 8 卡 H200,算上网络,大约 730 万—800 万元
  • FP8 稳定支持完整 1M 上下文,使用 H200 的话,按双节点准备,大约 730 万—800 万元
  • BF16、1M 上下文再加上一定并发,预算很容易来到 1000 万元以上

GLM-5.2 虽然开源了,但真正想把原版模型私有化部署,350 万元只是入场券

PS:FP8以下精度不在本文讨论之列,比如# 英伟达出手的NVPF4,GLM 5.2 本地部署,成本骤降50%

模型尺寸

GLM-5.2 是一个 MoE 模型,总参数约 743B,每生成一个 Token 实际激活约 39B 参数,并原生支持 1,048,576 Token,也就是我们常说的 1M 上下文

很多人看到“只激活 39B”,可能会觉得它的部署成本应该和四五十亿参数模型差不多

其实不是

MoE 的优势主要是降低每次推理的计算量,但模型的全部专家参数仍然需要放进显存。你不能因为这一次只调用了其中几个专家,就把其他专家从硬盘里临时加载进来

智谱官方版本有俩

FP8 模型权重文件 756 GB

本地部署 GLM-5.2 要花多少钱?我认真算了一笔账B F16 模型权重文件1.51TB

本地部署 GLM-5.2 要花多少钱?我认真算了一笔账

本地部署时占用显存的不只是模型权重,还包括:

  • CUDA 和推理框架运行空间
  • 激活值和计算缓冲区
  • MTP 推测解码相关开销
  • KV Cache
  • 并发请求预留空间

所以,不能简单用“743B × 每参数一个字节”来决定需要多少显卡

vLLM 给出的部署预算更加直观:

模型精度
vLLM 建议的最低显存
GLM-5.2 FP8
893GB
GLM-5.2 BF16
1786GB
本地部署 GLM-5.2 要花多少钱?我认真算了一笔账

unsetunset一台 H200 服务器多少钱?unsetunset

这里按照我了解到的一个相对现实的采购口径计算:

一台完整的 8×H200 SXM 服务器,去年初还能控到300万一下,今年内存、硬盘大涨价,估计 350 万元都打不住了

以 NVIDIA DGX H200 的完整配置作为参考,大致包括:

  • 8×NVIDIA H200 SXM
  • 每张显卡 141GB HBM3e
  • 总显存 1128GB
  • GPU 显存带宽 4.8TB/s
  • 通过 NVSwitch 连接,GPU 间带宽最高 900GB/s
  • 双路 Intel Xeon 8480C
  • 2TB 系统内存
  • 2×1.92TB 系统盘
  • 8×3.84TB NVMe 数据盘
  • 8 张最高 400Gbps 的 ConnectX-7 集群网卡
  • 整机最大功耗约 10.2kW

不同国产 OEM 厂商的 CPU、内存、硬盘和网卡配置会有差异

unsetunsetFP8 单节点unsetunset

vLLM 官方也把 FP8 称为实际部署时的默认推荐方案,最低显存需求是 893GB,而一台 8 卡 H200 有 1128GB,因此可以在单节点内完整加载,这也是最便宜、最容易落地的方案

单节点最大的优势不是只省了一台机器,而是所有 GPU 都通过 NVSwitch 通信,不需要经过服务器之间的网络。部署和排障都会简单很多,推理延迟也更稳定

但这里要注意:能够加载模型,不等于能够舒服地开启完整 1M 上下文。

vLLM 示例中,单节点 H200 的保守配置通常从 128K 上下文开始。200K 甚至更高也可以继续压测,但上下文越长,KV Cache 占用越大,可支持的并发请求就越少

所以,350 万元也近视可以部署完整的 GLM-5.2 FP8,适合以 128K 左右上下文起步,无法支持高并发的 1M 上下文服务。

unsetunsetFP8 加完整 1M 上下文unsetunset

GLM-5.2 最大的升级之一,就是原生支持 1M 上下文

随着上下文从 200K 增加到 1M,推理瓶颈会逐渐从计算转向 KV Cache 容量、长上下文内核以及 CPU 侧调度

vLLM 明确写出的单节点完整 1M 配置,是 8×B200 + 使用 FP8 KV Cache

如果硬件限定为 H200,又希望比较稳妥地支持 1M 上下文,要按照两台服务器设计,这里还需要200G起步的RAMA交换机、光模块,线缆:

项目
预算
两台 8×H200 服务器
约 700 万元
高速网络及线缆
约 30 万—100 万元
合计
约 730 万—800 万元

而且这机器功耗也是离谱,要配高密机柜,还可能要PDU和供电改造,不过这都是小钱了

BF16 版不赘述了,几乎都是上面 FP8 的双倍

后面更奢侈的方案也不说了,再往上追求并发、高可用和生产级稳定性,这就不再是一台服务器采购,而是一个千万元级别的 AI 基础设施项目了

最后,大家好奇到底什么公司一定要本地部署这些大模型?

据我了解,受监管的金融行业普遍如此,银行、证券,保险,他们本身也都财力雄厚,数据也比较敏感,调用云端大模型是不可能滴

它们购买的是数据不离开自己的边界,是模型能力不依赖外部平台,是服务可以持续运行,也是未来把AI接入全部核心业务的控制权

本文由作者【老章很忙】,微信公众号:【Ai学习的老章】,原创/授权 发布于平台,未经许可,禁止转载。
行业动态

Agent 开发指南:Kimi K3 动态加载工具,降低 30% Token 消耗

2026-7-27 9:41:00

行业动态

微信更新,扫一扫新增「拍照给AI小微」

2026-7-27 11:25:47

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧