作者:互联网 时间: 2026-07-29 07:26:56
家人们,关于大模型本地部署的文章,可能到这里就是我最后一次写了
天意如此,绝唱便以我最喜欢的 Qwen3.6-27B 来收官
本地部署 Qwen3.6 比英伟达更会玩,速度提升了 2.5 倍
就在刚刚,Kimi 如约兑现承诺,正式开源 K3 权重,参数量为2.8T
惊人的 1.56 TB,是它的权重文件体积;论开放权重模型的规模,全球没有比它更大的
结论先说:
在两个最强闭源模型 Claude Fable 5 与 GPT-5.6 Sol 面前,K3 的整体能力还有差距;放到开源阵营中,它则处于断档领先的位置
Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2
Agent 能力:开源第一梯队包括 JobBench、SpreadsheetBench、AutomationBench 的表现,而 BrowseComp 更以 91.2 分拿下全场第一
这样的实力已经足以让闭源模型感到压力
。。。如今连订阅价格这件事,Kimi 也已经赶上 Claude 和 GPT 了,值得专门一提
每月699 元、199 元、99 元和49 元,分别对应 Kimi 的各档套餐
从高到低看,ChatGPT 各档价格为200 美元(Pro 20x)、100 美元(Pro 5x)、20 美元、8 美元
给人的感觉是,Kimi 直接参考闭源旗舰模型价格,再按汇率换算
缺点同样明显:额度消耗得太快,即使选择 199 的套餐,也很难支撑使用
K3 在 SFT 阶段便引入量化感知训练(QAT),所以权重原生采用 MXFP4、激活采用 MXFP8;也正因此,这个参数量达到2.8 T的大模型,其模型文件仅有 1.56TB
每参数约 4.25 bit,也就是约 0.53 字节:这是把块级缩放因子计入 MXFP4 的 4 bit 权重后所得的换算结果,据此可以估算:
2.8T 参数 × 0.53 字节 ≈ 1.5TB
注意,这个 1.56TB 已经是”压缩后”的状态了,别指望像 GLM-5.2 那样”换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化
前文:认真算算本地部署 GLM-5.2 需要多少钱?
那篇文章最终判断:若要私有化部署 GLM-5.2 的743B 原版模型,350 万元只能算入场券
那么,本地部署2.8T 的 K3 究竟需要多少钱?
占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留,参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:
1.56TB × 1.18 ≈ 1.84TB
好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现
坏消息在于,面对这样的显存需求,单机时代已经结束
根据我掌握的数据,今年内存和硬盘大幅涨价,一台完整的 8×H200 SXM 服务器要从350 万元起步
看看长鑫科技的涨幅和市值,未来内存依旧会像金子一样。。。
主流推理框架最适合在16、32、64这样的卡数上分片,因为它们属于 2 的幂次方;多机推理涉及张量并行与专家并行,照此规划卡数最省心
入场券方案一:约 730 万—800 万元,配置为16 卡、两台
16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档
进入多机部署后,高速网络不可避免,需要200G 起步的 RDMA 交换机、光模块与线缆:
| 项目 | 预算 |
|---|---|
| 两台 8×H200 服务器 | 约 700 万元 |
| 高速网络及线缆 | 约 30 万—100 万元 |
| 合计 | 约 730 万—800 万元 |
舒适档方案二:约 1450 万—1550 万元,配置为32 卡、四台
显存达到4512GB,除权重外还能留下约 3TB 余量,此时长上下文和可观的并发才开始具备实现条件
官方推荐姿势方案三:约 2900 万—3000 万元,配置为64 卡、八台
官方技术博客的原话指出:更大的高带宽通信域有助于提升推理效率,K3 的部署配置,建议选择 64 卡以上的超节点
| 项目 | 预算 |
|---|---|
| 八台 8×H200 服务器 | 约 2800 万元 |
| 高速网络及线缆 | 约 100 万—200 万元 |
| 合计 | 约 2900 万—3000 万元 |
达到这个规模后,机房也必须同步升级:单台整机功耗约 10.2kW,八台合计80kW+,高密机柜、PDU、供电改造和散热都要调整,不过与整机采购相比,这些费用已经不算多
前面谈到了长鑫科技,
刚才刷到一个讲述长鑫与合肥故事的视频,心里有些感触再多说两句
三星、海力士、美光三家当年控制着内存,涨价或断供都由它们说了算,国内厂商连牌桌都上不了。面对无人看好的局面,合肥依然拿出真金白银,陪长鑫熬了快十年冷板凳,经历了流片失败,也走过了良率爬坡。到了今天——恰逢内存涨价周期,任何人都已经无法绕开长鑫这个名字
同样的剧本,如今正在大模型行业再次上演
看看现在使用 Claude 有多别扭:一边遭到 Anthropic 封号,一边在群里指责它霸道,骂完之后又转身寻找渠道请求续上——被拿捏到这种程度,能不生气吗?
当然生气,可又无可奈何,毕竟对方的模型确实强
长鑫的故事并没有玄妙道理:一个被卡脖子的行业,只有一条出路,就是自己把产品造出来,并且造得足够好
GLM-5.2、Kimi K3 们正在沿着这条路前进。差距依然存在,但方向已十分清晰:闭源模型每封一次号、涨一次价、增加一次区域限制,都会把用户送给国产开源模型
内存领域我们坚持了十年,大模型不必等待那么久
等到那一天,想封号就封吧,随便封
本文由作者【老章很忙】原创/授权发布于平台,微信公众号为【Ai学习的老章】,未经许可禁止转载。