最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
Kimi K3开源了,本地部署,至少准备好3000万
时间:2026-07-29 10:15:50 编辑:袖梨 来源:一聚教程网

家人们,今后我也许不会继续写大模型本地部署方面的文章了

收官绝唱选用我最喜欢的 Qwen3.6-27B,看来也是天意
本地部署 Qwen3.6 比英伟达更会玩,速度提升了 2.5 倍
就在刚刚,Kimi 如约履行承诺,正式开源了 K3 的 2.8T 参数权重
权重文件竟有 1.56 TB,而它正是全球开放权重模型中规模最大的一个,没有之一

结论先说:
- K3 权重是 MXFP4 精度,实测 1.56TB(96 个 safetensors 分片),单台 8 卡 H200(1128GB 显存)连权重都装不下,单节点直接出局
- 最低配置要从两台 8×H200 开始,再把网络算进去,大约需要 730 万—800 万元,而这仅仅是入场券
- 官方明确推荐使用 64 卡以上的超节点部署;若采用 8 台 8×H200,成本约为 2900 万—3000 万元
- 如果还要考虑 1M 上下文、并发与高可用,整体就会成为一个投入达到几千万级别的 AI 基础设施项目
K3 到底有多强
放在开源阵营中,K3的领先优势已经形成断档;不过与最强的两个闭源模型 Claude Fable 5 和 GPT-5.6 Sol 相比,其整体能力仍有差距
Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2
Agent 能力:开源第一梯队包括JobBench、SpreadsheetBench、AutomationBench;BrowseComp则以 91.2 分拿下全场第一

这样的实力,已经足以让闭源模型感到压力

还有个变化:Claude 和 GPT 的订阅价格,如今已经被 Kimi 追平了。。。
从低到高看,Kimi 每月套餐有 49 元、99 元、199 元、699 元四档

从 Pro 20x 到 Pro 5x,再到其余档位,ChatGPT 的价格是 200 美元、100 美元、20 美元、8 美元

我甚至觉得,Kimi 是直接参照闭源旗舰模型的价格,再乘上汇率来定价
缺点也相当明显:消耗速度过快,即使购买 199 的套餐,也很难支撑得住
模型尺寸
K3 的模型文件之所以能在 2.8 T参数下压到 1.56TB,源于其量化感知训练(QAT)从 SFT 阶段便已介入:激活采用 MXFP8,权重原生采用 MXFP4
按每参数计算,块级缩放因子与 4 bit 权重组成的 MXFP4 约占 4.25 bit,换成字节约为 0.53,估算如下:
2.8T 参数 × 0.53 字节 ≈ 1.5TB
注意,这个 1.56TB 已经是”压缩后”的状态了,别指望像 GLM-5.2 那样”换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化
前文:认真算算本地部署 GLM-5.2 需要花多少钱

关于 743B 的 GLM-5.2 原版模型,那篇文章给出的结论指向其私有化部署,350 万元也只是入场券
那么,本地部署 2.8T 的 K3 究竟要花多少钱?
占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留,参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:
1.56TB × 1.18 ≈ 1.84TB
好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现

坏消息在于,面对这样的显存需求,单机时代已经结束
根据我了解到的数据,今年内存和硬盘价格大涨,一台完整的 8×H200 SXM 服务器要从 350 万元起步
再看看长鑫科技的涨幅与市值,未来的内存依旧像金子一样。。。

卡数规划成 2 的幂次方(16、32、64),能让张量并行和专家并行的多机推理更省心,同时也落在主流推理框架便于分片的舒适区

约 730 万—800 万元的入场券方案一:两台机器,共 16 卡
16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档
进入多机部署后,高速网络不可或缺,包括 200G 起步的 RDMA 交换机、光模块与线缆:
| 项目 | 预算 |
|---|---|
| 两台 8×H200 服务器 | 约 700 万元 |
| 高速网络及线缆 | 约 30 万—100 万元 |
| 合计 | 约 730 万—800 万元 |
约 1450 万—1550 万元的舒适档方案二:四台机器,共 32 卡
显存总量为 4512GB,除去权重后还剩约 3TB,至此,长上下文与像样的并发才有可能实现
约 2900 万—3000 万元的官方推荐姿势方案三:八台机器,共 64 卡
官方技术博客的原意是:更大的高带宽通信域有助于提升推理效率,部署 K3 时,超节点配置最好达到 64 卡以上
| 项目 | 预算 |
|---|---|
| 八台 8×H200 服务器 | 约 2800 万元 |
| 高速网络及线缆 | 约 100 万—200 万元 |
| 合计 | 约 2900 万—3000 万元 |
规模达到这一步,机房也必须同步升级:单台整机功耗约为 10.2kW,八台合计达到 80kW+,高密机柜、PDU、供电改造与散热都要调整,不过与整机采购相比,这些已经算小钱
最后
前文说到了长鑫科技,
刚刚刷到一个讲述长鑫与合肥故事的视频,心里颇有感触再多说两句
当年,内存掌握在三星、海力士和美光三家手中,它们想涨价就涨价,想断供就断供,国内厂商甚至没有上牌桌的资格。合肥拿出真金白银,陪着长鑫坐了近十年的冷板凳;从流片失败到良率逐步提升,一路无人看好。直到今天——在内存涨价周期中,长鑫已经成为别人无法绕开的名字
同样的剧本,如今正在大模型行业再次上演
被 Anthropic 封号后在群里痛骂霸道,回过头却又四处找渠道、求着把 Claude 续上——现在的使用姿势就是这么拧巴。让人拿捏到这个程度,怎么可能不气?
当然生气,却也没有办法,毕竟对方的模型确实很强
一个行业遭遇卡脖子后,长鑫的故事给出的出路并不玄妙:只有自己把东西造出来,还得造到足够好
GLM-5.2、Kimi K3 们正沿着这条路前进。虽然差距仍然存在,但方向已经十分明确:闭源模型每封一次号、每涨一次价、每增加一次区域限制,都会为国产开源模型送来更多用户
内存领域我们坚持了十年,大模型不必再等那么久
等到那一天,想封号就封吧,随便封
本文由作者【老章很忙】原创/授权发布于平台,微信公众号为【Ai学习的老章】,未经许可,禁止转载。相关文章
- 提升工作效率与选择适用pdf实时翻译解决方案 07-29
- 改善PDF文件翻译效果与选择适用软件的关键策略 07-29
- 最佳免费翻译PDF的网站选择与在线文档工具使用方法 07-29
- 提高工作效率的5个技巧:pdf翻译在线免费与在线翻译工具 07-29
- pdf具备翻译功能吗?三大实用技巧帮助企业跨越语言障碍 07-29
- 失控进化地铁模式怎么玩 07-29