一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

Cloudflare 优化 Kimi 与 GLM 推理:通过 FP8 量化实现更小、更快、更安全的边缘 AI

时间:2026-08-04 14:57:57 编辑:袖梨 来源:一聚教程网

Cloudflare 宣布在其 Workers AI 平台上针对 Moonshot 的 Kimi K 系列和 Z.ai 的 GLM 模型进行了深度优化。通过引入 KV 缓存量化(从 BF16 转为 FP8)、模型权重压缩以及缓存保护技术,Cloudflare 在保持模型准确性的同时,成功将 Kimi K2.6 的上下文处理能力提升了一倍,达到约 137 万个 token。这些优化基于 SGLang 开源框架,旨在降低大规模推理成本并提升边缘计算效率。

核心要点

  1. 长上下文模型优化:针对 Moonshot 的 Kimi K 系列和 Z.ai 的 GLM 等高性能 MoE(混合专家)模型进行了针对性优化。
  2. KV 缓存量化:将 KV 缓存从 16 位精度(BF16)降低至 8 位浮点数(FP8),使内存占用减半,上下文容量翻倍。
  3. SGLang 框架集成:采用 SGLang 开源推理框架,并与开发团队合作将优化功能回馈至开源社区。
  4. 性能与成本平衡:在不牺牲模型准确性的前提下,通过权重压缩和缓存保护技术,实现了在共享硬件上支持更多客户并降低成本。

详细分析

KV 缓存量化:突破长上下文的内存瓶颈

在处理长文本生成时,模型需要存储已处理 token 的注意力键(K)和值(V),即 KV 缓存。对于长上下文模型,KV 缓存往往比模型权重更早填满 GPU 内存。Cloudflare 通过将 KV 缓存的存储精度从默认的 16 位(BF16)转变为 8 位(FP8, e4m3),成功将其体积缩小了一半。以 Kimi K2.6 模型为例,这一优化使内存中可容纳的上下文长度从约 68.6 万个 token 提升至约 137 万个 token,显著增强了处理超长对话的能力。

软硬件协同:SGLang 框架的高效应用

Cloudflare 在生产环境和基准测试中全面采用了 SGLang 开源推理服务框架。研究发现,SGLang 在当前市场上提供了卓越的性能表现。Cloudflare 不仅利用该框架分离了推理的预填充(Prefill)和解码(Decode)阶段以优化 GPU 利用率,还与 SGLang 团队紧密合作,将新功能和补丁上游至开源社区。这种深度集成确保了 Kimi 和 GLM 等复杂模型能在 Cloudflare 遍布全球的数据中心高效运行。

多租户环境下的安全性与效率优化

为了在共享硬件上实现更大规模的推理,Cloudflare 叠加了模型权重压缩和缓存保护技术。权重压缩进一步减少了内存占用,而缓存保护机制则确保了在多请求并发的共享环境下,各个请求的缓存数据能够安全、高效地共存。这些技术组合使得 Cloudflare 能够以更低的成本提供高性能 AI 推理服务,同时确保了多租户环境下的系统稳定性。

行业影响

Cloudflare 的这一系列优化标志着边缘 AI 推理进入了更高效率的阶段。通过在靠近用户的边缘节点运行 Kimi 和 GLM 等顶级模型,并利用量化技术突破内存限制,开发者能够以更低的延迟和成本构建长上下文 AI 应用。此外,Cloudflare 对 SGLang 社区的贡献也推动了开源推理框架的标准提升,为整个 AI 行业在模型部署和成本控制方面提供了可借鉴的范本。

常见问题

问题 1:KV 缓存量化到 FP8 会影响模型的生成质量吗?

根据 Cloudflare 的测试,将 KV 缓存从 BF16 量化为 FP8 可以在不改变模型准确性的前提下,实现内存占用的减半。这意味着用户在享受更长上下文支持的同时,不会感知到模型智能程度的下降。

问题 2:为什么 Kimi 和 GLM 模型特别难以高效运行?

这两款模型均属于大规模、长上下文的混合专家模型(MoE),对内存的需求极高。特别是在处理长文本时,KV 缓存的增长速度极快,极易触及 GPU 的内存瓶颈,因此需要通过量化和压缩等高级技术进行优化。

问题 3:SGLang 在这次优化中起到了什么作用?

SGLang 是一个开源的推理服务框架,Cloudflare 认为其性能处于市场领先地位。它帮助 Cloudflare 实现了推理阶段的分离优化,并作为核心引擎支撑了 Kimi 和 GLM 在边缘 GPU 上的大规模运行。

热门栏目