Kimi 和 GLM 是当前最强的大模型系列之一,但它们有一个共同的问题:太吃显存了。月之暗面的 Kimi K 系列和智谱的 GLM 都是长上下文、MoE 架构的大模型,好用到让人上瘾,但 GPU 显存永远不够用。 Cloudflare 的 Workers AI 团队一直在跑这些模型的推理。他们在官方博客上发了一篇技术文章,详细拆解了三种让大模型在 GP...
Technology
Cloudflare 分享推理优化实践:KV cache 量化 + 权重压缩,吞吐量提升 41%,成本降 30%
Kimi 和 GLM 是当前最强的大模型系列之一,但它们有一个共同的问题:太吃显存了。月之暗面的 Kimi K 系列和智谱的 GLM 都是长上下文、MoE 架构的大模型,好用到让人上瘾,但 GPU 显存永远不够用。 Cloudflare 的 Workers AI 团队一直在跑这些模型的推理。他们在官方博客上发了一篇技术文章,详细拆解了三种让大模型在 GP...
🤖 AI
AI Summary & AI Analysis
