🔗 https://mp.weixin.qq.com/s/y2R4VSxVaThM36FGUh_9yQ
谷歌 TurboQuant:KV Cache 压缩 6 倍,精度零损失
谷歌研究院在 ICLR 2026 上发布了 TurboQuant 算法,通过两项技术——极坐标量化(PolarQuant)和量化 JL 变换(QJL)——将大模型推理时的 KV Cache 压缩至 3-bit,内存占用缩小至少 6 倍,H100 上注意力计算加速 8 倍,且无需训练微调、精度零损失。Cloudflare CEO 称之为"谷歌的 DeepSeek 时刻"。
消息发出后美光、西部数据股价大跌,市场逻辑是:推理内存需求减少 → 利空存储厂商。
但这个逻辑大概率是错的。
经典的杰文斯悖论(Jevons Paradox)早在 1865 年就揭示过同样的规律:瓦特改良蒸汽机后煤效率大幅提升,按理说该省煤了,结果蒸汽机被更广泛应用,煤的总消耗反而暴增。效率提升 → 单位成本下降 → 需求激增 → 总消耗增加。
放到 TurboQuant 的场景:
• 同样的 GPU 内存能跑更长上下文、更大模型 → 之前做不了的场景现在能做了
• 推理成本降低 → AI 服务更便宜 → 调用量和部署规模激增
• 门槛降低 → 更多玩家入场 → 整个市场扩大
DeepSeek 就是前车之鉴——训练成本打下来后英伟达股价也跌过一波,但需求增长很快把跌幅吃回来了。
内存单价长期受半导体制程和产能驱动,本来就在持续下降,跟 TurboQuant 关系不大。但内存厂商的营收和利润取决于总出货量,而 AI 推理市场远未饱和,HBM 等高端产品利润率又远高于普通 DRAM。算法效率提升扩大的是蛋糕,不是缩小了蛋糕。
短期股价波动是市场的膝跳反射,用静态思维看了一个动态问题。
谷歌 TurboQuant:KV Cache 压缩 6 倍,精度零损失
谷歌研究院在 ICLR 2026 上发布了 TurboQuant 算法,通过两项技术——极坐标量化(PolarQuant)和量化 JL 变换(QJL)——将大模型推理时的 KV Cache 压缩至 3-bit,内存占用缩小至少 6 倍,H100 上注意力计算加速 8 倍,且无需训练微调、精度零损失。Cloudflare CEO 称之为"谷歌的 DeepSeek 时刻"。
消息发出后美光、西部数据股价大跌,市场逻辑是:推理内存需求减少 → 利空存储厂商。
但这个逻辑大概率是错的。
经典的杰文斯悖论(Jevons Paradox)早在 1865 年就揭示过同样的规律:瓦特改良蒸汽机后煤效率大幅提升,按理说该省煤了,结果蒸汽机被更广泛应用,煤的总消耗反而暴增。效率提升 → 单位成本下降 → 需求激增 → 总消耗增加。
放到 TurboQuant 的场景:
• 同样的 GPU 内存能跑更长上下文、更大模型 → 之前做不了的场景现在能做了
• 推理成本降低 → AI 服务更便宜 → 调用量和部署规模激增
• 门槛降低 → 更多玩家入场 → 整个市场扩大
DeepSeek 就是前车之鉴——训练成本打下来后英伟达股价也跌过一波,但需求增长很快把跌幅吃回来了。
内存单价长期受半导体制程和产能驱动,本来就在持续下降,跟 TurboQuant 关系不大。但内存厂商的营收和利润取决于总出货量,而 AI 推理市场远未饱和,HBM 等高端产品利润率又远高于普通 DRAM。算法效率提升扩大的是蛋糕,不是缩小了蛋糕。
短期股价波动是市场的膝跳反射,用静态思维看了一个动态问题。