据动察 Beating 监测,Baseten 研究团队发布 KV 缓存压缩方法 Still,通过冻结基座模型参数、仅训练轻量级 Perceiver 压缩器,在一次前向传播中即可完成 KV 缓存压缩,最高支持 200 倍压缩,无需在线优化或梯度更新。现有 KV 压缩方法大致分为两类。一类从原始 Token 中筛选重要缓存,如 SnapKV 和 H2O。另一类直接生成新的压缩缓存,但往往需要针对每个上下文进行在线优化。Still 采用摊销合成(Amortized Synthesis)思路,在 Transformer 每层加入参数规模约为基座模型 1% 的 Perceiver 压缩器,通过隐式查询对完整 KV 缓存执行交叉注意力,直接生成新的压缩 KV 缓存。在 Qwen 与 Gemma 模型测试中,Still 在 8k 至 64k 上下文、8 至 200 倍压缩率范围内保持了较高准确率。在长上下文基准 RULER 中,Still 在多数设置下超过 SnapKV、H2O 和 KV-Distill 等方法,在 matched-training 任务中领先 KV-Distill 约 8 至 22 个百分点。在 HELMET 多文档摘要测试中,压缩后的缓存仍可恢复 74% 至 95% 的全上下文性能增益。相比需要保留原始 Token 或依赖在线优化的方案,Still 将 KV 压缩转化为一次前向推理即可完成的学习过程,为超长上下文推理提供了新的缓存压缩路径。