Baseten Base Labs:模型研究·· 6 小時前AI 評分46
Still:單次前向傳播中的 KV cache 攤銷式壓縮
05Still: Amortized KV Cache Compaction in a Single Forward PassPaper·JUN 2026
AI 導讀
Still 可在單次前向傳播中將語言模型的 KV cache 壓縮 200×,並保留正確回答能力。在 Qwen 和 Gemma 模型上,壓縮倍率由 8× 至 200×、上下文長度由 8k 至 128k,均處於速度與品質權衡的有利區間。在長上下文 RULER 測試中,Still 比最強基線高 8–22 分。
來源:Baseten Base Labs:模型研究 · labs.baseten.co