返回資訊
RSS 採集arxiv.org

HeadWiseKV:降低混合長上下文模型的KV緩存記憶體

內容摘要

HeadWiseKV是針對混合長上下文語言模型的免訓練KV緩存壓縮框架。它為每個實體KV頭分配可預測的歷史窗口,在四個模型上維持接近Full-KV的RULER及LoCoMo質量。在Qwen3.6-27B服務研究中,112K上下文下峰值裝置記憶體降低8.59%,最大驗證成功上下文由114K擴大至161K。