RSS 採集arxiv.org
HeadWiseKV:降低混合長上下文模型的KV緩存記憶體
內容摘要
HeadWiseKV是針對混合長上下文語言模型的免訓練KV緩存壓縮框架。它為每個實體KV頭分配可預測的歷史窗口,在四個模型上維持接近Full-KV的RULER及LoCoMo質量。在Qwen3.6-27B服務研究中,112K上下文下峰值裝置記憶體降低8.59%,最大驗證成功上下文由114K擴大至161K。
HeadWiseKV是針對混合長上下文語言模型的免訓練KV緩存壓縮框架。它為每個實體KV頭分配可預測的歷史窗口,在四個模型上維持接近Full-KV的RULER及LoCoMo質量。在Qwen3.6-27B服務研究中,112K上下文下峰值裝置記憶體降低8.59%,最大驗證成功上下文由114K擴大至161K。
經您同意後,我們會使用 Google Analytics 了解頁面瀏覽及關鍵流程是否成功。我們不會傳送 Prompt、檔案、帳戶識別資料、模型識別資料、餘額、費用或原始錯誤。 私隱政策