正文内容 评论(0)
以存代算,近期最风靡的词汇之一。它的核心,就是KV Cache(键值缓存)。如果把大模型每次推理比作答题,KV Cache就像它的“即时记忆草稿本”。遇到多轮对话,模型直接翻看存好的草稿即可继续推演,既省下了算力,又缩短了答题时间。
但随着Agentic AI与长上下文模型的爆发,问题来了:智能体需要频繁回放百万级token的对话历史,这个“草稿本”越来越厚,转眼就占满了昂贵稀缺的GPU显存。显存放不下怎么办?系统只能把暂时用不到的记忆清出去。等智能体或用户再次提问时,模型又不得不把历史KV Cache从头再算一遍,如此往复的驱逐与重算导致了TTFT(首token时延)一路飙升,用户体验受到严重影响。
从有损到无损,至强处理器为KV Cache卸载与压缩提供更优方案
行业早已达成共识,既然GPU显存太贵、装不下,不如把KV Cache“搬”出去,存到成本更低的DDR内存、SSD甚至远端存储里。然而,巨量数据的传输往往会带来额外的性能开销,且对数据的精度造成影响。
针对这个难题,英特尔推出KV Shrink分层卸载与硬件压缩加速方案,并与道客(DaoCloud)在联合实验室完成验证与落地。
KV Shrink的核心思路是“以存代算、分层卸载、硬件压缩”。
![[MD:Title]](http://img1.mydrivers.com/img/20260904/b364b876-5848-42c0-a6a8-2cb5255ceaf4.jpg)
基于不同存储介质的 KV Cache 多层卸载机制(L1–L4)
系统将KV Cache按访问热度分层流动:用于实时对话的极热数据常驻成本最高的L1层(GPU HBM显存),保障低延迟响应;用于多轮对话的热数据卸载至L2层(DDR内存),通过大容量缓存池扩容降本;用于历史对话的温冷数据下沉至L3/L4层(本地SSD或远端分布式存储),实现持久化复用。KV Shrink为多层卸载方案提供了完备的调度机制,已计算的KV Cache可被后续请求直接调用,从而避免重复计算带来的算力浪费。
![[MD:Title]](http://img1.mydrivers.com/img/20260904/8dc3dea2-5ce6-432f-9370-2a7732654663.png)
基于英特尔 KV Shrink 的 KV Cache 卸载
CPU是驱动KV Shrink机制运转的核心,承担着KV Cache压缩、调度、分层存储与生命周期管理的重要职责。至强处理器作为KV Cache管理与调度的核心,其内置的英特尔® QAT(QuickAssist Technology,数据保护与压缩加速技术)是KV Shrink运转的重要基础。
QAT不仅在金字塔式多层卸载与灵活调度方面解决问题,还从以下几个层面减少了KV Cache的存储压力:一方面,客户可以通过KV Shrink提供的冷热调度API实现KV Cache卸载,另一方面,英特尔重新编排了KV Cache的数据存储格式,使其对压缩算法更为友好,可将压缩率从原本的10%+提升至20%+。
实测数据验证了英特尔KV Shrink方案的价值。1在80%缓存命中率的典型业务场景下,该方案相比原生vLLM基线实现TTFT最高约5倍的性能提升,用户交互体验改善显著。在压缩效率上,通过数据格式重排与QAT硬件加速的协同优化,KV Cache平均压缩率从原来的10%+提升至20%~30%,500TB规模下可节省约150TB存储空间;而QAT硬件压缩吞吐约为纯CPU软件方案的2倍,额外性能损耗控制在10%以内。在联合实验室的CodingAgent实测中,方案单路TTFT仅114.13毫秒,性能优于同类方案。
![[MD:Title]](http://img1.mydrivers.com/img/20260904/a92db208-f0ec-4d4e-8a39-e332a7b11332.jpg)
英特尔KV Shrink方案与原生vLLM基线组TTFT性能对比
![[MD:Title]](http://img1.mydrivers.com/img/20260904/8d365e4f-2bfe-4ac9-89d2-3bb53b6d7dc7.jpg)
英特尔KV Shrink方案与纯CPU软件方案压缩/解压缩性能对比
![[MD:Title]](http://img1.mydrivers.com/img/20260904/759599de-56f7-4ff5-9c5a-a2067d3e1dfc.jpg)
英特尔KV Shrink方案与不使用压缩/解压缩方案的性能对比
至强处理器和内置QAT的结合所带来的成果是显著的,它们大幅提升了长上下文推理的吞吐与效率,为AI推理需求交出了一份行之有效的答卷。
夯实硬件底座,至强处理器重新定义AI推理时代的CPU价值
除了QAT以外,至强处理器还集成了英特尔® DSA(Data Streaming Accelerator)数据流加速器,这是一个高性能数据拷贝与转换加速器,可从CPU分载数据移动任务,支持内存拷贝、数据填充等多种数据操作。DSA专为优化流式数据移动与转换操作而设计,可显著提升数据搬运的IOPS性能。
两大硬件加速器协同工作,让CPU高效承担起KV Cache的跨层数据流动、压缩和调度优化,将宝贵的GPU算力从繁琐的缓存管理中解放出来,专心做Token生成。
从存储压缩到性能提升,从单点测试到场景验证,英特尔以QAT无损压缩和系统级创新为KV Cache管理构建了兼顾精度、性能与成本的完整解题路径,这正是至强在AI推理时代不可替代的价值所在。
本文收录在
#快讯
- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...
