正文内容 评论(0

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%
2026-08-12 20:02:34  出处:快科技 作者:红茶 编辑:红茶     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技8月12日消息,由华为2012实验室、华为云、计算、终端等团队联合打造的开源智能体平台openJiuwen,近日联合昇腾推出了一项名为“算力亲和”的全链路协同技术。

该技术打通了Agent框架、推理引擎与底层算力之间的协同壁垒,通过让KV Cache(键值缓存)从被动管理走向主动协同,使Agent推理的首Token时延降低57%以上,推理存储占用峰值下降25%。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

随着AI Agent应用日益复杂,单个任务可能持续数十分钟甚至数小时,多个Agent还需分工协作。任务越长、协作的Agent越多,推理过程中产生的KV Cache就越庞大,推理时延也越久。

然而,传统推理引擎只能看到请求和缓存,却看不懂Agent正在做什么。如果子任务已经结束,缓存可能还停留在昂贵的NPU显存里;如果会话暂时挂起时,缓存却继续占着最贵的资源位置。

这背后的核心问题是:Agent掌握任务状态,引擎掌握算力资源,两者之间缺一条传递语义的通道。openJiuwen的解法是在Agent与推理引擎之间建立一套“状态契约”,即Agent Hint。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

Agent在关键状态变化时发出Hint信号,告诉引擎当前会话的生命周期状态;引擎据此执行对应的缓存动作:驱逐、卸载、预取。缓存不再只有“留在显存”或“排队等淘汰”两种命运,而是随任务节奏在存储层级间主动流动。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

测试结果显示,开启算力亲和后,模型请求端到端时延降低27.61%,前缀缓存命中率提升33%,池化缓存使用量峰值降低25.24%。

当前这套能力即将开源,感兴趣的开发者可以关注openJiuwen开源社区。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

【本文结束】如需转载请务必注明出处:快科技

责任编辑:红茶

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...