2026年8月12日,由华为2012实验室、华为云、计算与终端等团队共同研发的开源智能体平台openJiuwen,联合昇腾生态推出全新技术——“算力亲和”,实现从智能体框架、推理引擎到底层硬件算力的全链路协同优化。
该技术突破了传统架构中各层级之间语义割裂的瓶颈,推动KV缓存由静态被动管理转向动态主动协同。在实际运行中,Agent推理的首Token生成时延降低超过57%,推理过程中的存储占用峰值下降25%。
当前AI智能体应用场景日趋复杂,单次任务持续时间可达数十分钟乃至数小时,多智能体协同作业也日益普遍。任务周期越长、协作节点越多,推理过程中累积的KV缓存规模就越大,整体时延也随之攀升。而传统推理引擎仅能感知请求输入与缓存存在,无法理解智能体内部的任务语义:例如子任务已结束,缓存仍滞留于高成本的NPU显存;会话处于临时挂起状态,缓存却持续占据最昂贵的存储资源。
问题本质在于,智能体掌握任务执行状态,推理引擎掌控算力资源调度,二者之间缺乏语义层面的双向通路。openJiuwen为此构建了一套轻量、可扩展的“状态契约”机制——Agent Hint。当智能体关键状态发生变化时,主动向推理引擎发送Hint信号,明确标识当前会话的生命周期阶段;引擎据此精准执行缓存操作,包括驱逐、卸载或预取。缓存不再局限于“保留在显存”或“等待淘汰”的二元选择,而是依据任务节奏,在不同存储层级间自主流动、按需调度。
实测数据显示,启用“算力亲和”技术后,模型端到端请求时延降低27.61%,前缀缓存命中率提升33%,池化缓存使用量的峰值下降25.24%。该能力将于近期面向全球开发者开源,欢迎关注openJiuwen开源社区获取最新进展。

评论
更多评论