中关村在线

热点资讯

高通发布Hexagon NPU:第六代骁龙AI引擎赋能端侧300亿参数MoE智能体

高通于2026年9月11日在其官方网站发布信息,正式推出全新一代神经网络处理单元——Hexagon NPU。该单元专为支撑下一代AI智能体而设计,旨在推动人工智能能力在终端设备上的深度落地。

作为第六代骁龙8至尊版系列的核心升级之一,Hexagon NPU集成两项关键增强:全新构建的Element Accelerator加速器,以及显著扩容的共享内存系统。

Element Accelerator面向当前主流的生成式AI与智能体AI任务,特别针对Transformer类模型的核心计算需求进行优化。它融合向量计算与标量计算能力,可高效执行大语言模型中最耗时的关键运算,从而提升智能体的响应速度与推理效率,在严控移动端功耗的前提下,带来更丰富、更自然的交互体验。

与此同时,Hexagon NPU大幅扩充了片上共享内存容量。通过将多模型状态、对话上下文及KV缓存等关键数据就近部署于计算单元附近,有效缓解传统架构中的内存带宽瓶颈。这使得智能体在处理超长上下文、调用多种工具、并行执行多项任务时,依然保持稳定、低延迟的运行表现。

上述技术共同确立了Hexagon NPU的新定位:让更复杂、更自主的AI智能体能力直接在终端侧高效运行。Element Accelerator、增强型向量与标量计算单元,以及更大容量的共享内存,构成一套高度协同的硬件架构,不仅全面加速Transformer工作负载,还能从容应对智能体所需的复杂控制逻辑,并最大限度减少数据搬运开销,使更多上下文信息得以驻留在靠近计算核心的位置。

值得注意的是,Hexagon NPU的设计亦前瞻性地兼容未来模型演进方向。高通正携手主流内存与模型厂商,推动混合专家模型(Mixture-of-Experts,MoE)在终端侧的规模化应用,构建新一代端侧AI基础设施。

以一个参数量达300亿的MoE模型为例,在实际运行中,每次生成单个词元仅需激活约30亿个经路由机制选定的专家参数。相较传统密集模型需频繁调用大部分网络权重,MoE根据输入内容动态调度专属专家子网络,显著降低实时计算负担与内存带宽压力。

配合智能的专家模块按需加载机制及多层次缓存策略,该方案可在极低功耗与有限内存资源约束下,实现接近云端大模型水平的AI能力。由此,智能手机得以提供反应迅捷、全程离线、隐私安全的生成式AI体验。

混合专家模型通过选择性启用适配当前任务的专家单元,在保障输出质量的同时,避免对全量参数的重复调用,从而在效率与性能之间取得更优平衡。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具