当前所在位置: 中国教育品牌网主页 > 企业 > 正文 >

智能体时代,骁龙新一代旗舰平台的NPU如何重塑端侧AI

2026-10-01 14:59:38 来源:互联网 阅读:-
摘要

随着新一代骁龙旗舰平台发布临近,高通在AI领域的布局愈发清晰。CPU、GPU与NPU三大核心模块的升级已悉数披露,其中NPU作为端侧智能体AI的算力核心,其架构变革尤为关键。骁龙新一代旗舰平台搭载的全新Hexagon NPU,在算力、内存、模型支持等多个维度同步进化,瞄准的是一个更远的目标——让智能体AI真正在手机端持续运行。

智能体AI,对NPU提出了什么新要求?

智能体AI改变了移动端AI的任务模式。高通技术公司产品市场高级总监Cisco Cheng在署名博客中指出,智能体AI将定义移动计算的下一个时代,这些系统能够理解用户个人情境、跨应用协同运行、持续推理,并根据用户意图完成操作。这意味着移动端芯片需要解决的不只是算得快,还要解决持续算、低延迟算以及多任务协同算的问题。

针对这一趋势,骁龙新一代旗舰平台的Hexagon NPU引入了两项关键变化:Element Accelerator与更大共享内存系统。此外,该NPU在模型架构、精度策略上同样进行了系统性升级,共同构成了面向智能体时代的完整技术方案。

Element Accelerator:为Transformer工作负载定制

Element Accelerator是骁龙新一代旗舰平台NPU架构升级的核心。它针对Transformer工作负载进行了专门优化,结合向量计算单元与标量计算单元协同工作。其中,标量计算单元负责智能体的决策逻辑、路由和编排,向量计算单元提供高吞吐量AI数学计算,加速大模型推理中的关键任务。配合Fast Action Loops和KV-Cache加速,支持最长32K的上下文长度。

这套设计的深层意义在于:传统NPU的重心在“算”——把矩阵乘法做快。但智能体需要的不只是“算”,还需要“想”:在推理过程中选择路径、调用工具、编排任务。Element Accelerator让NPU同时具备了“重计算”和“轻调度”两类能力。

共享内存扩容50%:打通数据搬运瓶颈

随着模型规模增大,NPU面临的限制越来越不仅是计算性能,更在于数据搬运。智能体在生成答案时需要频繁读取用于保存对话上下文和历史计算结果的KV缓存,若片上空间不足,数据需要在NPU与设备主内存之间频繁搬移,推高时延和功耗。

骁龙新一代旗舰平台的Hexagon NPU将共享内存容量较前代增加50%,让模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,减少对外部内存的访问频次。高通表示,这一设计使智能体在处理更长上下文、调用更多工具以及执行并发任务时能保持流畅响应。

MoE与多精度策略:让大模型真正跑在手机上

Hexagon NPU面向下一代模型架构而打造。骁龙新一代旗舰平台正与领先的内存和模型厂商合作,将混合专家(MoE)模型引入终端侧。一个300亿参数的MoE模型,每次生成一个词元仅激活约30亿个被路由选中的参数。配合基于闪存的专家模块加载管理机制与缓存技术,以低功耗和低内存需求实现大模型级别的AI体验。

在精度策略上,骁龙新一代旗舰平台支持INT2、INT4、INT8、FP8和FP16五种格式,开发者可根据任务复杂度灵活平衡性能与功耗。对于基于INT4的模型,预填充性能提升最高50%,40亿参数模型首个词元生成时间低于1.5秒,解码吞吐更快,推测解码增强。

NPU角色的重新定义

把上述技术整合来看,骁龙新一代旗舰平台在NPU上的设计逻辑已经非常清晰。它面向“始终运行的AI、长上下文推理、多模态模型、并发智能体以及低时延行动闭环”而设计,不再只是一颗“算力更强”的NPU,而是为智能体运行模式重新设计的计算核心。过去的评价标准是“能跑多大的模型”,未来的评价标准是“能在功耗红线之内持续输出多少智能体验”。骁龙新一代旗舰平台的Hexagon NPU,正在为这个标准建立新的基线。

推荐阅读:

相关滚动