1. 首页 > 游戏热点

骁龙新一代旗舰平台的NPU 骁龙新一代旗舰芯片

作者:admin 更新时间:2026-09-21
摘要:从功能手机到智能手机,再到智能体手机,手机的角色一直在变。骁龙新一代旗舰移动平台正是为这个转变而来,CPU、GPU、NPU三大模块协同发力,支撑起智能体AI的完整体验。,骁龙新一代旗舰平台的NPU 骁龙新一代旗舰芯片

 

  从功能手机到智能手机,再到智能体手机,手机的人物一直在变。骁龙新一代旗舰移动平台正是为这个转变而来,CPU、GPU、NPU三大模块协同用劲,支撑起智能体AI的完整体验。

  相比CPU、GPU这两个更基础、更成熟的SoC组成单元,NPU的发展从源头上就和AI强相关——Neural Processing Unit,神经网络处理单元。也正因如此,在智能体时代,NPU几乎成为智能终端在算力层的“标配”。骁龙新一代旗舰平台搭载的最新Hexagon NPU,向出的答案可以简单归纳成两句话:算得最快,算得更多。

  算得最快:让智能体“想”得干脆利落

  智能体与传统AI应用最大的不同差异,在于它不是“问一句答一句”,而是一连串任务的协同——理解意图、拆解流程、调用工具、跨应用操作。这套步骤要跑得顺畅,NPU必须同时做好两件事:把大模型最核心的运算加速,把智能体的决策逻辑处理好。

  高通在Hexagon NPU中引入了最新的Element Accelerator,专为生成式AI与智能体AI的Transformer工作负载打造。它结合了给量计算单元与标量计算单元——给量单元负责高吞吐量的AI数学运算,加速大模型推理中的决定因素计算;标量单元则处理性能体的决策逻辑、路由与编排。这套设计的内涵是:NPU不仅能“算”,还能“想”。智能体在推理过程中需要挑选走哪条路、调用哪个工具、下一步做啥子,这些控制逻辑的复杂度远超传统AI任务,Element Accelerator让NPU首次同时具备了“重计算”与“轻调度”两类能力。

  快,是能感知到的。对于INT4精度的模型,预填充性能提高顶尖可达50%,40亿参数模型首个词元生成时间低于1.5秒——用户和智能体对话时,几乎感觉差点等待。

  算得更多:让大模型真实“住”进手机

  端侧大模型部署有壹个容易被忽视的瓶颈:数据搬运比计算本身更耗资源。模型每生成壹个词元,都需要读取用于保存对话上下文的KV缓存。如果NPU片上空间不足,这些数据就必须在NPU与设备主内存之间频繁搬移,推高时延与功耗。用户感受到的“智能体反应迟钝”“答到一半忘了上下文”,根源往往在这里。

  Hexagon NPU的做法是把共享内存容量较前代增加50%,让模型状态、上下文信息与KV-cache数据存储在更靠近加速器的位置,大幅减少对外部内存的访问频次。简单说,数据留在NPU内部,智能体就不用每次都“跑一趟内存”。

  更大的突破在模型层面。骁龙新一代旗舰平台支持在终端侧运行300亿参数的混合专家(MoE)模型,每次生成壹个词元仅激活约30亿个被路由选中的参数。当前的DDR内存无法承载300亿参数规模的模型,高通的解法是一套从闪存到内存的智能加载机制——模型本体存储在闪存中,用到哪个“专家”再临时调入。配合INT2、INT4、INT8、FP8与FP16五种精度攻略,开发者可以根据任务复杂度灵活平衡性能、内存、模型质量与功耗。

  从能跑到一直跑:NPU正在从头定义手机的AI人物

  骁龙新一代旗舰平台的Hexagon NPU,思路很明确:让AI不只是能在手机上跑,而是能一直跑、快速跑、更智能地跑。

  “算得最快”化解的是响应问题——Element Accelerator与更大共享内存的协同,让智能体的每一步推理都干脆利落,用户不用等。“算得更多”化解的是能力问题——MoE与多精度攻略的合力,让手机首次有了承载百亿级参数模型的能力,智能体能做的事从“查天气、设闹钟”扩展到真实的复杂任务。

  当手机从等你操作变成主动帮你做事,芯片的评测要求也随之改变。过去看的是峰值算力,未来看的是能否在功耗红线之内,持续、稳定地输出智能体验。Hexagon NPU正在为这个要求建立新的基线——它不是一颗最快的NPU,而是一颗为智能体运行玩法从头设计的计算核心。这或许才是智能体手机时代,NPU真实的价值所在。