设备端手机智能体可能需要理解请求、保留情境、选择工具、等待应用响应、检查结果,再决定下一步。这个循环会反复移动模型数据、执行 transformer 运算,并在严格的内存、电池和散热限制下协调软件。
因此,设备端 Agentic AI 是系统设计问题,而不是 TOPS 数字竞赛。Qualcomm 的新一代 Hexagon NPU 是一个有用的案例,因为其公布的改进覆盖 transformer 计算、共享内存、稀疏模型路由、数值精度和 CPU 协作。但这些特性本身不能证明未来的手机或智能体体验一定出色。
如需了解产品层面的定义,请阅读什么是 AI 智能体手机,以及这一称谓并不承诺什么。如需比较设备,请参阅2026 年全球 AI 手机盘点。
简要结论:智能体需要均衡的处理链
本地智能体需要用内存存放模型和工作数据,需要足够带宽向处理器供给数据,还需要高效的 transformer 计算、CPU 控制、快速存储,以及把模型连接到获准应用操作的软件。散热和电源管理决定了这类负载能够持续运行多久。
| 硬件或软件层 | 主要作用 | 需要核实的内容 |
|---|---|---|
| NPU | 高效加速重复的神经网络和 transformer 运算 | 支持的模型、精度及实测延迟,而不只是 TOPS |
| 芯片内共享内存 | 让频繁复用的工作数据靠近计算单元 | 绝对容量、带宽和比较基准 |
| 系统 RAM 与存储 | 保存模型权重、情境缓存及未常驻 NPU 的专家模块 | 操作系统运行后的可用内存、存储速度和模型占用 |
| CPU | 调度步骤、分配任务、处理应用逻辑并准备数据 | 混合负载下的端到端任务延迟和效率 |
| 操作系统、运行时和应用 | 提供模型、工具、权限、确认流程和回退方案 | 量产设备上实际可用的操作 |
| 散热与电池系统 | 支持持续推理,而不只是短时演示 | 长时间运行时的性能、发热和能耗 |
1. Transformer 加速可减少高成本的重复运算
大多数语言和多模态模型都使用 transformer。推理过程中,模型在处理输入和生成 token 时,会反复执行矩阵乘法、归一化和逐元素函数。CPU 也能完成这些运算,但专用加速器可以凭借更高的并行度和能效来处理常见计算模式。
Qualcomm 表示,新款 Hexagon 设计增加了面向 transformer 工作负载的 Element Accelerator。它与 NPU 的标量、向量和矩阵扩展协同工作,而不是取代这些单元。可以把 NPU 想象成一间车间:矩阵单元负责大批规则运算,其他单元处理形态与控制要求不同的操作。增加专用工位,有望减少交接,避免让不适合的机器低效工作。
这是 Qualcomm 对架构的说明,并非独立基准测试。它无法证明特定模型的任务耗时、能耗或量产手机上的持续性能。
2. 共享内存很重要,因为移动数据本身也要付出成本
NPU 无法计算自己不能访问的数据。模型权重是训练得到的数值,而激活值是输入通过网络时产生的临时输出。中间张量和模型状态也必须保留到后续操作完成。语言模型还可能维护用于表示此前 token 的情境缓存。所有这些数据都在争夺有限的内存空间。
Qualcomm 表示,新一代 Hexagon NPU 的共享内存子系统扩大了 50%。目标是在芯片内保留更多模型状态、激活值和中间张量,减少访问外部 DDR 内存。可以类比为厨师获得了更大的操作台:反复使用的食材可以留在手边,无需每一步都去储藏室取用。操作台不会让储藏室变大,但能减少等待和搬运消耗的能量。
这个百分比需要结合背景理解。Qualcomm 的文章没有公布该共享内存的绝对容量;扩大 50% 也不代表整部手机的 RAM 增加 50%,更不意味着一个完整的大模型会全部常驻这块 NPU 内存。购买者和开发者仍需考察总 RAM、可用 RAM、内存带宽、存储表现和具体工作负载的测试结果。
3. Mixture-of-Experts 改变了模型每次实际运行的规模
稠密模型在每一步推理中都会使用较大范围的参数。Mixture-of-Experts (MoE) 模型则包含多个专用专家模块,并把每个 token 路由到其中一部分。Qualcomm 举例称,一个 300 亿参数的 MoE 可以保留数百亿可用参数,但每次在 NPU 上生成 token 时,只激活约 30 亿个经过路由选择的参数。
可以把它想象成一家拥有 30 个科室的医院,但一次会诊只让相关专科医生参与。医院的全部专业能力仍需占用场地和接受管理,只是单个病例仅调用其中一部分。同样,“约 3B 激活参数”可以减少每个 token 的计算量和带宽需求,但模型其余部分仍需存放在某处,通常分布于存储和内存中;专家路由或加载也有额外开销。
Qualcomm 将从闪存到内存的专家模块管理与缓存描述为该方案的一部分。这可能让更大级别的模型适合在手机上运行,但不应把 30B MoE 描述为每个 token 都运行一个 30B 稠密模型。这个示例也不能证明量产手机上的模型质量、token 速率、RAM 要求或电池续航。
4. 精度需要在质量、内存和速度之间取舍
精度指推理时用多少 bit 表示模型数值。较低 bit 格式通常可以减小权重体积、内存流量和计算成本,但激进量化可能损害准确性,除非模型和运行时能妥善处理。不存在普遍适用的最佳格式。
Qualcomm 列出的支持范围包括 INT2、INT4、INT8、FP8 和 FP16。开发者可以把更紧凑的格式分配给对精度不敏感的工作负载部分,并在质量要求较高的位置保留更高精度。这更像为不同素材选择合适的图像格式,而不是打开一个全局“快速模式”开关。
该公司还声称,INT4 模型的 prefill 性能最高可提高 50%。Prefill 是模型在生成回答前处理提示和既有情境的阶段;decode 则是随后逐 token 生成内容的阶段。更快的 prefill 可以缩短输出开始前的等待,尤其是在输入较长时。但这不代表整个智能体任务必然快 50%。这一数据由供应商公布,使用了“最高”这一限定,文章也未提供所用模型、提示长度、功耗水平或对比平台。Decode 速度、工具延迟和应用间交接仍可能占据主要时间。
5. CPU 指挥智能体的操作循环
NPU 是负责模型推理的专用单元,而不是操作系统的替代品。智能体仍需要控制流程:决定调用哪个模型或工具、准备输入、调度工作、跟踪任务状态、处理不受支持的操作,并在应用与处理器之间传递结果。
Qualcomm 将 CPU 描述为互补角色:编排多步骤工作负载,并提前为 NPU 准备数据。可以把它类比为一支乐团:打击乐声部演奏得更快,并不能决定整个乐团下一段演奏什么。端到端响应速度既取决于最快的声部,也取决于指挥、乐谱和交接。
因此,芯片能力不等于产品能力。手机制造商必须整合运行时、操作系统服务、应用接口和权限。开发者必须针对受支持的后端进行优化和测试。CPU 回退或缺少应用接口,都可能抵消理论上的 NPU 优势。
更强的 AI 硬件不能证明什么
- 可靠性:更快的推理不能证明模型能正确理解请求、选择适当工具或从错误中恢复。
- 操作权限:硬件无法自行获得信息、支付、文件或设置的访问权。相关操作必须由操作系统、应用和用户授权。
- 应用支持:跨应用工作需要受支持的 API、协议或集成。即使 NPU 能力很强,也无法操作没有开放可用动作的应用。
- 安全自主:敏感操作仍需要范围限制、清晰预览、确认、日志、取消和回退机制。
- 默认隐私:本地处理可以减少发送到服务器的数据,但遥测、备份、账户同步和云端回退仍可能把数据传出设备。
- 持续性能:一次短时演示无法证明智能体长时间运行时的发热、耗电和速度。
Qualcomm 还提出,把适合的推理任务从云端转移到边缘侧,可以改善成本、隐私、性能和个性化。这些是潜在的设计优势,而不是必然结果。需要更大模型、最新信息或大量计算的任务仍可能留在云端;实际智能体也可能采用混合架构。
购买者清单:判断整部手机,而不是芯片口号
- 当前有哪些名称明确的智能体任务可在你所在地区和所用语言下运行?
- 哪些步骤完全在设备端运行,手机又会在何时使用云端?
- 离线时,或者应用、账户或服务不可用时,会发生什么?
- 哪些应用开放了受支持的操作,哪些步骤仍需手动完成?
- 用户能否复核、批准、取消并审计后果重大的操作?
- 扣除操作系统和常用应用后,还剩多少 RAM 和存储空间?
- 延迟、电池和散热结果是否来自量产设备上的持续使用测试?
- 厂商会为模型、运行时、安全和集成提供多久的更新?
开发者清单:测试完整的操作循环
- 分别分析 prefill、decode、工具调用和应用交接。
- 测量峰值与持续状态下的内存、带宽、能耗和温度。
- 验证每种精度下的质量,不要想当然地认为较低 bit 可以接受。
- 对 MoE 模型测试专家模块加载和缓存未命中,而不只测试预热后的运行。
- 记录哪些操作在 NPU 上执行,哪些会回退到其他处理单元。
- 设计明确的权限范围、确认、超时和恢复路径。
- 在量产硬件和软件上对完整用户任务进行基准测试。
常见问题
设备端 AI 智能体必须使用 NPU 吗?
并非绝对需要:CPU 和 GPU 也能运行 AI 模型。NPU 专为高效加速神经网络推理而设计,这对电池供电且反复运行的工作负载可能很重要。最终体验仍取决于内存、软件和应用访问能力。
30B MoE 是否意味着手机会计算全部 300 亿个参数?
不是。在 Qualcomm 的示例中,模型约有 300 亿个可用参数,但每个 token 步骤只路由约 30 亿个参数。完整模型仍需要存储和内存管理;只路由一部分参数,也不代表它与 3B 模型完全相同。
共享内存扩大 50% 是否意味着手机 RAM 增加 50%?
不是。Qualcomm 描述的是 NPU 的共享内存子系统,而不是系统总 RAM。该公告给出了相对增幅,但未在文章中提供绝对容量。
更快的 INT4 prefill 会让智能体整体快 50% 吗?
不一定。Qualcomm 声称,在未具体说明的条件下,某一推理阶段的性能最高可提高 50%。Token 生成、CPU 编排、网络调用、应用响应时间和确认步骤也会影响任务完成速度。
披露与来源
本文分析 Qualcomm 发布的架构声明。文中引用的性能数据来自 Qualcomm,并非 Meydo 的独立测试。Meydo 未使用这些公告来宣称任何 Meydo 产品具备相应能力。
- Qualcomm:《为什么 Agentic AI 需要完全不同的移动架构:Qualcomm Hexagon NPU》,2026 年 9 月 10 日。
- Qualcomm:《将 AI 推理从云端转移到手机可以降低 AI 成本》,2025 年 9 月。
