端侧 NPU 军备竞赛 2026:TOPS 越吹越大,真正的瓶颈却是内存带宽

手机厂商发布会的 AI 页面越来越像算力竞赛:TOPS 数字一年翻一倍,「本地跑大模型」成了旗舰芯片的标配宣传。但实际把一个 7B 模型塞进手机试试,生成速度常常只有个位数 token/s——TOPS 明明够用,慢在哪?答案是:端侧 LLM 解码是内存带宽问题,不是算力问题。本文拆解 2025–2026 旗舰 NPU 的官方口径、带宽瓶颈的数学,以及「端侧到底能跑多大」的现实答案(芯片与量化的基础盘点见站内旧文《手机上的大模型》,本文聚焦 2026 年的新格局)。

旗舰 NPU 的 2025–2026:从晒 TOPS 到晒能效

三家平台的官方叙事已经明显分化:

高通骁龙 8 Elite Gen 5(2025 年 9 月发布):官方产品简报强调增强 Hexagon NPU 能效比提升 16%、神经网络处理速度提升 37%,支持 INT2 量化、端侧生成式 AI 加密与 Agentic AI 场景;整片 SoC 宣称 CPU 能效提升 35%、整体功耗省 16%。高通延续了「不公布绝对 TOPS」的路线——上一代起它就只用相对提升说话。

联发科天玑 9500(2025 年 9 月发布):官方定位直接叫「Agentic AI 平台」,NPU 宣称峰值功耗降低 56%、常驻小模型功耗降 40%、3B 参数 LLM 输出速度提升 100%、支持 128K 上下文。这是三家中最直白把「端侧 LLM」写进官方口径的。

苹果 A19 Pro(2025 年 9 月发布):16 核 Neural Engine 照旧,但苹果从 A18(官方口径 38 TOPS)之后停止公布 TOPS 数字,宣传转向内存带宽与能效。社区估计其 Neural Engine 在 40+ TOPS 量级——注意这是第三方估算,不是官方数字。

看得清的趋势:绝对 TOPS 的营销价值在退潮,能效、3B/7B 模型吞吐、常驻小模型功耗、Agentic 场景成为新的比拼点。传闻中的下一代(如 iPhone 18 系列的 A20 Pro)被曝把 Neural Engine 核数翻倍——截至 2026-10-07 这仍是泄漏口径,未获苹果官方确认,本文不采信其具体数字。

为什么带宽才是真瓶颈:一道除法题

LLM 逐 token 生成(解码阶段)时,模型权重是每一步都要完整读一遍的。对一个以「权重字节 ÷ 内存带宽」为主导的过程,理论速度上限可以粗算:

token/s ≈ 内存带宽 ÷ 模型体积(字节)

例:7B 模型 INT4 量化 ≈ 4 GB
手机典型 LPDDR 带宽 ≈ 68–80 GB/s
理论上限 ≈ 68 ÷ 4 ≈ 17 token/s(未计 KV Cache、调度与功耗墙损耗)

这个除法解释了三件行业怪事:

  1. TOPS 再大也涨不了速:NPU 的乘加算力只在预填充(prompt 处理,可大规模并行)阶段用得上;解码是逐 token 的访存串行活,算力严重过剩,带宽严重不够。
  2. 量化不只省显存,更直接提速:模型压到一半,速度上限就翻一倍。这是端侧死磕 INT4/INT2 的根本原因——高通支持 INT2 的意义正在于此。
  3. 带宽成为新营销点:苹果转推内存带宽、A 系列每代升级 LPDDR 规格的动因,与 PC 侧 Mac 统一内存被社区用来跑大模型是同一个逻辑。

端侧到底能跑多大:一个速查表

综合上述公式与各平台公开材料,截至 2026-10-07 的现实区间:

模型规模 量化后体积 手机现实性 典型体验
0.5B–1B 0.3–0.7 GB 老机型也能跑 常驻型任务:意图识别、摘要、纠错
3B–4B 2–2.5 GB 2024 后旗舰舒适区 联发科官方主打档:可交互的对话/翻译
7B–8B 4–5 GB 顶配机型勉强 中端机带宽直接卡死,发热降频明显
13B–14B 7–8 GB 基本不可行(手机) 需 16GB 内存 + 高带宽,体验仍勉强
20B+ 12 GB+ 仅 Mac/PC 统一内存 32GB+ 的桌面设备主场

两个常被忽略的附加项:KV Cache 会随上下文长度线性吃显存(128K 上下文宣示的代价在端侧尤其疼);功耗墙会让纸面带宽维持不住——持续生成时 SoC 降频,速度从「首屏惊艳」滑向「长文龟速」。

PC 侧参照:M3 的带宽账

Mac 上同样的物理规律。有第三方研究测过 Apple M3 Neural Engine 跑 Llama 3.2 1B:经优化后生成速度从 10.0 提升到 24.3 token/s——即便如此,1B 模型在桌面级芯片上也就这个量级,恰好印证了「除以带宽」的模型(M 系列统一内存带宽一百 GB/s 上下,跑 8B INT4 的理论上限约在每秒十几到二十 token)。本地跑模型的实践工具链(量化选择、显存估算)可参考站内《Ollama 实战指南》。

Agentic AI:端侧的新故事

2025–2026 各家不约而同把 NPU 的下一幕押在「智能体」上:不是本地跑一个完整大模型,而是让小型常驻模型处理隐私敏感、需要全天候在线的任务——屏幕理解、意图路由、跨应用操作。这类负载的特点恰好避开带宽短板:模型小(1B 级)、上下文短、追求低功耗常开。天玑 9500 官方把「Agentic AI」写进平台名、高通强调端侧生成式 AI 加密,都是在讲同一个故事:云端大模型负责聪明,端侧小模型负责贴身。

给选型者的建议

  • 评估端侧方案时先问三个数字:模型量化后体积、目标机型内存带宽、可接受功耗。TOPS 排不上前三;
  • 用户级应用把「甜点模型」锚在 1B–4B,7B 以上只给旗舰机型做降级开关;
  • 长上下文功能慎上端侧,KV Cache 的显存账要先算;
  • 隐私敏感、需要离线的功能(输入预测、屏幕理解、相册搜索)才是 NPU 的主场,别拿它硬刚云端旗舰模型的质量。

端侧智能这盘棋,比的不是谁的 NPU 更大,而是谁在 68 GB/s 的水管里把每一比特权重用得更省。带宽不翻倍,模型就只能往下压——这就是为什么 2026 年最值得关注的端侧技术不是新芯片,而是更激进的量化与蒸馏。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?