过去两年,大模型在手机上从发布会 PPT 变成了系统级标配:苹果的写作工具与通知摘要、谷歌 Pixel 的 Magic Cue、国产厂商的离线语音助手,背后都是常驻端侧的小模型。本文盘一下截至 2026-10-07 的端侧推理现状:芯片到了什么水平、模型有多大、软件栈怎么选、哪些场景真的跑得起来。
为什么大模型非要塞进手机
动机有四个:隐私(数据不出设备)、离线(无网可用)、延迟(省去网络往返)、成本(厂商不必为每次调用付云端推理账单)。但端侧模型注定做不大,所以各家的最终形态都是端云协同:小模型常驻端侧处理高频低复杂度任务,路由判断在端上完成,复杂请求无感升级到云端大模型。
苹果在 WWDC 2026 发布的第三代基础模型(AFM 3)把这套结构讲得最清楚:
flowchart TB
A["输入:通知 / 语音 / 相册 / 屏幕"] --> B["路由判断:意图复杂度(端侧)"]
B -->|"简单:摘要 / 翻译 / 检索 / 指令"| C["端侧小模型 3B 级<br/>4-bit 量化 · NPU 执行"]
B -->|"复杂:多步推理 / Agent / 长上下文"| D["云端大模型<br/>Private Cloud Compute"]
C --> E["端上执行并返回结果"]
D --> E
苹果的云端部分跑在 Private Cloud Compute 上,用户数据「不存储、不共享」;请求过于复杂时才升级,其余全部在端侧消化。
硬件底座:NPU 军备竞赛,内存带宽才是真瓶颈
截至 2026-10-07 的旗舰 SoC 现状:
- 苹果 A19 / A19 Pro(iPhone 17 系列):16 核 Neural Engine,算力 35 TOPS——这个数字从 A17 Pro(2023)起三代没变过;有报道称 iPhone 18 Pro 的 A20 Pro 会翻倍到约 70 TOPS。M 系列上,M4 的 38 TOPS 是苹果官方公布的最后一代 Neural Engine 数字,M5(2025-10)起宣传重心转向每颗 GPU 核心内嵌的 Neural Accelerator,宣称 AI 性能最高 3.5 倍提升,Neural Engine 的 TOPS 从此不再公布。
- 高通骁龙 8 Elite Gen 5(2025-09 发布):3nm 工艺,Hexagon NPU 官方口径 AI 性能较上代提升三成以上(第三方口径 37%–46% 不等),主打端侧多模态与 Agentic AI;值得注意的是高通已经不再把单一 TOPS 数字当宣传主角。
- 联发科天玑 9500(2025-09 发布):第九代 NPU 990 加生成式 AI 引擎 2.0,官方称算力较上代翻倍,并率先宣布支持 BitNet 1.58-bit 大模型。
但真正卡住端侧推理的不是 TOPS,而是内存带宽。LLM 逐 token 解码时,每生成一个字都要把全部权重过一遍内存,是典型的带宽受限负载。旗舰机 LPDDR5X 已到 9600–10600 MT/s 档,峰值带宽约 77–85 GB/s。做个算术:3B 模型 4-bit 量化后权重约 1.6 GB,理论上限就是每秒 50 token 上下;7B 模型权重 3.5–4 GB,天花板立刻掉到 20 token/s,再算上 KV cache 和实测损耗就更紧张。这就是各家把端侧主力定在 3B 级、而不是越大越好的根本原因。
模型侧:3B 成为主力配置
- 苹果 AFM 3 Core:3B 稠密模型,上一代 3B 的直系后代;更亮眼的是 AFM 3 Core Advanced——20B 稀疏 MoE,每个 token 只激活 1–4B 参数,经指令跟随剪枝(IFP)压缩后权重驻留闪存、按需把专家换入内存,专为大内存的 Apple silicon 设计。
- 谷歌 Gemini Nano:2023 年随 Pixel 8 落地,Pixel 10(Tensor G5,2025-08)搭载最新版本,支撑 Magic Cue 等二十多项端侧特性;谷歌从未官宣参数量,第三方普遍估计在 1.8B–3.25B 一档。
- 开源小模型:Qwen3 覆盖 0.6B–4B 全尺寸(端侧部署最常见 4B 档)、微软 Phi-4-mini 3.8B(MIT 协议)、Google Gemma 3n E2B/E4B(选择性参数激活,实际按 2B/4B 运行)、HuggingFace SmolLM3 3B。
- 国产阵营:vivo 蓝心 BlueLM 1B/3B/7B 矩阵(3B 为主力);华为小艺走麒麟芯片 + 模型压缩 + 盘古端云协同路线;小米 2025 年开源 7B 推理模型 MiMo,社区实测在两千元档机型上 4-bit 量化也能离线跑通;据钛媒体报道,面壁智能的端侧模型 2026 年进入了三星全球旗舰产品线。
软件栈与量化
- 苹果:Core ML 面向应用分发,模型跑在 Neural Engine 上;MLX 是研究与原型友好的阵列框架——苹果官方博客实测,M5 借助 Neural Accelerator 在 MLX 下 LLM 性能较 M4 提升 19%–27%。
- 高通:AI Engine(QNN)SDK 把模型编译到 Hexagon NPU 上执行。
- 谷歌:MediaPipe LLM Inference API 已进入维护模式,新特性转向 AI Edge 的 LiteRT-LM;Gemma 3n 以 .litertlm 格式开箱即用。
- 跨平台:llama.cpp(GGUF 权重,CPU/Metal)是事实上的通用底座,谷歌官方文档甚至专门写了「用 llama.cpp 跑 Gemma」的指南;MLC-LLM 走机器学习编译路线,把模型直接编译到手机 GPU 或浏览器里跑。
量化是端侧的前提:16-bit 下 3B 模型要 6 GB 以上内存,4-bit 后约 1.6 GB 才塞得进与系统共享的运行内存。主流做法已从训练后量化演进到量化感知训练(QAT,苹果 AFM 3 即采用),同等位宽下质量损失显著更小;联发科押注的 BitNet 1.58-bit 把权重压到三值,是更激进的路线。精度与质量的详细换算,本站此前《模型量化的精度账》一文专门讨论过,此处不展开。
落地场景:哪些在端上,哪些必须回云
端侧已经成熟的:
- 通知与邮件摘要:苹果 Apple Intelligence 的通知摘要、优先级排序全部在端侧完成,信息不离开手机;AFM 3 的听写与语音合成质量较上代有明显提升(苹果官方评测数据)。
- 系统级实时翻译:Pixel 10 的通话实时翻译由 Tensor G5 端侧承担;苹果的对话翻译同样走端侧优先路径。
- 相册自然语言搜索:「去年冬天在海边的日落照片」这类查询由端侧多模态模型完成语义匹配。
- 离线语音指令与听写:飞行模式可用的语音助手、离线听写,是国产厂商旗舰机的标配卖点。
这些任务短、高频、对隐私敏感,3B 级模型足够胜任。
仍必须回云的:复杂多步推理、Agent 式工具调用、长上下文文档处理、高质量图像生成。苹果的答案是 AFM 3 Cloud Pro 跑在 Google Cloud 的 NVIDIA GPU 上,用 PCC 的隐私承诺兜底——「端侧优先、云端升级」的双层结构已是行业共识。
边界与展望
三个约束决定端侧大模型的天花板:
- 运行内存:手机内存要与系统和应用共享,模型上限基本被 RAM 和带宽写死。旗舰机来到 12–16 GB 的今天,一个 4-bit 的 7B 模型仍要占掉 4 GB 上下——这与用户"后台多开"的体验直接冲突。AFM 3 Core Advanced 的「权重驻留闪存 + 专家按需换入内存」就是在给这条上限打补丁。
- 散热与持续算力:NPU 的峰值 TOPS 只能维持数秒到数十秒,长时间生成会撞上温控墙;可持续功耗比峰值算力更值得看。
- 量化损耗:参数越小对量化越敏感,1B 级模型 4-bit 之后的能力折损是产品体验上真实存在的。
还有一条容易被忽略的线:模型怎么更新。端侧模型随系统 OTA 分发(苹果 AFM 3 随操作系统升级、Gemma 3n 随应用包内置),意味着端侧模型的能力节奏由系统版本而非云端迭代决定——这也是端侧能力天然滞后于云端前沿模型几个月到一年的结构性原因。
长期形态大概率不是「端侧取代云端」,而是路由常态化:端上常驻一个小而快的模型处理隐私与高频任务,复杂请求无感升级云端,两者共用同一套系统级 API。下一代手机 SoC 的竞赛,也已经从 TOPS 数字转向内存带宽、稀疏激活与持续能效——这三条线,比 TOPS 更值得盯。
读者留言
COMMENTS 暂无还没有留言,来说第一句?