先建框架,再读新闻
算力芯片的新闻密度极高:新架构、新制程、新公司,参数一项比一项亮眼。但多数报道默认读者已经知道这些芯片在分工版图里的位置,结果往往是看完只记住了几个大数字。这篇文章不评任何具体产品,只做一件事:给出一个分类框架,让你以后读芯片新闻时知道该问什么。
GPU 为什么成了 AI 算力的代名词
深度学习的主体计算是矩阵乘法,天然可并行——同一种运算可以拆给成千上万个核心同时执行。GPU 恰好为并行吞吐而生:海量相对简单的核心、远高于普通内存的显存带宽,加上十几年打磨出来的软件生态。三点叠加,让它成了默认答案。
显存带宽值得一提。大模型的计算是「数据搬运密集型」的:权重和激活值要不断在显存与计算单元之间流动,搬不动,算得再快也得等。GPU 为此配备了专门的显存与多卡互联(如 NVLink 一类的高速互连),让多卡协同训练成为可能——这也是 CPU 加大内存条替代不了 GPU 的根本原因。
三点里最容易被低估的是生态。围绕 CUDA 长出了 cuDNN、NCCL 这样的基础库、完整的编译工具链和无数框架适配,十几年积累构成了真正的壁垒。硬件参数可以被追平,生态却要靠时间沉淀——换一家芯片,往往意味着算子补齐、框架适配、精度调优从头再来。这也是为什么参数上的追赶者众多,真正完成生态承接的少。
ASIC:把灵活性换成能效
ASIC(专用集成电路,为特定计算定制的芯片)走的是另一条路。既然大模型的核心是 Transformer 里的矩阵乘阵列,就直接在硅片上堆乘加单元,去掉 GPU 为图形和通用计算保留的部分——设计空间立刻大了一圈:更高的能效比、更低的单位成本、更少的数据搬运开销。大厂自建的张量处理器(如 TPU 一类的矩阵加速器)是这条路线的经典代表,专用加速器承载自家训练与推理已有多年的生产历史。
特化程度也分场景。训练要求对各种模型结构保持灵活,特化空间有限;推理目标明确、负载形态稳定,是 ASIC 更适合的战场。代价同样清楚:模型结构一旦发生大的变化,深度特化的设计可能贬值,押注的是「主流结构不会突变」这个前提。
推理卡的成本逻辑
训练是一次性投入,推理是每天重复发生的运营成本。推理对峰值算力的要求低于训练,却对显存带宽和单位成本高度敏感——模型权重常驻显存,每生成一个 token 都要搬运数据,「带宽墙」往往先于「算力墙」出现。推理的吞吐还高度依赖批量:把并发请求凑成一批同时算,单 token 的摊薄成本大幅下降,这也是推理服务总在谈「批处理策略」的原因。于是「推理用不那么强但便宜的卡」是自然的成本优化方向,也是各家推理方案竞争的主战场。推理的性价比账本,比拼的不是峰值算力,而是每元成本能产出的 token 数——本站在价格战与算力一文中算过这笔账。
国产与自研
国产算力梯队大致两类:互联网大厂自研自用,与独立芯片厂商对外供货。它们的共同课题不在流片而在生态适配——让主流框架和推理引擎愿意移植、让开发者迁移成本降下来。生态环节的进展决定芯片能否真正被用起来,这比发布会参数更值得关注。
读报三问
下次看到芯片新闻,先问三个问题:
- 训练还是推理? 两者优化目标不同,宣传参数常不能跨场景直接比较。
- 峰值算力还是有效算力? 峰值是纸面数字,实际利用率(MFU,模型算力利用率的行业术语)才代表真实产出,两者差数倍很常见。
- 软件生态谁承接? 框架适配、算子库、工具链缺一样,落地就多一分手工活。
小结
芯片格局是动态的:架构在演进、分工在细化,今天的最优解未必是明年的。对采购与架构决策而言,与其押注单一供应商,不如让服务层保持引擎无关、模型格式保持标准,给自己留出随时转移的余地。
读者留言
COMMENTS 暂无还没有留言,来说第一句?