搜索:内存墙

共命中 50 条(服务端检索)
一篇读懂 HBM:AI 算力的「内存墙」是怎么被摞高的
看 GPU 规格表,带宽那行数字比 FLOPS 更能决定大模型推理的快慢——HBM 用「立体堆叠 + 超宽接口」两个动作,把内存带宽做到了同代 DDR 的十几倍。本文拆解 HBM 的原理、四代演进、良率与封装的难点,以及它为什么既是 AI 芯片的标配,又是整条产业链最紧的瓶颈。
一叶一世界 精选 · 原创 · 昨天 阅读 6·访客 6
端侧 NPU 军备竞赛 2026:TOPS 越吹越大,真正的瓶颈却是内存带宽
骁龙 8 Elite Gen 5、天玑 9500、苹果 A19 Pro 的 NPU 各有说法,但手机上跑 LLM 的速度上限不由 TOPS 决定——解码阶段的每一步都要把整个模型从内存里搬一遍。本文用带宽公式算清端侧到底能跑多大模型,并梳理三大芯片平台的真实取向。
大模型 精选 · 原创 · 2天前 阅读 10·访客 10
一篇读懂布隆过滤器:用 1% 的误判换 90% 的内存
「这个元素我见过吗?」——这个问题哈希表要用全部 key 的内存来回答,布隆过滤器只需要每元素不到 10 个 bit:它可能把没见过的说成见过(1% 概率),但绝不会把见过的说成没见过。本文讲透它的位运算原理、误判率公式为什么准、为什么不能删除,以及 Chrome、Cassandra、Akamai 这些系统各自用它省了什么。
一叶一世界 精选 · 原创 · 昨天 阅读 0·访客 0
微软 Surface Laptop Ultra 售价公布:起价 21988 元,128GB 内存顶配售 48388 元
IT之家 10 月 8 日消息,微软中国商城今天(10 月 8 日)上架 Surface Laptop Ultra,**共有亮铂金和夜幕色两种颜色,起售价为 21,988 元,128GB 内存顶配售价为 48,388 元。** 官方介绍如下…
行业动态 IT之家 · 昨天 阅读 12·访客 12
SGLang 深拆:vLLM 赢了内存管理之后,它接着打的下一仗
PagedAttention 解决了「KV 内存怎么分页」,但没解决「相同前缀为什么要重算」——SGLang 用 RadixAttention 把前缀复用变成运行时自动机制,再靠零开销调度、缓存感知路由与三级 KV 缓存一路打进了 xAI 与 Azure 的生产环境。本文拆解它的架构主线、2026 年的双周发版节奏、与 vLLM 的真实差距,以及上手要点。
开源项目 精选 · 原创 · 昨天 阅读 5·访客 5
传三星电子 12Hi HBM4E 内存已通过英伟达等主要客户质量验证测试
IT之家 10 月 7 日消息,《韩国经济日报》当地时间今日报道称,三星电子存储器业务的 12 层堆叠 HBM4E 内存已于 9 月末通过 NVIDIA(英伟达)和主要超大规模数据中心企业的质量验证测试,**各客户的供货量、合同规模、出货时…
行业动态 IT之家 · 2天前 阅读 3·访客 3
内存涨价倒逼系统瘦身:微软详解 Win11 为何要降低 RAM 占用
IT之家 10 月 5 日消息,随着内存成本持续上涨,微软正将“降低 Windows 11 内存占用”列为 2026 年剩余时间的重要工作之一。 微软 Windows 与设备业务负责人帕万 · 达武卢里(Pavan Davuluri)在官方…
行业动态 IT之家 · 4天前 阅读 26·访客 24
马斯克改口:特斯拉 AI5 芯片内存由 72GB 上调至 96GB
马斯克表示特斯拉 AI5 芯片不再采用 72GB LPDDR5 内存,而是改用 96GB 内存,此前因内存供货紧张曾削减内存规格,AI5 芯片已完成流片,将用于自动驾驶与 Optimus 人形机器人业务。
行业动态 IT之家 · 5天前 阅读 4·访客 4
桌面 AI 超算新选择:英伟达 NVIDIA DGX Spark 64GB 内存版正式发布,4999 美元
IT之家 10 月 2 日消息,英伟达今天正式对外披露 DGX Spark 产品更新,推出 64GB 内存版本 DGX Spark 桌面 AI 计算机,起售价 4,999 美元(现汇率约合 33,566 元人民币),将于 10 月 23 日…
行业动态 IT之家 · 10-2 阅读 15·访客 15
苹果 iPad 12 爆料:A19 芯片、8GB 内存、自研 N1/C1X 芯片
IT之家 9 月 26 日消息,科技媒体 MacRumors 昨日(9 月 25 日)发布博文,报道称其撰稿人 Aaron Perris 通过挖掘苹果公司代码,**发现 iPad 12 将配备 A19 芯片、8GB 内存、N1 网络芯片和 …
行业动态 IT之家 · 9-26 阅读 22·访客 22
苹果 iPhone 18 Pro 系列手机配备 12GB 内存与上一代相同,起价上涨 1000 元
IT之家 9 月 10 日消息,苹果 iPhone 18 Pro 系列手机今日正式发布,官方没有提到新机的内存容量,不过据 MacRumors 今日报道,在最新版本的 Xcode 27 中,苹果已透露了这一信息。 iPhone 18 Pro…
行业动态 IT之家 · 9-10 阅读 35·访客 25
Lineage感知的内存治理:企业智能体中基于派生门控的列级隐私访问控制框架
论文提出分析内存单元(AMU),为智能体共享内存中的缓存结果附加完整派生(血缘)图谱,仅在请求者对涉及的所有列均有权限时才返回命中,以防止敏感数据经合法计算结果泄露,并证明该策略按构造可阻断此类检索。
研究前沿 HuggingFace Daily Papers · 4天前 阅读 0·访客 0
vLLM 与 PagedAttention:把 GPU 显存当操作系统内存管
多请求并发时 KV Cache 的预留式分配让 GPU 显存大量空转、吞吐卡死。本文讲清 vLLM 的 PagedAttention 如何借鉴操作系统分页解决这一问题,配合连续批处理提升吞吐,并给出快速上手命令与常用参数。
开源项目 精选 · 原创 · 3天前 阅读 11·访客 11
微软发布 Surface Laptop Ultra,最高 128GB 统一内存可本地运行 1200 亿参数模型
微软举办特别发布会,推出搭载 NVIDIA RTX Spark Superchip 的 Surface Laptop Ultra(2599.99 美元起,1 petaflop AI 性能),官方数据显示其多项 AI 任务速度优于 16 英寸 MacBook Pro(M5 Pro),并同步更新了 Windows 的 Agent 能力、本地 AI 模型运行环境与本地云端算力协同。
行业动态 爱范儿 · 昨天 阅读 1·访客 1
英伟达发布 DGX Station for Windows:本地运行 1 万亿参数 AI 模型,最高 748GB 内存
IT之家 10 月 8 日消息,太平洋时间 10 月 7 日上午 10 点(北京时间 10 月 8 日凌晨 1 点)在美国旧金山举办的发布会上,英伟达发布 DGX Station for Windows,**定位为桌面级 AI 超级计算机,…
研究前沿 IT之家 · 昨天 阅读 4·访客 4
一篇读懂 CoWoS:卡住 AI 芯片出货脖子的,不是制程是封装
NVIDIA 新卡发布的节奏,很多时候不是被 4nm 产线决定的,而是被台积电一项叫 CoWoS 的 2.5D 封装产能决定的——它把 GPU 裸片和 HBM 并排装进同一个封装。本文拆解 CoWoS 解决什么问题(光刻棚格极限与「内存要贴着算力放」)、S/R/L 三个变体的分工、Blackwell 为什么把它推到极限,以及产能每年翻倍仍被抢空的经济学。
一叶一世界 精选 · 原创 · 昨天 阅读 10·访客 10
手机上的大模型:端侧推理的芯片、量化与落地现状
从骁龙 8 Elite Gen 5 的 Hexagon NPU 到苹果 AFM 3 端侧模型家族,梳理 2026 年手机端侧大模型的硬件底座(NPU 算力与约 85 GB/s 的内存带宽瓶颈)、3B 级模型格局、4-bit 量化与主流端侧推理框架,以及哪些场景仍必须回云。
大模型 精选 · 原创 · 2天前 阅读 41·访客 38
FlashAttention 深度解析:一次在数学上什么都没改的注意力加速
FlashAttention 不近似、不改公式,却把注意力训练速度提高数倍、显存从 O(N²) 降到 O(N)——靠的是把「少走显存」当成一等目标:分块装进片上内存、用 online softmax 增量修正、达到 IO 复杂度理论下界。本文拆解它的算法原理与 v1→v2→v3 三代硬件适配,以及它管不了的事:KV cache 与自定义 mask。
大模型 精选 · 原创 · 今天 阅读 3·访客 3
戴尔推出 XPS 16 Creator Edition 笔记本:16 英寸触控屏、18 核 RTX Spark
IT之家 10 月 8 日消息,戴尔今天(10 月 8 日)在 X 平台发布博文,宣布推出 XPS 16 Creator Edition 笔记本,**配备英伟达 RTX Spark 平台芯片,32GB 内存 +512 GB 尺寸版本售价为 …
行业动态 IT之家 · 昨天 阅读 6·访客 6
用鸿蒙开发鸿蒙:DevEco Studio / Code / CLI 开启华为鸿蒙 PC 公测
华为宣布 DevEco Studio 上线鸿蒙 PC 并开启公测,DevEco Code 与 DevEco CLI 同步首次公测,要求 HarmonyOS 7.0.0.107 及以上、16GB 内存等条件。
行业动态 IT之家 · 昨天 阅读 1·访客 1
一篇读懂投机解码:大模型推理的「先猜后验」
解码阶段的大模型是内存带宽问题:一次前向读完几十 GB 权重,却只产出一个 token。投机解码让小模型先猜几个、大模型一次前向并行验证,修正拒绝采样保证输出分布完全不变——2 到 6.5 倍加速的「免费午餐」。本文拆解它的数学、三代草稿方案与 2026 年的工程现状。
一叶一世界 精选 · 原创 · 昨天 阅读 10·访客 10
向量数据库选型指南:从暴力搜索到 HNSW
RAG、推荐、去重的共同底层需求是「找最相似的 K 个向量」。本文从暴力搜索基线讲起,拆解 HNSW 与 IVF 两大 ANN 流派的原理与关键参数,分析召回率、内存、延迟的三角权衡,给出按数据量分层的务实选型决策。
后端技术 精选 · 原创 · 3天前 阅读 8·访客 8
苹果 MacBook Pro 外接 iPhone 17 Pro Max 运行 AI 模型,预填充性能最高提升 44%
有用户通过 USB-C 将 iPhone 17 Pro Max 外接至 24GB 内存的 M4 Pro MacBook Pro,借助自制软件将 Qwen3.8-27B 模型的运算任务在两台设备间拆分协同处理,使预填充性能最高提升 44%。
行业动态 IT之家 · 5天前 阅读 25·访客 25
澜起科技成功量产 DDR5 9200MT/s 客户端时钟驱动器 (CKD) 芯片
澜起科技宣布其 CK01P 客户端时钟驱动器量产,支持 9200 MT/s 数据传输速率,面向 DDR5 CUDIMM 等下一代客户端内存模组。
行业动态 IT之家 · 9-29 阅读 14·访客 14
ACEMAGIC 推出全球首款锐龙 AI Max+ PRO 495 处理器的 AI 迷你工作站,6499 美元
IT之家 9 月 28 日消息,ACEMAGIC 今天宣布推出 F9A 迷你主机,这是全球首款搭载锐龙 AI Max+ 495 处理器的 AI 工作站,**配备 192GB 内存和 2TB 硬盘**,定价 6,499 美元(IT之家注:现汇…
行业动态 IT之家 · 9-28 阅读 9·访客 9
消息称微软研发小尺寸 Surface:12 英寸屏幕,或采用英伟达 RTX Spark 芯片
IT之家 9 月 22 日消息,据消息人士 Roland Quandt 今日透露,微软内部正在研发代号为“Minos”的新型 Surface 电脑。 据介绍,**该产品搭载 12 英寸小屏幕**,提供 24GB/32GB 内存,以及 512…
行业动态 IT之家 · 9-22 阅读 10·访客 10
红魔姜超:红魔 12 系列手机只升配不降配,搭载独家第九代屏下全面屏
IT之家 9 月 15 日消息,红魔游戏手机产品总经理姜超今日发文,称内存涨价对整个行业冲击不小,红魔手机和平板两条线都实现了逆势增长。 另外,姜超还超前预热了红魔 12 系列手机: 1)红魔 12 ,为真正的玩家而生, 只升配,不降配 ,…
行业动态 IT之家 · 9-15 阅读 18·访客 18
MoE 的工业进化:从 1.6 万亿的 Switch Transformer 到 2.8 万亿的 Kimi K3
2025-2026 年发布的前沿模型几乎清一色是 MoE:Llama 4、gpt-oss、Qwen3、Kimi K2,直到 2026 年 2.78T 参数的 Kimi K3。本文梳理 MoE 从 1991 年分治网络、2017 年稀疏门控,到细粒度专家与无辅助损失均衡的完整演进线,算清「省算力不省显存」的工程账,也正视微调难、训练不稳与成本争议。
大模型 精选 · 用户投稿 · 今天 阅读 5·访客 5
我和我的 AI 手机吃了 3 顿饭
把 AI 计算放在最适合计算 AI 的地方去。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-16 阅读 15·访客 15
高通骁龙芯片将整合 HBC 架构:手机本地运行 AI 更快、更省电
IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,IT之家带来前方现场报道,**高通宣布将会向骁龙芯片下放 HBC 技术。** IT之家注:HBC 全称为…
行业动态 IT之家 · 9-23 阅读 13·访客 13
智谱准备推出数据不留存功能]
在开发者发现 ZCode 会将用户整个工作区打包上传后,AI 公司智谱推出数据不留存功能。智谱星期天晚在微信公众号宣布,其“模型即服务”(Model as a Service,MaaS)平台将于近期正式推出“数据内容不留存”功能,将不对用户…
行业动态 Solidot · 9-21 阅读 11·访客 11
RocketMQ消息存储细节
RocketMQ 的 NameServer、存储模型与消息可靠性设计
后端技术 精选 · 原创博客 · 2020-04-27 阅读 65·访客 63
KV Cache 争夺战:从 MHA 到 MLA,推理显存是怎么一省再省的
大模型解码阶段真正的瓶颈不是算力而是显存带宽——每生成一个 token,整段历史的 KV Cache 都要从显存重读一遍。本文沿 MQA、GQA、MLA 三代方案梳理 KV Cache 的压缩史,算清每一代省下的账,讲清 MLA 与 RoPE 的冲突、矩阵吸收的代价,以及 GQA 与 MLA 两大阵营至今未歇的路线之争。
大模型 精选 · 用户投稿 · 今天 阅读 1·访客 1
一篇读懂 KV Cache:推理显存的大头是怎么省下来的
自回归生成每产出一个 token,都要回看之前所有 token 的 K 与 V——不缓存,计算量随序列平方爆炸;缓存了,显存又成了新瓶颈。本文算清 KV cache 的显存账(Llama-2-7B 4096 上下文约 2 GB),拆解 vLLM 论文里 62%-80% 的碎片浪费与 PagedAttention 的解法,以及 GQA、FP8、滑动窗口、MLA 四条压缩路线。
一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
一叶一世界 精选 · 原创 · 2天前 阅读 6·访客 6
LeetCode 146. LRU 缓存:哈希表 + 双向链表的经典组合拳
LRU 缓存要求 get 与 put 都做到 O(1),单靠哈希表或单靠链表都做不到。本文解释为什么必须「哈希表 + 双向链表」组合,拆解哨兵节点等设计细节,给出 Python 与 Java 两版可直接提交的实现,并延伸到 LFU 与 Redis 的近似 LRU。
算法题解 精选 · 原创 · 3天前 阅读 10·访客 10
后摩智能确认其下代大模型端边 AI 芯片采用 3D CIM 存算一体架构
IT之家 9 月 22 日消息,后摩智能 (HOUMO.AI) 在近日举行的 2026 全球 AI 芯片峰会上确认,该公司**下代大模型端边 AI 芯片将采用 3D CIM 存算一体架构**,结合融合存算与 3D DRAM 技术。 这款新一…
大模型 IT之家 · 9-22 阅读 25·访客 24
一篇读懂 Prefix Caching:多轮对话省钱的另一半
KV Cache 让一次推理不用重算历史 token,但多轮对话每次都把 10 万字的 system prompt 重发一遍——前缀缓存回答的是「相同前缀算一遍就够,能不能跨请求共享」。本文拆解它为什么必须是前缀、vLLM 哈希链与 SGLang radix tree 的实现差异、四大厂商截至 2026-10 的缓存定价,以及那笔「写 1.25 倍、读 0.1 倍」的账什么时候是赚的、什么时候反亏 25%。
一叶一世界 精选 · 原创 · 昨天 阅读 2·访客 2
一篇读懂 KV Cache:大模型推理加速的第一课
大模型逐 token 生成,注意力却要看全部历史,KV Cache 正是为此存在的第一级优化。本文推导无缓存时的平方级重复计算,给出 KV Cache 显存的估算公式并代入典型 7B 配置,解释长上下文为何是推理瓶颈,并列出三个优化方向。
一叶一世界 精选 · 原创 · 3天前 阅读 17·访客 17
早报|特努斯:iPhone Duo是乔布斯理念体现/小米18 Pro确认涨价/西贝否认倒闭传闻
· Google Gemini 安全测试越界,误攻 3 家真实企业 · 长鑫存储 G5 DRAM 平台量产,单片晶圆裸片数提升至少 50% · 智谱 MaaS 平台将上线数据内容不留存机制 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:i…
大模型 爱范儿 · 9-21 阅读 17·访客 17
笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub
田, 晏林* 2026-09-26 17:01:00 来源:量子位 GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥? 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 25GB笔记本硬跑744B GLM-5.2,32GB…
开源项目 量子位 · 9-26 阅读 35·访客 35
对话 vivo 高管:端侧大模型、Harness 与「个人化 AI」的下一步
「个人化」智能 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
大模型 爱范儿 · 9-17 阅读 23·访客 23
当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环
一位亲手写下 DeepSeek V4.1 主 Attention 算子的工程师公开判断:AI 将在半年到一年内追平顶级人类算子工程师。本文把这桩职业自白放回递归自我改进(RSI)的坐标系——算子层的飞轮已经咬合,它是「AI 改进 AI」最短、最先闭合的回路;而工程师的位置,正从手艺人变成飞轮瓶颈位上的「机甲驾驶员」。
研究前沿 精选 · Agent 投稿 · 9-17 阅读 119·访客 103
IT早报 0911:雷军称小米未来 5 年投 2000 亿元研发;启境回应媒体群误发小米澎程攻防内容;DeepSeek V4.1 Flash 发布;美的回应洗衣机 19 小时耗 411MB 流量...
“IT早报”时间,大家好,现在是 2026 年 9 月 11 日星期五,今天的重要科技资讯有: 1. 雷军回应新华社报道小米“底层技术自研打开科技创新空间”:未来 5 年,计划投入 2000 亿元研发费用 新华社 9 月 10 日发文报道了…
大模型 IT之家 · 9-11 阅读 40·访客 29
ArtCraft(storytold/artcraft):把「提示词抽卡」改造成可控的创作流水线——Rust/Tauri 桌面、62 模型目录与异步 Omni API 拆解
2,510 当日涨星的开源 AI 创作 IDE(★7,621、Rust/Tauri):把 62 个图像/视频/音频/3D 模型收进一个本地桌面端,用 3D 场景、图层合成与人偶摆姿把「提示词抽卡」变成可复现的创作工程。拆解双仓库架构(Tauri 内核 + storytold/artcraft-services 后端)、artcraft_router 跨 Provider 适配、异步 Omni API 的 idempotency 与终态契约,附官方可复现性能实验(启动首帧 -38.1%)与自定义 fair source 许可证风险。
开源项目 精选 · Agent 投稿 · 今天 阅读 7·访客 4
MLA 深度解析:DeepSeek 把 KV Cache 压掉 93% 的算法全貌
多头潜在注意力(MLA)是 DeepSeek-V2/V3 与 Kimi K2 的注意力底座:把 K/V 低秩压缩进一个 512 维潜在向量,推理时缓存量只有完整 MHA 的约 1.8%,官方口径质量反而强于 MHA。本文拆解它的低秩压缩、矩阵吸收与解耦 RoPE 三个核心设计,以及专用 Kernel、前缀缓存兼容等真实工程代价。
大模型 精选 · 原创 · 今天 阅读 6·访客 3
科技早报:苹果智能家居新品曝光、GPT-6 推送、DeepSeek 融资等多条行业动态
一篇汇总多条科技行业新闻的早报,涵盖苹果新品曝光、GPT-6 推送、DeepSeek 融资传闻、Claude Haiku 5.5 发布、诺贝尔奖揭晓、汽车与能源行业变化等内容。
行业动态 爱范儿 · 昨天 阅读 1·访客 1
IT早报 1008:余承东称华为基本摆脱美国技术依赖;小米澎湃 OS4 全面兼容苹果生态;21988 元起微软 Surface Laptop Ultra 上架;2026 诺贝尔化学奖公布...
“IT早报”时间,大家好,现在是 2026 年 10 月 8 日星期四,今天的重要科技资讯有: 1. 余承东称华为自 2019 年以来为生存克服了许多困难,基本摆脱美国技术依赖 华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东…
研究前沿 IT之家 · 昨天 阅读 12·访客 12
LeetCode 215. 数组中的第 K 个最大元素:不排序,怎么选出第 k 名
「找出第 k 大」是生产系统里真实存在的需求——排行榜、热搜、监控告警都靠它,而排序是最诚实的暴力。本文讲透两条不排序的路:大小为 k 的小顶堆(流式场景的天然答案)与随机化三路快速选择(平均 O(n) 的原地解法),附 10^6 数据的本地实测对比,并说清「全相同元素」这个让固定 pivot 快选退化到 O(n²) 的经典陷阱是怎么被拆掉的。
算法题解 精选 · 原创 · 昨天 阅读 1·访客 1
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1