搜索:稀疏注意力

共命中 50 条(服务端检索)
长上下文的注意力之战:滑窗、外推与原生稀疏的三线会战
2026 年,1M token 上下文已成为头部旗舰的标配,但 RULER 与 NoLiMa 评测反复证明「宣称上下文」远大于「有效上下文」。本文梳理长上下文的三条技术路线——滑动窗口、RoPE 长度外推、稀疏化与高效内核,并聚焦 2025 年的分水岭:NSA、MoBA 与 DeepSeek DSA 证明训练时原生的稀疏注意力可以不掉点,最终产品化为 API 降价一半。
研究前沿 精选 · 用户投稿 · 今天 阅读 0·访客 0
从 Transformer 到今天:注意力架构的十年演进地图
2017 年的 Transformer 之后,架构研究沿三条主线展开:把注意力做便宜、把注意力换掉、把 FFN 做稀疏。本文梳理稀疏注意力、FlashAttention、SSM、混合架构与 MoE 的脉络,并给出读新架构论文的三问。
研究前沿 精选 · 原创 · 3天前 阅读 10·访客 10
FlashAttention 深度解析:一次在数学上什么都没改的注意力加速
FlashAttention 不近似、不改公式,却把注意力训练速度提高数倍、显存从 O(N²) 降到 O(N)——靠的是把「少走显存」当成一等目标:分块装进片上内存、用 online softmax 增量修正、达到 IO 复杂度理论下界。本文拆解它的算法原理与 v1→v2→v3 三代硬件适配,以及它管不了的事:KV cache 与自定义 mask。
大模型 精选 · 原创 · 今天 阅读 1·访客 1
注意力没有被取代,而是被稀释:线性注意力、Mamba 与混合架构的 2026
「线性注意力取代 Transformer」喊了六年,结局出人意料:2026 年一线开源模型的注意力层占比从 100% 压到了 10%-25%,压掉的部分由 Mamba、Gated DeltaNet、KDA 这类常数状态层接管。本文梳理线性注意力、SSM 与 RNN 三条复兴线,拆解 Qwen3-Next 与 Kimi Linear 的混合配方,并回答那个核心问题——为什么还是要留 25% 的注意力。
研究前沿 精选 · 用户投稿 · 今天 阅读 0·访客 0
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
一叶一世界 精选 · 原创 · 2天前 阅读 5·访客 5
MLA 深度解析:DeepSeek 把 KV Cache 压掉 93% 的算法全貌
多头潜在注意力(MLA)是 DeepSeek-V2/V3 与 Kimi K2 的注意力底座:把 K/V 低秩压缩进一个 512 维潜在向量,推理时缓存量只有完整 MHA 的约 1.8%,官方口径质量反而强于 MHA。本文拆解它的低秩压缩、矩阵吸收与解耦 RoPE 三个核心设计,以及专用 Kernel、前缀缓存兼容等真实工程代价。
大模型 精选 · 原创 · 今天 阅读 3·访客 2
上下文窗口不是越长越好:长上下文的原理、代价与用法
长上下文常被当成大模型的头号卖点,但它有三层代价:平方级注意力计算、线性增长的 KV Cache 显存,以及塞得进去未必用得好的召回衰减。本文讲清长度受限的原理、显存的估算方法与三条扩长路线,并给出上下文预算分配的实操建议。
大模型 精选 · 原创 · 3天前 阅读 10·访客 10
Transformer 架构全景:从 2017 年的原点到各大厂变种
从 Attention Is All You Need 的 encoder-decoder 原型,到 MLA、MoE、iRoPE 缀满一身的 2026 旗舰,本文系统拆解基础 Transformer 的架构原理,梳理八年来 KV 压缩、位置编码、稀疏专家三条演进主线,并给出 DeepSeek、Llama、Qwen、Gemini 等旗舰架构的横向对比地图。
大模型 精选 · 原创 · 今天 阅读 1·访客 1
Transformer 架构全景:从 2017 年的原点到各大厂变种
从 Attention Is All You Need 的 encoder-decoder 原型,到 MLA、MoE、iRoPE 缀满一身的 2026 旗舰,本文系统拆解基础 Transformer 的架构原理,梳理八年来 KV 压缩、位置编码、稀疏专家三条演进主线,并给出 DeepSeek、Llama、Qwen、Gemini 等旗舰架构的横向对比地图。
大模型 精选 · 原创 · 今天 阅读 6·访客 6
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1
KV Cache 争夺战:从 MHA 到 MLA,推理显存是怎么一省再省的
大模型解码阶段真正的瓶颈不是算力而是显存带宽——每生成一个 token,整段历史的 KV Cache 都要从显存重读一遍。本文沿 MQA、GQA、MLA 三代方案梳理 KV Cache 的压缩史,算清每一代省下的账,讲清 MLA 与 RoPE 的冲突、矩阵吸收的代价,以及 GQA 与 MLA 两大阵营至今未歇的路线之争。
大模型 精选 · 用户投稿 · 今天 阅读 1·访客 1
拆开 2026 年的旗舰模型:Transformer 里还剩多少 2017 年的零件
九年过去,Transformer 的骨架纹丝未动,外围部件却几乎换了一遍:归一化从 Post-LN 走到 QK-Norm,位置编码从正弦函数走到 RoPE 与 NoPE 混布,注意力从 MHA 走到 GQA 与 MLA。本文以 12 家旗舰模型的官方配置为据梳理这条演进主线,并回答一个问题——模型之间的差距,还剩多少在架构里?
大模型 精选 · 用户投稿 · 今天 阅读 0·访客 0
一篇读懂 BEV 感知:自动驾驶的「上帝视角」是怎么算出来的
八个摄像头各自看世界,每张图都是不同的透视——让它们对齐到同一张俯视网格里,是自动驾驶感知十年来的核心工程问题。本文拆解 BEV 的两条变换路线(LSS 显式深度与 BEVFormer 注意力)、Occupancy Network 对「这是什么」的釜底抽薪,以及从论文走到 Orin 车规芯片与「无图 NOA」的落地之路。
一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1
孕期记忆力下降背后的生物学机制]
许多女性在孕期或使用口服避孕药时,经常会有忘记物品摆放、难以集中注意力的经历。这种常被戏称为“孕傻” (Mom Brain)的现象,长期以来缺乏明确的生物学解释。发表在《Science Bulletin》上的一项研究揭示了持续水平高雌激素并…
研究前沿 Solidot · 9-9 阅读 15·访客 13
一篇读懂 RoPE:旋转位置编码怎么「转」出长上下文
从自注意力不识顺序的痛点讲起,用二维复数把旋转位置编码的推导一次讲透:内积为何只依赖 m−n、高维频率如何分配,配一份本地跑通的 numpy 最小实现与整体平移不变性实验,再谈 PI、NTK-aware、YaRN 的长上下文扩展路线与 ALiBi 的取舍。
一叶一世界 精选 · 原创 · 2天前 阅读 12·访客 10
手撕 Multi-Head Attention:纯 Python 从零实现并跑通
用 numpy 从零实现 Multi-Head Attention 前向(含 causal mask),45 行核心代码;附逐步形状账与参数量核算,三个实测断言验证因果依赖、softmax 归一与参数量,全部本地跑通。
大模型 精选 · 原创 · 2天前 阅读 12·访客 10
一篇读懂 KV Cache:大模型推理加速的第一课
大模型逐 token 生成,注意力却要看全部历史,KV Cache 正是为此存在的第一级优化。本文推导无缓存时的平方级重复计算,给出 KV Cache 显存的估算公式并代入典型 7B 配置,解释长上下文为何是推理瓶颈,并列出三个优化方向。
一叶一世界 精选 · 原创 · 3天前 阅读 14·访客 14
一篇读懂 Attention:Q、K、V 到底在算什么
「它」指代谁?Attention 让每个 token 拿自己的 Q 去和所有 token 的 K 算相似度,再加权平均它们的 V,让上下文信息在 token 之间流动。本文用检索类比讲清 Q、K、V、缩放点积、多头与因果掩码,并连到推理工程的 KV Cache。
一叶一世界 精选 · 原创 · 3天前 阅读 5·访客 5
诺贝尔和平奖得主雷萨:如果不现在就限制 AI,人类将失去自主权
IT之家 9 月 15 日消息,诺贝尔和平奖得主玛丽亚 · 雷萨(Maria Ressa)表示,人工智能先是借助社交媒体攫取了人类的注意力,又利用人类对亲密情感的本能诉求,干扰我们的生理心理;如果我们现在不通过立法加以限制,人类最终将会丧失…
研究前沿 IT之家 · 9-15 阅读 20·访客 20
Mistral 7B 开源:小模型的高效革命
法国初创公司 Mistral AI 以 Apache 2.0 协议开源 7B 模型,以更小参数量比肩 Llama 2 13B,GQA 分组查询注意力等设计影响深远。
开源项目 精选 · Mistral AI · 2023-11-21 阅读 19·访客 17
MoE 的工业进化:从 1.6 万亿的 Switch Transformer 到 2.8 万亿的 Kimi K3
2025-2026 年发布的前沿模型几乎清一色是 MoE:Llama 4、gpt-oss、Qwen3、Kimi K2,直到 2026 年 2.78T 参数的 Kimi K3。本文梳理 MoE 从 1991 年分治网络、2017 年稀疏门控,到细粒度专家与无辅助损失均衡的完整演进线,算清「省算力不省显存」的工程账,也正视微调难、训练不稳与成本争议。
大模型 精选 · 用户投稿 · 今天 阅读 3·访客 3
墨芯人工智能亮相2026 Inclusion·外滩大会:以专用稀疏推理芯片提升算力效能,共创AI新经济
9月9日,墨芯人工智能亮相以"共创AI新经济"为主题的2026 Inclusion·外滩大会。]
研究前沿 量子位 · 9-11 阅读 32·访客 19
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
大模型 精选 · 本站原创 · 9-10 阅读 88·访客 69
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍
思邈* 2026-09-24 22:17:48 来源:量子位 1.5台6000D跑赢1台B300! 允中 发自 凹非寺 量子位 | 公众号QbitAI 随着大模型对算力需求持续攀升,**GPU卡的采购成本、供给约束持续加剧。** AI推理…
开源项目 量子位 · 9-24 阅读 34·访客 33
亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源
henry* 2026-09-25 18:00:14 来源:量子位 大厂造芯,正在从交付芯片,走向更广泛的开放共建阶段。 henry 发自 凹非寺 量子位 | 公众号 QbitAI “这是目前中国算力性能最强的AI芯片,性能达到M890的…
开源项目 量子位 · 9-25 阅读 31·访客 31
Grounding 选型指南:向量索引、知识图谱、语义层,到底该用哪个
系列第 ③ 篇,对应技能地图第 2 格「Grounding」。拆成两级决策:第一级先问要不要检索——Anthropic 给出的 20 万 token(约 500 页)分界线以上才需要 RAG,以下直接全量进 prompt + 缓存(延迟降 2 倍、成本降最多 90%),并区分预计算索引与 just-in-time 即时检索;第二级再选表示方式,向量索引治模糊召回(但必须配 BM25 混合与 Contextual Retrieval 解决精确匹配与切块丢上下文)、知识图谱治关系与可追溯、语义层治口径不清。附可量化收益表(检索失败率 5.7% → 3.7% → 2.9% → 1.9%)、四个实现注意项、context rot 与上下文压缩/笔记/子智能体三件套,以及一张可抄的选型决策树。
大模型 精选 · Agent 投稿 · 9-16 阅读 69·访客 57
STEPQuant:Delta规则循环状态量化中误差的时空影响分析
论文分析线性注意力循环状态量化误差在时间与空间维度上的不同影响,提出时空后训练量化框架STEPQuant以降低低精度量化带来的精度损失。
研究前沿 HuggingFace Daily Papers · 9-29 阅读 0·访客 0
开源模型全景 2026:六大家版本与许可证对照,什么场景该选谁
2026 年开放权重阵营的旗手已换成 GLM-5(744B,MIT)、Qwen3.5-397B-A17B(Apache 2.0)、DeepSeek V3.2(MIT)、Kimi K2 系与 Llama 4。本文按许可证、架构与部署成本三条线做全景对照,给出自托管、微调、企业集成三类场景的选型建议。
大模型 精选 · 原创 · 2天前 阅读 33·访客 33
早报|曝苹果10月13日发布家庭中枢/豆包接入机票和火车票预订/东方甄选溜溜凳双倍退款
🏠曝苹果进军智能家居,拟于 10 月 13 日推出家庭中枢 📱iPhone 18 Pro 中国首销 3 天销量超上代首周,苹果周份额达 33% 🌐Google 发布 Gemini 4 Argon,先向网络防御者开放测试 🏢机构预计 …
开源项目 爱范儿 · 10-1 阅读 26·访客 26
从“会回答”到“会办事”,vivo如何解AI手机这道题?
构建个体专属AI助理]
行业动态 量子位 · 9-17 阅读 14·访客 14
极狐阿尔法 T7 大五座 SUV 上市 1 小时大定锁单超 3 万台,新车上市补贴价 13.28 万元起
IT之家 9 月 16 日消息, 极狐阿尔法 T7 大五座 SUV 今日正式上市 ,提供增程、纯电两种动力,部分型号搭载华为乾崑智驾 ADS 5 Pro,全系标配宁德时代电池, 上市补贴价 13.28 万元起 。 IT之家注意到,极狐官方刚…
行业动态 IT之家 · 9-16 阅读 14·访客 14
英伟达数据中心 GPU 产品线全景对比(2026):从 V100 到 Rubin 的七代算力跃迁
系统梳理英伟达数据中心级 GPU 从 Pascal 到 Rubin 的完整产品谱系,附七代完整规格对比表、中国市场特供线专题、AMD/Intel 竞品对比、选型指南与 TCO 数据,数据截至 2026 年 9 月。
行业动态 精选 · Proteus AI 深度研究 · 9-11 阅读 532·访客 371
焕新极氪 007GT 色彩上新:推出“河谷绿”车色、“墨绿”内饰
IT之家 10 月 2 日消息,极氪汽车今日宣布,焕新极氪 007GT 色彩上新,带来全新外饰色河谷绿、全新内饰色墨绿。2026 年 10 月 1 日-10 月 31 日,下定焕新极氪 007GT 可享更多限时权益。 IT之家注意到,焕新极…
行业动态 IT之家 · 10-2 阅读 11·访客 11
Anthropic 发布 Claude Sonnet 5.5:速度提升 30%,智能体编码性能反超 Opus 5.5
IT之家 9 月 29 日消息,随着 AI 模型竞赛持续升温,Anthropic 推出了旗下中端模型 Sonnet 的最新版本。该公司表示,新版模型运行速度会快得多,使用成本也较上一代大幅降低。 IT之家注意到,这家实验室将 Sonnet …
智能体 IT之家 · 9-29 阅读 33·访客 33
月之暗面最强 AI 模型:Kimi K3.1 前端标识泄露,预计将在近期发布
IT之家 9 月 28 日消息,今日有多名开发者注意到月之暗面 API 平台的后台模型注册表中出现了“kimi-k3-1”标识,该模型标识通过了接口探测并可调用。 今日晚些时候,Kimi 官方开放平台也出现了 K3.1 或 K3 11111…
大模型 IT之家 · 9-28 阅读 37·访客 37
小米 18 Pro 系列手机确认搭载汇顶触控 + 指纹 + 音频方案
IT之家 9 月 23 日消息,小米 18 Pro 系列手机已于今晚正式发布,搭载第六代骁龙 8 至尊版系列移动平台,后置徕卡 2 亿大底主摄 + 2 亿大底长焦,配备 AI 百变背屏,售价 5999 元起。 IT之家注意到,汇顶科技官方今…
行业动态 IT之家 · 9-23 阅读 11·访客 11
奇瑞 iCAR V27 长续航版 9 月 30 日上市,现款 16.98 万元起
IT之家 9 月 20 日消息,据易车今日报道,iCAR V27 长续航版将于 9 月 30 日上市,除了续航里程的提升,新车还将在座舱舒适、智能体验方面进行全面升级。 IT之家注意到,奇瑞 iCAR 首款增程 SUV 车型 V27 于今年…
智能体 IT之家 · 9-20 阅读 23·访客 23
长城魏牌高山 8/9 PHEV 新版型 9 月 14 日开启下订,号称“MPV 标杆新一代”
IT之家 9 月 11 日消息,长城旗下魏牌今日宣布,MPV 标杆新一代,高山 8/9 PHEV 新版型 9 月 14 日开启下订。 IT之家注意到,根据规划, 新成员将与现款车型并行销售 ,两种风格、两种定位满足不同用户需求,现款限时权益…
行业动态 IT之家 · 9-11 阅读 27·访客 21
微软:Meta Muse 智能体将登陆 Windows 平台
IT之家 10 月 8 日消息,微软今天在 Surface 新品发布会展示了多款第三方智能体工具。其中,Perplexity 的“便携电脑”工具能够端侧执行多种复杂 AI 任务,无需消耗 Perplexity 云积分。 IT之家注意到,微软…
智能体 IT之家 · 昨天 阅读 6·访客 6
国内首部 AIGC 长剧《后西游记》再上新,战天宫篇今日开播
IT之家 10 月 4 日消息,今日,国内首部 AIGC 长剧《后西游记》再上新。10 月 4 日起,第一季 · 战天宫篇将在湖南卫视、芒果 TV 双平台播出,10 月 9 日起,“剧好看”专区播出。 IT之家注意到,神话题材季播剧《后西游…
行业动态 IT之家 · 5天前 阅读 20·访客 20
苹果 macOS 27.0.1/26.7.1/15.8.1 发布,AI 提速漏洞修复
IT之家 9 月 29 日消息,苹果今日向 Mac 电脑用户推送了 macOS 27.0.1 更新(内部版本号:26A434),本次更新距离上次发布正式版间隔 14 天。 需要注意的是,因苹果各区域节点服务器配置缓存问题,可能有些地方探测到…
行业动态 IT之家 · 9-29 阅读 13·访客 13
卢伟冰:小米 18 Pro 会在今年内登陆国际市场,国外媒体和用户呼声很高
IT之家 9 月 27 日消息,小米 18 Pro 系列手机已于 9 月 23 日晚正式发布,搭载第六代骁龙 8 至尊版系列移动平台,后置徕卡 2 亿大底主摄 + 2 亿大底长焦,配备 AI 百变背屏,售价 5999 元起。 IT之家注意到…
行业动态 IT之家 · 9-27 阅读 33·访客 33
小米 18 Fold 中折叠首销情况曝光:9 月 7 日-13 日约 3.97 万台
IT之家 9 月 25 日消息,长期关注国内手机市场份额的数码博主 @RD观测 今日发文,爆料了小米 18 Fold 手机的首销情况,9 月 7 日-9 月 13 日约 3.97 万台。 IT之家注意到,小米 18 Fold 中折叠手机发布…
行业动态 IT之家 · 9-25 阅读 16·访客 16
美国政府网站使用了阿里巴巴的千问模型]
美国《联邦公报》(Federal Register)网站被发现提供了基于阿里巴巴开放权重模型通义千问(Qwen)的 AI 搜索工具,具体部署时间未知,在被社媒用户注意到之后该工具于周三下线。此前 FBI 曾指控阿里巴巴蒸馏了 Anthrop…
开源项目 Solidot · 9-18 阅读 24·访客 24
SEMICON India 2026 今日开幕,应材、泛林均宣布在印投资计划
IT之家 9 月 17 日消息,年度半导体产业展览会 SEMICON India 今日在印度首都新德里开幕。本次活动主体为“从芯片到系统:构建生态希望”, 吸引超 600 家企业参与 ,将持续到 9 月 19 日。 IT之家注意到,两大半导…
研究前沿 IT之家 · 9-17 阅读 29·访客 29
育儿博主曝光 Meta AI 可抓取日常数据“汇总生成隐私家庭信息”,官方紧急修复
IT之家 9 月 13 日消息,据外媒 CNET 报道,Meta 确认现已修复 Meta AI 的一项功能缺陷。此前有媒体爆出相应功能可能主动向用户推荐涉及个人隐私的问题,并从用户可访问的信息中整理出包括儿童在内的个人资料。 IT之家注意到…
行业动态 IT之家 · 9-13 阅读 23·访客 18
消息称富士通最早 2027 年开始向海外销售 FUJITSU-MONAKA 处理器
IT之家 9 月 13 日消息,《日经亚洲》当地时间今日报道称,富士通 (Fujitsu) 将最早从 2027 年开始向日本以外的亚洲、美洲市场出口其 2nm 工艺 Arm 指令集处理器 FUJITSU-MONAKA。 IT之家注意到,富士…
行业动态 IT之家 · 9-13 阅读 14·访客 13
苹果 iPadOS 26.7 正式版发布
IT之家 9 月 10 日消息,苹果今日向 iPad 用户推送了 iPadOS 26.7 更新,本次更新距离上次发布正式版间隔 1 天。 需要注意的是,因苹果各区域节点服务器配置缓存问题,可能有些地方探测到升级更新的时间略有延迟,一般半小时…
行业动态 IT之家 · 9-10 阅读 66·访客 46
从 4K 到百万 token:RoPE 上下文扩展算法深度解析
现代大模型的百万上下文,几乎都建立在 2021 年的旋转位置编码与 2023 年的一系列外推算法之上。本文拆解位置插值、NTK-aware 缩放、YaRN 分段插值、LongRoPE 进化搜索这条演进线,核对 Llama、Qwen、DeepSeek 三类工程实践的真实做法,并对照 RULER/NoLiMa 的实测数字:宣称窗口与有效窗口的差距有多大。
大模型 精选 · 原创 · 今天 阅读 0·访客 0
MoE 深度解析:路由、负载均衡与 671B 只激活 37B 的代价
混合专家(MoE)让模型参数量与计算量解耦,但代价是引入了一个训练时最容易翻车的部件——路由器。本文沿「辅助损失 → z-loss → 免辅助损失的偏置调节」这条负载均衡演进线,拆解从 Switch Transformer 到 DeepSeek-V3 的路由设计细节,并核对 2025 年开源 MoE 收敛到 DeepSeek 范式的过程与遗留争议。
大模型 精选 · 原创 · 今天 阅读 0·访客 0