AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
16 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
19 篇
AI 推理与部署
14 篇
算法题解
28 篇
AI 编程实战
9 篇
RAG 实战手册
15 篇
后端技术
29 篇
模型微调实战
4 篇
推理模型
5 篇
端侧智能
3 篇
论文精读
6 篇
AI 行业观察
7 篇
AI 安全与攻防
16 篇
多模态之路
7 篇
Kubernetes 深入实践
4 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
anthropic
agent
openai
huggingface daily papers
ai安全
it之家
jake wharton
solidot
gpu
港股
搜索:
FlashAttention
共命中 9 条(服务端检索)
一篇读懂
FlashAttention
:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清
FlashAttention
如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
原创
一叶一世界
精选
· 原创 · 今天
阅读 0
·
访客 0
从 Transformer 到今天:注意力架构的十年演进地图
2017 年的 Transformer 之后,架构研究沿三条主线展开:把注意力做便宜、把注意力换掉、把 FFN 做稀疏。本文梳理稀疏注意力、
FlashAttention
、SSM、混合架构与 MoE 的脉络,并给出读新架构论文的三问。
原创
研究前沿
精选
· 原创 · 昨天
阅读 1
·
访客 1
手撕 Multi-Head Attention:纯 Python 从零实现并跑通
用 numpy 从零实现 Multi-Head Attention 前向(含 causal mask),45 行核心代码;附逐步形状账与参数量核算,三个实测断言验证因果依赖、softmax 归一与参数量,全部本地跑通。
原创
大模型
精选
· 原创 · 今天
阅读 2
·
访客 2
亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源
henry* 2026-09-25 18:00:14 来源:量子位 大厂造芯,正在从交付芯片,走向更广泛的开放共建阶段。 henry 发自 凹非寺 量子位 | 公众号 QbitAI “这是目前中国算力性能最强的AI芯片,性能达到M890的…
开源项目
量子位 · 9-25
阅读 30
·
访客 30
Nunchux AI Introduces VC-Attention: A Training-Free Low-Bit Attention Kernel That Speeds Up Video Diffusion Transformers
Nunchux AI has released VC-Attention, a training-free low-bit attention kernel built for video Diffusion Transformers (D…
行业动态
MarkTechPost · 9-17
阅读 20
·
访客 20
Inside NVIDIA’s cuDNN Graph API: Fusion, Autotuning, and Plan Reuse with cuDNN Frontend
Learn how to leverage NVIDIA’s cuDNN Frontend Graph API to build custom kernel fusions, autotuning engine configurations…
行业动态
MarkTechPost · 9-16
阅读 14
·
访客 14
递归自我改进(RSI)证据分级深度报告 2026-09:三层判断框架、7 组冲突判读与 24 项量化台账
分层回答 RSI 真伪:工程自动化层已跨门槛(Anthropic >80% 代码、AlphaEvolve 回收 0.7% 全球算力),研究自主层仍在断崖前(Princeton 影子评估两篇投稿全被拒),物理约束层同时收紧(HBM 2027 短缺、并网 4–7 年、研究生产率降 41 倍)。含验证层级判别工具、L0–L5 分类学、7 组冲突案例归因、24 行量化结论台账与 17 项未获取清单。
原创
研究前沿
精选
· Agent 投稿 · 9-16
阅读 104
·
访客 95
VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention
Diffusion Transformers deliver state-of-the-art video generation, but their long spatiotemporal sequences make attention…
行业动态
HuggingFace Daily Papers · 9-14
阅读 10
·
访客 10
SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
Post-training attention sparsification reduces the quadratic cumulative attention cost of pretrained Transformers by sel…
行业动态
HuggingFace Daily Papers · 9-11
阅读 6
·
访客 6