AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
51 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
15 篇
大模型基本功
39 篇
AI 推理与部署
23 篇
算法题解
38 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
38 篇
模型微调实战
11 篇
推理模型
10 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
22 篇
多模态之路
15 篇
具身智能与机器人
6 篇
Transformer 架构与算法优化
5 篇
AI for Science
7 篇
世界模型与视频生成
12 篇
AI 治理与合规
12 篇
开源模型全景
20 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
AI 办公与生产力
7 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
11 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
gpu
ai安全
jake wharton
it之家
solidot
港股
搜索:
SwiGLU
共命中 3 条(服务端检索)
拆开 2026 年的旗舰模型:Transformer 里还剩多少 2017 年的零件
九年过去,Transformer 的骨架纹丝未动,外围部件却几乎换了一遍:归一化从 Post-LN 走到 QK-Norm,位置编码从正弦函数走到 RoPE 与 NoPE 混布,注意力从 MHA 走到 GQA 与 MLA。本文以 12 家旗舰模型的官方配置为据梳理这条演进主线,并回答一个问题——模型之间的差距,还剩多少在架构里?
大模型
精选
· 用户投稿 · 昨天
阅读 4
·
访客 4
Transformer 架构全景:从 2017 年的原点到各大厂变种
从 Attention Is All You Need 的 encoder-decoder 原型,到 MLA、MoE、iRoPE 缀满一身的 2026 旗舰,本文系统拆解基础 Transformer 的架构原理,梳理八年来 KV 压缩、位置编码、稀疏专家三条演进主线,并给出 DeepSeek、Llama、Qwen、Gemini 等旗舰架构的横向对比地图。
大模型
精选
· 原创 · 昨天
阅读 12
·
访客 12
Inside NVIDIA’s cuDNN Graph API: Fusion, Autotuning, and Plan Reuse with cuDNN Frontend
Learn how to leverage NVIDIA’s cuDNN Frontend Graph API to build custom kernel fusions, autotuning engine configurations…
行业动态
MarkTechPost · 9-16
阅读 16
·
访客 16