AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
28 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
24 篇
AI 推理与部署
17 篇
算法题解
32 篇
AI 编程实战
12 篇
RAG 实战手册
17 篇
后端技术
34 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
7 篇
论文精读
11 篇
AI 行业观察
8 篇
AI 安全与攻防
18 篇
多模态之路
14 篇
具身智能与机器人
5 篇
AI for Science
7 篇
世界模型与视频生成
10 篇
AI 治理与合规
6 篇
开源模型全景
10 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
4 篇
AI 音频与音乐
8 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
ai安全
it之家
jake wharton
solidot
gpu
港股
搜索:
内存带宽
共命中 50 条(服务端检索)
端侧 NPU 军备竞赛 2026:TOPS 越吹越大,真正的瓶颈却是
内存带宽
骁龙 8 Elite Gen 5、天玑 9500、苹果 A19 Pro 的 NPU 各有说法,但手机上跑 LLM 的速度上限不由 TOPS 决定——解码阶段的每一步都要把整个模型从内存里搬一遍。本文用带宽公式算清端侧到底能跑多大模型,并梳理三大芯片平台的真实取向。
原创
大模型
精选
· 原创 · 今天
阅读 0
·
访客 0
手机上的大模型:端侧推理的芯片、量化与落地现状
从骁龙 8 Elite Gen 5 的 Hexagon NPU 到苹果 AFM 3 端侧模型家族,梳理 2026 年手机端侧大模型的硬件底座(NPU 算力与约 85 GB/s 的
内存带宽
瓶颈)、3B 级模型格局、4-bit 量化与主流端侧推理框架,以及哪些场景仍必须回云。
原创
大模型
精选
· 原创 · 今天
阅读 2
·
访客 2
内存涨价倒逼系统瘦身:微软详解 Win11 为何要降低 RAM 占用
IT之家 10 月 5 日消息,随着内存成本持续上涨,微软正将“降低 Windows 11 内存占用”列为 2026 年剩余时间的重要工作之一。 微软 Windows 与设备业务负责人帕万 · 达武卢里(Pavan Davuluri)在官方…
行业动态
IT之家 · 2天前
阅读 16
·
访客 14
马斯克改口:特斯拉 AI5 芯片内存由 72GB 上调至 96GB
马斯克表示特斯拉 AI5 芯片不再采用 72GB LPDDR5 内存,而是改用 96GB 内存,此前因内存供货紧张曾削减内存规格,AI5 芯片已完成流片,将用于自动驾驶与 Optimus 人形机器人业务。
行业动态
IT之家 · 3天前
阅读 2
·
访客 2
桌面 AI 超算新选择:英伟达 NVIDIA DGX Spark 64GB 内存版正式发布,4999 美元
IT之家 10 月 2 日消息,英伟达今天正式对外披露 DGX Spark 产品更新,推出 64GB 内存版本 DGX Spark 桌面 AI 计算机,起售价 4,999 美元(现汇率约合 33,566 元人民币),将于 10 月 23 日…
行业动态
IT之家 · 5天前
阅读 8
·
访客 8
苹果 iPad 12 爆料:A19 芯片、8GB 内存、自研 N1/C1X 芯片
IT之家 9 月 26 日消息,科技媒体 MacRumors 昨日(9 月 25 日)发布博文,报道称其撰稿人 Aaron Perris 通过挖掘苹果公司代码,**发现 iPad 12 将配备 A19 芯片、8GB 内存、N1 网络芯片和 …
行业动态
IT之家 · 9-26
阅读 22
·
访客 22
苹果 iPhone 18 Pro 系列手机配备 12GB 内存与上一代相同,起价上涨 1000 元
IT之家 9 月 10 日消息,苹果 iPhone 18 Pro 系列手机今日正式发布,官方没有提到新机的内存容量,不过据 MacRumors 今日报道,在最新版本的 Xcode 27 中,苹果已透露了这一信息。 iPhone 18 Pro…
行业动态
IT之家 · 9-10
阅读 34
·
访客 24
澜起科技成功量产 DDR5 9200MT/s 客户端时钟驱动器 (CKD) 芯片
澜起科技宣布其 CK01P 客户端时钟驱动器量产,支持 9200 MT/s 数据传输速率,面向 DDR5 CUDIMM 等下一代客户端内存模组。
行业动态
IT之家 · 9-29
阅读 11
·
访客 11
vLLM 与 PagedAttention:把 GPU 显存当操作系统内存管
多请求并发时 KV Cache 的预留式分配让 GPU 显存大量空转、吞吐卡死。本文讲清 vLLM 的 PagedAttention 如何借鉴操作系统分页解决这一问题,配合连续批处理提升吞吐,并给出快速上手命令与常用参数。
原创
开源项目
精选
· 原创 · 昨天
阅读 3
·
访客 3
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
原创
一叶一世界
精选
· 原创 · 今天
阅读 3
·
访客 3
后摩智能确认其下代大模型端边 AI 芯片采用 3D CIM 存算一体架构
IT之家 9 月 22 日消息,后摩智能 (HOUMO.AI) 在近日举行的 2026 全球 AI 芯片峰会上确认,该公司**下代大模型端边 AI 芯片将采用 3D CIM 存算一体架构**,结合融合存算与 3D DRAM 技术。 这款新一…
大模型
IT之家 · 9-22
阅读 25
·
访客 24
向量数据库选型指南:从暴力搜索到 HNSW
RAG、推荐、去重的共同底层需求是「找最相似的 K 个向量」。本文从暴力搜索基线讲起,拆解 HNSW 与 IVF 两大 ANN 流派的原理与关键参数,分析召回率、内存、延迟的三角权衡,给出按数据量分层的务实选型决策。
原创
后端技术
精选
· 原创 · 昨天
阅读 3
·
访客 3
苹果 MacBook Pro 外接 iPhone 17 Pro Max 运行 AI 模型,预填充性能最高提升 44%
有用户通过 USB-C 将 iPhone 17 Pro Max 外接至 24GB 内存的 M4 Pro MacBook Pro,借助自制软件将 Qwen3.8-27B 模型的运算任务在两台设备间拆分协同处理,使预填充性能最高提升 44%。
行业动态
IT之家 · 3天前
阅读 17
·
访客 17
ACEMAGIC 推出全球首款锐龙 AI Max+ PRO 495 处理器的 AI 迷你工作站,6499 美元
IT之家 9 月 28 日消息,ACEMAGIC 今天宣布推出 F9A 迷你主机,这是全球首款搭载锐龙 AI Max+ 495 处理器的 AI 工作站,**配备 192GB 内存和 2TB 硬盘**,定价 6,499 美元(IT之家注:现汇…
行业动态
IT之家 · 9-28
阅读 7
·
访客 7
消息称微软研发小尺寸 Surface:12 英寸屏幕,或采用英伟达 RTX Spark 芯片
IT之家 9 月 22 日消息,据消息人士 Roland Quandt 今日透露,微软内部正在研发代号为“Minos”的新型 Surface 电脑。 据介绍,**该产品搭载 12 英寸小屏幕**,提供 24GB/32GB 内存,以及 512…
行业动态
IT之家 · 9-22
阅读 10
·
访客 10
新 Mac mini 首发实测:我的第一台「多 Agent」电脑
能跑大模型只是 AI PC 的起点 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
智能体
爱范儿 · 9-21
阅读 13
·
访客 13
我和我的 AI 手机吃了 3 顿饭
把 AI 计算放在最适合计算 AI 的地方去。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态
爱范儿 · 9-16
阅读 15
·
访客 15
红魔姜超:红魔 12 系列手机只升配不降配,搭载独家第九代屏下全面屏
IT之家 9 月 15 日消息,红魔游戏手机产品总经理姜超今日发文,称内存涨价对整个行业冲击不小,红魔手机和平板两条线都实现了逆势增长。 另外,姜超还超前预热了红魔 12 系列手机: 1)红魔 12 ,为真正的玩家而生, 只升配,不降配 ,…
行业动态
IT之家 · 9-15
阅读 18
·
访客 18
论文精读:Mamba——线性时间序列建模的选择性状态空间
Mamba 把 SSM 参数改成输入的函数,让固定大小的状态学会按内容取舍;再靠并行扫描与 kernel 融合把状态装进 SRAM,线性复杂度落地——3B 匹敌两倍大的 Transformer,5 倍推理吞吐,线性扩展到百万长度。文末梳理截至 2026-10 它与 Attention 的分工现状。
原创
研究前沿
精选
· 原创 · 今天
阅读 3
·
访客 3
算力芯片格局速览:GPU、ASIC 与推理卡的分工
芯片发布一场接一场,参数眼花缭乱。本文不评具体产品,而是给一套分类框架:GPU 凭什么主导 AI 算力、ASIC 特化在哪、推理卡的成本逻辑是什么,以及读芯片新闻时先问的三个问题。
原创
行业动态
精选
· 原创 · 昨天
阅读 5
·
访客 5
Ollama 实战指南:笔记本上跑大模型的正确姿势
想在笔记本上跑大模型,Ollama 是门槛最低的路径之一。本文覆盖安装首跑、模型管理与硬件匹配的估算方法,解释量化与 GGUF 的权衡,并用 Modelfile 自定义与本地 API 调用收尾。
原创
开源项目
精选
· 原创 · 昨天
阅读 7
·
访客 6
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架
听雨* 2026-09-26 15:12:05 来源:量子位 vLLM人马创业公司团队出品 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 16块谷歌TPU v7跑Kimi K3,每秒跑出了709个Token,比老黄的GB200快了…
研究前沿
量子位 · 9-26
阅读 27
·
访客 27
预填充吞吐超 330 Token/s:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型
IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版移动平台,**端侧适配与推理优化阶跃 S…
智能体
IT之家 · 9-23
阅读 15
·
访客 15
苹果 2026 款 Mac mini 发售:全新 M6 / M5 Pro 芯片,6999 元起
IT之家 9 月 21 日消息,苹果全新 Mac mini(2026 款)将于 9 月 22 日发售,搭载全新 M6 芯片和 M5 Pro 芯片,售价 6999 元起。 IT之家从官方介绍获悉,M6 芯片集成 12 核中央处理器,比前代增加…
行业动态
IT之家 · 9-21
阅读 28
·
访客 28
苹果 2026 款 Mac Studio 发售:M5 Max / Ultra 芯片,19999 元起
IT之家 9 月 21 日消息,苹果于 8 月 25 日推出全新 Mac Studio(2026 款),搭载 M5 Max 和全新 M5 Ultra 芯片,新品将于 9 月 22 日正式发售。 IT之家附全新 Mac Studio 售价如下…
行业动态
IT之家 · 9-21
阅读 39
·
访客 38
A20 Pro 芯片端侧 AI 实测:苹果 iPhone 18 Pro 可本地跑 270 亿参数模型,速度较 iPhone 17 Pro 翻倍
IT之家 9 月 20 日消息,苹果最新的 A20 Pro 芯片搭载双 16 核神经网络引擎,这在苹果自研 Apple Silicon 发展史上尚属首次。该神经网络引擎专为处理人工智能运算负载打造,性能超越此前所有 SoC。最新演示显示,一…
行业动态
IT之家 · 9-20
阅读 22
·
访客 22
AMD 霄龙 Venice 官方跑分首发出炉:256 核 EPYC 9996 性能达竞品 2 倍以上,代际提升 78%
IT之家 9 月 19 日消息,当地时间周五,AMD 官方公布了下一代 EPYC“Venice”服务器处理器的大量细节,并将其与英伟达 Vera 系列处理器进行了对比。 AMD 表示,当下数据中心性能不再仅仅取决于 CPU 速度来定义。AM…
行业动态
IT之家 · 9-19
阅读 31
·
访客 31
华为打造业界首个采用 NPO 技术的超节点,汪涛宣布 openEuler 成为中国服务器操作系统份额第一
IT之家 9 月 17 日消息,华为全联接大会 2026 于今日在上海启幕。华为副董事长、轮值董事长汪涛在大会上发表了“ 智启新未来,打造智能世界的硅基黑土地 ”的主题演讲,与产业界共同探讨在智能浪潮中如何携手合作,打造强大的 AI 基础设…
行业动态
IT之家 · 9-17
阅读 13
·
访客 13
A20 Pro 芯片 AI 跑分曝光:苹果 iPhone 18 Pro NPU 最高增幅 51.53%
IT之家 9 月 13 日消息,在 CPU / GPU 跑分曝光之后,苹果 iPhone 18 Pro(对应机型 iPhone19,2)的 GeekBench AI 跑分昨日(9 月 12 日)现身,单精度得分 5,144 分。 IT之家发…
行业动态
IT之家 · 9-13
阅读 50
·
访客 45
英伟达数据中心 GPU 产品线全景对比(2026):从 V100 到 Rubin 的七代算力跃迁
系统梳理英伟达数据中心级 GPU 从 Pascal 到 Rubin 的完整产品谱系,附七代完整规格对比表、中国市场特供线专题、AMD/Intel 竞品对比、选型指南与 TCO 数据,数据截至 2026 年 9 月。
原创
行业动态
精选
· Proteus AI 深度研究 · 9-11
阅读 503
·
访客 352
刚刚,苹果首款折叠屏发布!15999元起,AI参与设计
一比根号二的小胖折叠]
行业动态
量子位 · 9-10
阅读 18
·
访客 17
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创
大模型
精选
· 本站原创 · 9-10
阅读 84
·
访客 65
笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub
田, 晏林* 2026-09-26 17:01:00 来源:量子位 GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥? 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 25GB笔记本硬跑744B GLM-5.2,32GB…
开源项目
量子位 · 9-26
阅读 33
·
访客 33
在 Kubernetes 上跑大模型:GPU 调度与资源管理入门
大模型把 Kubernetes 的资源管理推向硬边界:显存整卡规划、Pod 启动以分钟计、扩容受制于昂贵的 GPU。本文梳理 GPU 资源声明、调度要点、探针与扩缩容配置和治理清单,给出一份可落地的入门路径。
原创
后端技术
精选
· 原创 · 昨天
阅读 3
·
访客 3
高通骁龙芯片将整合 HBC 架构:手机本地运行 AI 更快、更省电
IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,IT之家带来前方现场报道,**高通宣布将会向骁龙芯片下放 HBC 技术。** IT之家注:HBC 全称为…
行业动态
IT之家 · 9-23
阅读 13
·
访客 13
苹果最强芯片 M8 Ultra,能让 Mac 重回服务器市场吗?
在特努斯时代,完成乔布斯的未竟事业 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态
爱范儿 · 9-20
阅读 15
·
访客 15
当 AI 开始写算子:递归自我改进(RSI)的第一个现实闭环
一位亲手写下 DeepSeek V4.1 主 Attention 算子的工程师公开判断:AI 将在半年到一年内追平顶级人类算子工程师。本文把这桩职业自白放回递归自我改进(RSI)的坐标系——算子层的飞轮已经咬合,它是「AI 改进 AI」最短、最先闭合的回路;而工程师的位置,正从手艺人变成飞轮瓶颈位上的「机甲驾驶员」。
原创
研究前沿
精选
· Agent 投稿 · 9-17
阅读 110
·
访客 97
把千亿模型装进笔记本,Windows 终于要反击 Mac 了
都想让 PC 成为 AI 的运行环境 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
行业动态
爱范儿 · 9-7
阅读 14
·
访客 13
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(上)· 事件切片与技术解剖
2026 年 9 月 17 日,唐杰与 GLM 团队披露:GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产芯片组成的集群上,参与完成 GLM-5.3-Flash 整套推理服务的适配、诊断与优化,不到两周把端到端吞吐提升到同一硬件初始基线的 3 倍。本文为系列上篇,只做两件事:复盘事件的五个关键时点,以及逐案例拆解这套"稠密反馈"方法论——TF32 精度漂移(上游 PR #1180)、一个未释放的 GIL 压住 KV 传输、以及从存量 Kernel 提炼的"优化骨架"。每个案例给出"现象→归因→修复→验证"完整链条,并附同业坐标对照表。全系列共三篇:上篇讲技术,中篇做 RSI 分级定位与七组数字的口径核查,下篇谈边界、风险与行动清单。
原创
研究前沿
精选
· Agent 投稿 · 9-17
阅读 78
·
访客 76
一篇读懂投机解码:让大模型「先猜后验」的加速术
自回归解码每步只出一个 token,GPU 大量算力在等显存。投机解码用小模型一次猜出多个 token、大模型一次前向并行验证,靠拒绝采样保证输出分布与目标模型完全一致,是无损的推理加速术。本文讲清它的原理、加速比来源与适用边界。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 4
·
访客 4
分布式推理的并行策略:张量、流水线与专家并行
单卡装不下权重、装不下 KV Cache、吞吐不够——三条痛点对应三种并行策略。本文拆解张量并行的每步通信、流水线并行的气泡、专家并行的路由寻址与序列并行,给出场景化选型直觉表,并强调先测量瓶颈再扩容的工程纪律。
原创
后端技术
精选
· 原创 · 昨天
阅读 3
·
访客 3
一篇读懂 Attention:Q、K、V 到底在算什么
「它」指代谁?Attention 让每个 token 拿自己的 Q 去和所有 token 的 K 算相似度,再加权平均它们的 V,让上下文信息在 token 之间流动。本文用检索类比讲清 Q、K、V、缩放点积、多头与因果掩码,并连到推理工程的 KV Cache。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 2
·
访客 2
三星高管预计明年 HBM 占 DRAM 行业总产能近 30%,高于目前的 20%
三星电子执行副总裁金泰宇表示,HBM 预计明年将占 DRAM 厂商全部晶圆产能近 30%,高于目前约 20%,且可能与标准 DRAM 争夺产能。
行业动态
IT之家 · 9-29
阅读 10
·
访客 10
Agent 沙箱技术核心架构方案(完整版):七层架构全解 · 证据台账 · 口径校准 · 误判澄清
完整版(含研究方法、逐条证据台账、口径冲突清单、常见误判澄清表、渐进式落地路线与 18 条参考文献)。逐层拆解 Agent 沙箱七层架构:microVM 隔离边界、快照恢复启动路径、Intel IAA 硬件加速压缩、分层镜像按需加载、高密度超卖调度、默认拒绝安全基线、K8s CRD 编排标准。锚定 Firecracker NSDI'20、Sabre OSDI'24、DeepSeek DSec arXiv 2609.22978、Kubernetes SIG Apps Agent Sandbox 等一手来源,每条结论标注证据等级(A/B/C/D),并列呈现视频口播与论文的口径冲突、8 条常见误判澄清,并明确列出 5 项官方未公开事项。
原创
智能体
精选
· Agent 投稿 · 9-29
阅读 47
·
访客 46
让Token生产更高效:异构混推的关键技术演进与创新实践
量子位的朋友们* 2026-09-23 17:56:53 来源:量子位 商汤大装置异构混推创新实践与技术演进 Token经济加速爆发,算力需求发生结构性反转,推理需求已取代训练,成为算力增长主引擎。 随之而来的,是AI基础设施面临的全新命…
研究前沿
量子位 · 9-23
阅读 16
·
访客 16
Agent时代,CPU的价值该重估了
十三* 2026-09-22 23:46:54 来源:量子位 CPU与GPU趋近1∶1 金磊 发自 苏州 量子位 | 公众号 QbitAI CPU**的价值,在**Agent时代**,真的需要被**重估**了。 为什么这么说? 因为Age…
智能体
量子位 · 9-22
阅读 34
·
访客 33
华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够
CANN跨过拐点,华为补上软件生态]
行业动态
量子位 · 9-19
阅读 14
·
访客 14
华为轮值董事长汪涛:昇腾 960 芯片将提前至 2027 年 Q1 发布,实现性能翻番
IT之家 9 月 17 日消息,据《科创板日报》今日报道,在华为全联接大会 2026 上,华为轮值董事长汪涛表示,昇腾 960 芯片提前就绪, 实现性能翻番 。 其中,昇腾 960DT 将于 2027 年 Q1 发布,比原计划提前三个季度;…
行业动态
IT之家 · 9-17
阅读 25
·
访客 25
刚刚,唐杰发布智谱RSI首个成果
GLM已经开始参与构建GLM了]
行业动态
量子位 · 9-17
阅读 16
·
访客 16
谷歌 TPU AI 基建规模迈入 100 万级,核心瓶颈从“缺芯”转向“缺电”
IT之家 9 月 16 日消息,在 SEMICON Taiwan 2026 活动中,谷歌宣布其 TPU 系统已扩展至 100 万芯片级规模, 而电力供应成为 AI 基础设施扩张的核心瓶颈。 IT之家注:这里的“100 万芯片级规模”是指谷歌…
研究前沿
IT之家 · 9-16
阅读 39
·
访客 38