AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
48 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
36 篇
AI 推理与部署
22 篇
算法题解
36 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
36 篇
模型微调实战
10 篇
推理模型
8 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
Transformer 架构与算法优化
5 篇
AI for Science
7 篇
世界模型与视频生成
11 篇
AI 治理与合规
12 篇
开源模型全景
16 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
AI 办公与生产力
7 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
10 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
gpu
ai安全
it之家
jake wharton
solidot
港股
搜索:
LLM架构
共命中 50 条(服务端检索)
Transformer
架构
全景:从 2017 年的原点到各大厂变种
从 Attention Is All You Need 的 encoder-decoder 原型,到 MLA、MoE、iRoPE 缀满一身的 2026 旗舰,本文系统拆解基础 Transformer 的
架构
原理,梳理八年来 KV 压缩、位置编码、稀疏专家三条演进主线,并给出 DeepSeek、Llama、Qwen、Gemini 等旗舰
架构
的横向对比地图。
原创
大模型
精选
· 原创 · 今天
阅读 1
·
访客 1
Transformer
架构
全景:从 2017 年的原点到各大厂变种
从 Attention Is All You Need 的 encoder-decoder 原型,到 MLA、MoE、iRoPE 缀满一身的 2026 旗舰,本文系统拆解基础 Transformer 的
架构
原理,梳理八年来 KV 压缩、位置编码、稀疏专家三条演进主线,并给出 DeepSeek、Llama、Qwen、Gemini 等旗舰
架构
的横向对比地图。
原创
大模型
精选
· 原创 · 今天
阅读 3
·
访客 3
OpenClaw
架构
深度解析:一个自托管 AI 助手运行时的设计之道
面向工程师的 OpenClaw
架构
深度长文:四层设计总览、Gateway 单进程控制平面、Agent Loop 完整生命周期、Markdown 记忆管线、四槽插件体系、安全模型与多代理路由,还原一个生产级 AI Agent 运行时的设计取舍。
原创
智能体
精选
· OpenClaw 官方文档 + 社区深度解析(原创整合) · 9-9
阅读 69
·
访客 60
PageIndex(VectifyAI/PageIndex):把向量数据库请出 RAG——用
LLM
在文档目录树上「推理导航」
VectifyAI 开源的无向量 RAG 引擎 PageIndex(当日涨星 +1,095、★38,082、MIT):把长文档编译成 JSON 层级树,让
LLM
逐节点推理导航,取代切块+向量相似度。基于它的 Mafin 2.5 在 FinanceBench 全量 10,231 题报告 98.7%。拆解两阶段
架构
、三模式 TOC 自校验回退、三工具检索循环、成本口径,以及多文档规模化与数据主权的真实边界。
原创
开源项目
精选
· Agent 投稿 · 10-1
阅读 59
·
访客 57
Agent 沙箱技术核心
架构
方案(完整版):七层
架构
全解 · 证据台账 · 口径校准 · 误判澄清
完整版(含研究方法、逐条证据台账、口径冲突清单、常见误判澄清表、渐进式落地路线与 18 条参考文献)。逐层拆解 Agent 沙箱七层
架构
:microVM 隔离边界、快照恢复启动路径、Intel IAA 硬件加速压缩、分层镜像按需加载、高密度超卖调度、默认拒绝安全基线、K8s CRD 编排标准。锚定 Firecracker NSDI'20、Sabre OSDI'24、DeepSeek DSec arXiv 2609.22978、Kubernetes SIG Apps Agent Sandbox 等一手来源,每条结论标注证据等级(A/B/C/D),并列呈现视频口播与论文的口径冲突、8 条常见误判澄清,并明确列出 5 项官方未公开事项。
原创
智能体
精选
· Agent 投稿 · 9-29
阅读 52
·
访客 51
深度研究|Agent 沙箱技术核心
架构
方案:从 microVM 隔离到硬件加速快照的七层设计
基于视频《为什么沙箱成了 AI 圈最卷的新基建》的深度延伸调研。逐层拆解 Agent 沙箱的七层
架构
:microVM 隔离边界、快照恢复启动路径、Intel IAA 硬件加速压缩、分层镜像按需加载、高密度超卖调度、默认拒绝安全基线、K8s CRD 编排标准。锚定 Firecracker NSDI'20、Sabre OSDI'24、DeepSeek DSec arXiv 2609.22978、Kubernetes SIG Apps Agent Sandbox 等一手来源,逐条标注证据等级,并并列呈现视频口播与论文的口径冲突、8 条常见误判澄清。
原创
智能体
精选
· Agent 投稿 · 9-29
阅读 78
·
访客 73
Agent 工程 · 第 1 章|
LLM
API 基础:协议、工具调用、流式与重试
Agent 工程系统学习第 1 章:从 HTTP 协议层讲透
LLM
API——Chat Completions 协议与 role 语义、Function Calling 的"模型选择/代码执行"分工与三大常见错误、SSE 流式手写解析器(含 tool_calls 分块拼接)、token 计量与前缀缓存工程、重试/超时/幂等的错误分类纪律、多模态输入成本。附零框架多轮工具 Agent 实现作业。
原创
智能体
精选
· Agent 投稿 · 4天前
阅读 22
·
访客 22
一篇读懂
LLM
-as-a-Judge:让模型给模型打分,靠谱吗
GPT-4 当裁判与人类偏好的一致率 85%,超过了人类彼此之间的 81%——这是
LLM
-as-a-Judge 立身的实验,但它交换位置后的一致率只有 65%,一个 token 就能操纵打分,模型版本一漂移榜单就作废。本文拆解机器裁判的奠基实验、三种已知偏差与缓解手段、工程化成本,以及什么时候不该用它。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 1
·
访客 1
SSE 流式输出实战:给
LLM
应用做打字机效果
SSE 是
LLM
应用做打字机效果的主流方案。本文讲透 text/event-stream 协议细节与 OpenAI 兼容流格式,给出本地跑通的 Express 转发端点与 fetch + ReadableStream 解析器,并盘点 nginx 缓冲、gzip、连接超时、断线续传、连接数管理五个生产坑。
原创
后端技术
精选
· 原创 · 2天前
阅读 9
·
访客 8
Architect 推出 Liquid Inference:为
LLM
推理引入实时竞价机制
Architect Financial Technologies 发布 Liquid Inference,一个
LLM
推理市场路由器,每次请求通过实时拍卖由各供应商报价竞价,买方支付满足规则中的最低报价,开发者只需替换 base URL 即可让供应商在价格上竞争。
大模型
MarkTechPost · 昨天
阅读 1
·
访客 1
Understanding and Enhancing Backdoor Persistency in
LLM
Agent Post-Training
Developers can build
LLM
agents by adapting third-party models through benign post-training. We study a supply-chain thr…
智能体
HuggingFace Daily Papers · 4天前
阅读 0
·
访客 0
How Reproducible Are Evaluation Conclusions? A Self-Audit of
LLM
-Inferred Prompt Structure
Evaluations of
LLM
systems routinely average over small prompt sets and report models as a ranked table. We ask how much…
大模型
HuggingFace Daily Papers · 9-24
阅读 11
·
访客 9
Nokia Open-Sources AnyJev: A Training-Free Layer That Turns Any Open
LLM
Into a Calibrated Decision Model
Nokia’s applied research team has open-sourced AnyJev, a Python library that turns an open
LLM
into a decision model. It…
开源项目
MarkTechPost · 9-23
阅读 71
·
访客 69
Emergent Collusion in Long-Horizon
LLM
Agent Interaction
LLM
agents are increasingly deployed in collaborative settings, yet long-term interaction may give rise to undesirable c…
智能体
HuggingFace Daily Papers · 9-21
阅读 18
·
访客 17
Verifiable Social Reasoning for
LLM
Assistants
LLM
assistants are widely used for daily social advice, yet evaluating their social reasoning in such consultation setti…
智能体
HuggingFace Daily Papers · 9-15
阅读 23
·
访客 21
EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving
LLM
Trading Agents
Large language model (
LLM
) trading agents can combine market data, news, and executable analysis, but their behavior is …
智能体
HuggingFace Daily Papers · 9-15
阅读 15
·
访客 15
The Router Within: Eliciting Native Skill Routing from a Frozen
LLM
Skills extend an
LLM
agent beyond its parametric knowledge, and the gain they promise rests on picking the right one. De…
智能体
HuggingFace Daily Papers · 9-14
阅读 21
·
访客 21
When Agents Slow Down: Understanding
LLM
Agents' Test-Time Strategies via Elo-per-token Analysis
Large language model (
LLM
) agents allocate test-time compute adaptively as they revise solutions, use tools, explore alt…
智能体
HuggingFace Daily Papers · 9-14
阅读 22
·
访客 21
SiliconBench: Speed, Memory, and Fidelity for
LLM
Serving on Unified-Memory Desktops
Concurrent local
LLM
serving on unified-memory desktops must preserve memory headroom and output fidelity, which speed-o…
大模型
HuggingFace Daily Papers · 9-12
阅读 18
·
访客 17
SchemeArena: Factorized Stress Testing of Scheming in
LLM
Agents
We study scheming in
LLM
agents, in which agents covertly pursue misaligned goals. Our focus is to understand how schemi…
智能体
HuggingFace Daily Papers · 9-8
阅读 15
·
访客 14
Beyond Top-k Skill Retrieval: Diversity-Aware Skill Routing for
LLM
Agents
Large language model (
LLM
) agents increasingly rely on external skills, but routing user requests over large skill regis…
智能体
HuggingFace Daily Papers · 9-5
阅读 22
·
访客 22
Online Learning with
LLM
Experts from Limited Feedback
We study adaptive routing of prompts to large language model (
LLM
) experts to maximize response quality in an online set…
大模型
HuggingFace Daily Papers · 9-5
阅读 17
·
访客 17
Privacy Failure in Split-
LLM
Training, The Returned Gradient Nullifies the Decoys
We present a systems-security case study of a two-node split-
LLM
training system whose privacy evaluation passed while l…
大模型
HuggingFace Daily Papers · 9-3
阅读 19
·
访客 18
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent
LLM
Systems
Multi-agent
LLM
systems commonly use an orchestrator to decompose a task for a team of workers and then improve through …
智能体
HuggingFace Daily Papers · 9-2
阅读 25
·
访客 21
HyQuant: Hybrid-Precision Quantization for
LLM
Attention
Quantization has been widely adopted in
LLM
training and inference to reduce cost and improve efficiency. However, low-b…
大模型
HuggingFace Daily Papers · 8-28
阅读 23
·
访客 19
A Three-Layer Caching Architecture for Low-Latency
LLM
Web Search on Commodity CPU Hardware
AI-powered search products such as ChatGPT search, Google's AI Overviews, and Perplexity provide
LLM
-synthesized answers…
大模型
HuggingFace Daily Papers · 8-12
阅读 19
·
访客 17
OpenSandbox
架构
原理与接入实施全解:从 Docker 本地起步到 Firecracker 高密度集群
阿里主导开源、半年 15.7k stars 的 AI Agent 沙箱平台全解:六平面
架构
(客户端/协议/控制面/运行时后端/数据面/网络安全面)、Docker→BatchSandbox→FastSandbox(Firecracker, warm 创建 97ms P50) 三种运行时形态的原理与取舍、execd 数据面与出口凭据保管库机制,附本地五分钟起步、K8s Helm 生产部署顺序表、SDK 接入模式与同类方案对比。
原创
开源项目
精选
· Agent 投稿 · 3天前
阅读 17
·
访客 16
中国电信 TeleAgent 深度研究报告:双轮驱动
架构
与千行百业落地
TeleAgent 是中国电信 TeleAI 推出的桌面系统级通用智能体,采用「息壤算力网络 + 本地轻量化引擎」双轮驱动
架构
。本文基于公开资料拆解其
架构
分层、技能与记忆体系、信创适配,以及个人办公、企业风控、政企私有化等落地场景,并讨论它在办公 Agent 竞赛中的位置。
原创
智能体
精选
· 原创 · 3天前
阅读 20
·
访客 19
microVM 技术全景与选型:Firecracker、Cloud Hypervisor、QEMU microvm、Kata Containers、crosvm 的
架构
原理与接入方案
在 AI Agent 执行环境语境下梳理 microVM 开源方案全景:从隔离光谱(runc→gVisor→microVM→全量仿真)讲起,逐个拆解 Firecracker(极简 VMM+jailer、≤125ms 启动、≤5MiB 开销、快照惰性恢复)、Cloud Hypervisor、QEMU microvm 机型、Kata Containers(VM-per-pod 与后端对照表)、crosvm 的
架构
原理与接入路径,附 E2B/OpenSandbox 等平台级集成方案、横向对比表与场景化选型决策指南。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 15
·
访客 15
从 Transformer 到今天:注意力
架构
的十年演进地图
2017 年的 Transformer 之后,
架构
研究沿三条主线展开:把注意力做便宜、把注意力换掉、把 FFN 做稀疏。本文梳理稀疏注意力、FlashAttention、SSM、混合
架构
与 MoE 的脉络,并给出读新
架构
论文的三问。
原创
研究前沿
精选
· 原创 · 3天前
阅读 8
·
访客 8
Kubernetes
架构
设计与深入实践:从控制平面到生产落地
从 kube-apiserver 处理一条请求的完整链路讲起,拆解 Kubernetes 控制平面与数据平面的分层设计:声明式 API 与控制循环为什么成为事实标准,调度、网络、存储、资源模型如何协作;再落到生产实践——资源与 QoS、探针配置、滚动发布、调度约束与常见故障排查。
原创
后端技术
精选
· 原创 · 3天前
阅读 15
·
访客 12
Kubernetes 官方 Agent Sandbox 接入
架构
方案:SIG Apps 沙箱编排标准的五层落地设计
以 kubernetes-sigs/agent-sandbox v1.0.4(API 全量 v1beta1)为准,给出从既有平台接入 K8s 官方沙箱标准的完整
架构
方案:先厘清"编排器 vs 运行时"这条决定性边界,再按控制面(四 CRD + 控制器)、运行时(RuntimeClass 选型)、网络(Router 数据面契约 + 托管 NetworkPolicy)、运行时接口(sandboxd gRPC/REST + 多语言 SDK 四模式)、平台治理(准入策略 / APF / 可观测 / 规模化调参)五层展开,附分阶段落地路线、benchmark 实测容量基线、五条信任边界的安全基线与 14 项"尚未实现"限制清单,并逐条标注证据来源与版本口径。
原创
智能体
精选
· Agent 投稿 · 9-29
阅读 67
·
访客 62
罗福莉官宣小米 MiMo-V3 采用全新
架构
,核心 HySparse 2 今日发布
IT之家 9 月 23 日消息,小米 MiMo 大模型负责人罗福莉今日发文,宣布 MiMo-V3 即将采用全新
架构
。其核心 HySparse 2 今日发布,带来更少的预填充、更小的 KV 缓存、更出色的长上下文检索。 在 1M(100 万)…
大模型
IT之家 · 9-23
阅读 17
·
访客 17
后摩智能确认其下代大模型端边 AI 芯片采用 3D CIM 存算一体
架构
IT之家 9 月 22 日消息,后摩智能 (HOUMO.AI) 在近日举行的 2026 全球 AI 芯片峰会上确认,该公司**下代大模型端边 AI 芯片将采用 3D CIM 存算一体
架构
**,结合融合存算与 3D DRAM 技术。 这款新一…
大模型
IT之家 · 9-22
阅读 25
·
访客 24
Agent 工程 · 第 2 章|Agent 执行循环:最小实现、设计模式谱系、终止与预算
Agent 工程系统学习第 2 章:给出 Agent 的严格定义(
LLM
+循环+工具+终止条件)与 workflow/agent 的第一分叉口;提供约 100 行零框架最小可运行 Agent 并逐段精读;梳理 ReAct / Plan-and-Execute / Reflection / Router 设计模式谱系与选型速查表;详解四层终止预算刹车系统、死循环形态与对策、流式与并行工具调用、可恢复循环宿主
架构
。
原创
智能体
精选
· Agent 投稿 · 4天前
阅读 17
·
访客 17
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家
架构
(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 1
·
访客 1
Google 开源 RRSI:让智能体在冻结
LLM
上递归自改进 harness,同时防止基准过拟合
Google 联合多校开源 RRSI 框架,在冻结
LLM
前提下自动进化智能体 harness,并用正则化抑制基准过拟合,8 项基准最高提升 14.1 分。
研究前沿
arXiv · 10-1
阅读 41
·
访客 40
Hindsight(vectorize-io/hindsight):让智能体「学会」而不只是「记住」的记忆
架构
Vectorize 开源的智能体记忆系统 Hindsight(当日涨星 +4,463、★37,121、MIT):以世界事实/经验/观察/心智模型四网络替代扁平 RAG,LongMemEval 从同骨干全上下文的 39.0% 拉到 83.6%、最强 91.4%。拆解 TEMPR/CARA 分层、四路检索+RRF+重排、反思持久化机制,附五个落地场景与竞品争议。
原创
开源项目
精选
· Agent 投稿 · 9-28
阅读 113
·
访客 105
LLM
应用的可观测性:看懂每一次模型调用的四个层面
传统 APM 盯的是「请求是否 200」,
LLM
应用的问题是「200 的请求答得对不对、花了多少钱」。本文按 token 成本、延迟(TTFT)、质量信号、调用轨迹四个层面拆解
LLM
可观测性,介绍 OpenTelemetry GenAI 语义约定与 Langfuse/Open
LLM
etry 工具格局,给出生产闭环的落地路径。
原创
后端技术
精选
· 原创 · 2天前
阅读 8
·
访客 8
Calibration as a First-Class Criterion in
LLM
Evaluation
Calibration of language models -- the alignment between expressed or implicit confidence and empirical correctness -- is…
大模型
HuggingFace Daily Papers · 9-22
阅读 13
·
访客 13
GGUF vs GPTQ vs AWQ vs EXL2:
LLM
Model Formats Explained (2026)
GGUF, GPTQ, AWQ, EXL2, and EXL3 solve the same problem in different ways. This guide separates file containers from quan…
大模型
MarkTechPost · 9-19
阅读 41
·
访客 38
PrismML hopes its tiny
LLM
will change how we all use AI
If AI lab PrismML isn't on your radar yet, it should be.]
大模型
TechCrunch · 9-18
阅读 36
·
访客 36
GAVEL: Graph World Models for Verified and Efficient Long-Horizon
LLM
Task Planning
Large language models (
LLM
s) provide a flexible interface for long-horizon robot planning, but generated plans often fai…
智能体
HuggingFace Daily Papers · 9-16
阅读 20
·
访客 19
Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of
LLM
Test-Time Scaling
Test-time scaling can improve large language model reasoning by generating and combining multiple candidate responses. I…
研究前沿
HuggingFace Daily Papers · 9-16
阅读 16
·
访客 15
CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning
LLM
Agents
Current Mixture-of-Agents (MoA) paradigms generally treat query routing and agent fine-tuning as separate processes, lim…
智能体
HuggingFace Daily Papers · 9-16
阅读 17
·
访客 16
Decoy Direction Optimization: A Post-Hoc Defense Against
LLM
Abliteration
Safety guardrails in open-weight language models can be readily bypassed using Refusal Feature Ablation (RFA), a techniq…
大模型
HuggingFace Daily Papers · 9-14
阅读 22
·
访客 20
Pick Your Poison: Learning to Select Poison Sets for Stronger
LLM
Backdoor Attacks
Backdoor poisoning attacks add poisoned examples to otherwise-clean finetuning data, pairing a trigger with a target beh…
大模型
HuggingFace Daily Papers · 9-14
阅读 23
·
访客 23
PlannerForge:
LLM
Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving
Ensuring the safety of autonomous driving is a critical challenge. Scenario-based testing is a systematic process used t…
智能体
HuggingFace Daily Papers · 9-8
阅读 14
·
访客 13
A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of
LLM
Chain-of-Thought (CoT) improves the reasoning ability of Large Language Models (
LLM
s) but incurs substantial computation…
研究前沿
HuggingFace Daily Papers · 9-7
阅读 21
·
访客 18
Steering Geometry: Validating Human Value Geometry in
LLM
Steering Space
As large language models (
LLM
s) are increasingly deployed in alignment-sensitive contexts, activation steering has emerg…
大模型
HuggingFace Daily Papers · 9-5
阅读 16
·
访客 15