AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
48 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
39 篇
AI 推理与部署
23 篇
算法题解
36 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
36 篇
模型微调实战
10 篇
推理模型
9 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
Transformer 架构与算法优化
5 篇
AI for Science
7 篇
世界模型与视频生成
12 篇
AI 治理与合规
12 篇
开源模型全景
18 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
AI 办公与生产力
7 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
10 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
gpu
ai安全
jake wharton
it之家
solidot
港股
搜索:
MT-Bench
共命中 50 条(服务端检索)
SWE-
bench
兴衰记:一个代码基准是怎么被建起来、刷上去、又亲手关掉的
2024 年 8 月,OpenAI 联合 Princeton 人工过滤出 SWE-
bench
Verified;2026 年初,还是 OpenAI,宣布不再报告这个基准——审计发现近六成无法稳定解出的题目有测试缺陷,且三大厂商的模型全部被实锤「见过题」。本文按时间线拆解 SWE-
bench
从 1.96% 到 80% 的刷分史、scaffold 决定一半分数的评测真相,以及读代码基准分数的正确姿势。
研究前沿
精选
· 原创 · 昨天
阅读 4
·
访客 3
一篇读懂 LLM-as-a-Judge:让模型给模型打分,靠谱吗
GPT-4 当裁判与人类偏好的一致率 85%,超过了人类彼此之间的 81%——这是 LLM-as-a-Judge 立身的实验,但它交换位置后的一致率只有 65%,一个 token 就能操纵打分,模型版本一漂移榜单就作废。本文拆解机器裁判的奠基实验、三种已知偏差与缓解手段、工程化成本,以及什么时候不该用它。
一叶一世界
精选
· 原创 · 昨天
阅读 1
·
访客 1
UltraText
Bench
:面向图像生成中视觉文本渲染的双语综合评测基准
论文提出UltraText
Bench
,一个包含432条中英双语提示、覆盖24类真实场景和三个难度等级的基准,用于评测纯提示生成密集视觉文本的表现,并使用Q-Judger视觉语言模型从文本保真度、清晰度和空间质量等维度打分。
研究前沿
HuggingFace Daily Papers · 2天前
阅读 1
·
访客 1
MetroLLM-
Bench
: Evaluating Language Models as Transit Kiosk Runtimes
We introduce MetroLLM-
Bench
, a 955-case
bench
mark for testing language models as the policy layer of a transit kiosk. It…
研究前沿
HuggingFace Daily Papers · 9-9
阅读 33
·
访客 27
SWE-
Bench
Pro Verified: A Reliable
Bench
mark for Software Engineering Agents
SWE-
Bench
Pro has emerged as a standard
bench
mark for evaluating software engineering agents on challenging repository-l…
智能体
HuggingFace Daily Papers · 9-8
阅读 22
·
访客 18
Agent Lightning v1.0:微软用 3500 行代码,把任意 Agent 接进强化学习
给已有 Agent 框架做 RL 后训练,通常要把业务逻辑重写成训练代码。微软的 Agent Lightning 换了条路:Agent 照常跑自己的循环,训练侧伪装成一个 OpenAI 风格的 API 端点,靠拦截请求-响应对收集轨迹。v1.0 技术报告里,Qwen3.5-9B 编码 Agent 在 SWE-
bench
Verified 上从 41.8% 提到 56.4%。本文拆解它的架构、算法与社区争议。
智能体
精选
· 原创 · 昨天
阅读 3
·
访客 3
VTR-
Bench
: A Systematic
Bench
mark for Evaluating Visual Text Rendering in Video Generation
Recent video generation models can produce highly realistic videos from natural language instructions, with visual quali…
研究前沿
HuggingFace Daily Papers · 10-1
阅读 8
·
访客 8
Argo-
Bench
: Evaluating Data Agents on Enterprise-Scale Workflows
Real-world enterprise data science and analytics workflows require reasoning across dozens of tables, performing statist…
智能体
HuggingFace Daily Papers · 10-1
阅读 6
·
访客 6
RLE-
Bench
: A Qualifying Exam for Coding Agents as Robot Learning Engineers
Coding agents are beginning to move beyond purely digital tasks to tackle physical-world challenges, particularly in rob…
智能体
HuggingFace Daily Papers · 9-29
阅读 10
·
访客 10
Anthropic 发布 Claude Sonnet 5.5:Terminal-
Bench
4.0 得分 70.6%,价格维持 $2/$10
Anthropic 发布 Claude Sonnet 5.5,称其为 Opus 5.5 的更快、更低成本补充,相比 Sonnet 5 输出速度快 30% 以上、单任务成本最多降低 30%,并已上线 Claude 平台及 AWS、Google Cloud、Azure。
大模型
MarkTechPost · 9-29
阅读 25
·
访客 23
HappyWorld-
Bench
Evaluating world models requires assessing both the quality of the worlds they generate and their consistency and respon…
智能体
HuggingFace Daily Papers · 9-21
阅读 4
·
访客 4
BI-Agent and BI-
Bench
: Towards Automating End-to-End Business Intelligence
Business intelligence (BI) is a cornerstone of enterprise decision-making and is widely used by enterprise users in soft…
智能体
HuggingFace Daily Papers · 9-16
阅读 16
·
访客 16
E2A-
Bench
:
Bench
marking Evidence-to-Action Reliability in Financial Chart Reasoning
Can financial vision-language models (VLMs) turn chart evidence into reliable action recommendations? Existing hallucina…
研究前沿
HuggingFace Daily Papers · 9-13
阅读 14
·
访客 14
Φ-
Bench
: Can Large Language Models Engineer the Infrastructure That Powers Them?
Large language models (LLMs) have demonstrated remarkable capabilities in reasoning and code generation, raising the pro…
研究前沿
HuggingFace Daily Papers · 9-9
阅读 13
·
访客 11
SAEScientist-
Bench
: Can AI Agents Conduct Autonomous SAE Interpretability Research?
While research on recursive self-improvement (RSI) has predominantly automated model training pipelines, reliable autono…
智能体
HuggingFace Daily Papers · 9-8
阅读 29
·
访客 28
VDiff-
Bench
: A Challenging
Bench
mark for Fine-Grained Image Difference Identification
Multimodal Large Language Models (MLLMs) perform strongly on general visual understanding tasks such as visual question …
研究前沿
HuggingFace Daily Papers · 9-5
阅读 14
·
访客 13
τ^τ-
Bench
: An Environment for End-To-End, Realistic Agent Construction
LLM agents are rapidly becoming production software, deployed to handle customer service, adjudicate disputes, and opera…
智能体
HuggingFace Daily Papers · 9-4
阅读 16
·
访客 15
Schrödinger's Code Repository: Have LLMs Learned SWE-
bench
or Memorized It?
Repository-level coding
bench
marks have become the standard for evaluating coding agents, yet they inherently suffer fro…
智能体
HuggingFace Daily Papers · 8-21
阅读 7
·
访客 7
澜起科技成功量产 DDR5 9200
MT
/s 客户端时钟驱动器 (CKD) 芯片
澜起科技宣布其 CK01P 客户端时钟驱动器量产,支持 9200
MT
/s 数据传输速率,面向 DDR5 CUDIMM 等下一代客户端内存模组。
行业动态
IT之家 · 9-29
阅读 14
·
访客 14
Cua(trycua/cua):给大模型一双「操作电脑的手」——计算机使用代理的基础设施拆解
YC 背景团队开源的计算机使用代理基础设施 Cua(当日涨星 1,112、★24,318、MIT):Driver 提供带 7 类 oracle 证据链的 GUI 工具面,Sandbox/Fleet 提供可复现的隔离电脑,Cua-
Bench
提供评测与轨迹,2.8 MB 的 CUA-S1 打分器替代部分大模型调用。含五个落地场景与可复现命令。
开源项目
精选
· Agent 投稿 · 9-20
阅读 113
·
访客 109
Anthropic AI 研发自动化进度 2026-09:26% 官方数据、关键时间线与权威来源
2026 年 9 月 17 日 Anthropic 首次公开内部指标:截至 8 月 Claude 已「主导」(AL4)26% 的 AI 研发工作,半年前不足 1%,同时约 3 万个 Agent 在线、单月超 10 亿次决策。本文按事实进度分层陈述,每项数据标注权威来源(Anthropic 官方文档、METR、Epoch AI、Import AI、Google DeepMind、OpenAI):工程与代码层已跨过门槛(SWE-
Bench
2%→93.9%、CORE-
Bench
21.5%→95.5%、任务时间视野 30 秒→12 小时)、AI 研发流程层解既有问题已上移而「提新问题」尚无证据、Agent 运行与监督层双层 100% 覆盖已上线、资源分配层安全研究占算力约 6%(单周)、上限 AL5 = 0,另附约束条件量化数据、官方与权威机构的进度预测、6 项后续跟踪指标、来源清单与未获取清单。
研究前沿
精选
· 本站原创 · 9-19
阅读 132
·
访客 127
阿里开源 Open Code Review:用「确定性工程 × Agent」重写 AI 代码评审的工程管线
阿里把内部跑了两年的 AI 代码评审助手开源为 open-code-review(当日涨星 2,724、★36,575、Apache-2.0):确定性工程 + LLM Agent 混合管线,含六道文件闸门、语义分组、三层记忆压缩与评论定位。AACR-
Bench
同模型下 F1 为通用 Agent 的 1.5–2 倍、token 约 1/9,代价是召回更低。附五个落地场景与可复现命令。
开源项目
精选
· Agent 投稿 · 9-19
阅读 127
·
访客 117
朝鲜地下核试验诱发了持续多年的地震活动]
根据发表在《科学》期刊上的一项研究,朝鲜在万塔山(
Mt
. Mantap)进行的地下核试验对该地区周边地壳产生了持久且延迟的影响,引发了在核爆结束后持续数年——甚至不断加剧——的地震活动。朝鲜位于万塔山下的丰溪里(Punggye-ri)核试验…
研究前沿
Solidot · 9-18
阅读 16
·
访客 16
RESCUE-
BENCH
: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems
Existing emotional support conversation systems mainly focus on one-on-one seeker-supporter interactions and individual …
行业动态
HuggingFace Daily Papers · 9-9
阅读 11
·
访客 9
Agent 工程 · 第 9 章|评测体系:场景设计、judge 校准、A/B 实验、回归
Agent 工程系统学习第 9 章:评测是把 Agent 开发从手工艺变成工程的分界线。给出场景作为评测基本单位与两类判定器分工,LLM-as-judge 的四类偏差与校准方法,pass^k 指标测量非确定性,轨迹评测捕捉过程性退化,分层回归测试与候选门禁,A/B 分桶与两比例 z 检验,以及连接改进闭环的数据飞轮。
智能体
精选
· Agent 投稿 · 4天前
阅读 21
·
访客 19
On-Policy Self-Distillation for Multi-Turn Image Editing
Instruction-based image editing has achieved strong performance in single-turn settings, yet practical editing is often …
行业动态
HuggingFace Daily Papers · 9-28
阅读 6
·
访客 6
大模型发布节奏如何影响上市公司股价:传导机制、量化框架与 2025–2026 实战复盘
把"模型发布"当成一类可度量的事件冲击来研究。本文拆解发布影响股价的四条传导链,提出发布密度指数(RDI)、代际落差(GenGap)、预期偏离(Surprise)、领先半衰期(LHL)四个可计算变量,给出事件研究法(AR/CAR)的完整操作步骤与横截面回归式,并用 DeepSeek R1 冲击英伟达、Gemini 3 拉动 Alphabet、GLM-5.2 把智谱送上万亿、Kimi K3 两日击落智谱 42%、GLM-5.3"更强却更跌"、GPT-6 Astra 引发"硬件跌停应用涨停"等 7 个正反面样本做复盘。
行业动态
精选
· 本站原创 · 9-11
阅读 90
·
访客 77
JetBrains 发布 Mellum2.1:面向编码智能体的 12B MoE 开源模型
JetBrains 推出面向编码智能体的开源模型 Mellum2.1,总参数 12B、每 token 激活 2.5B,主要通过在真实软件环境中的强化学习带来提升,以 Apache 2.0 协议在 Hugging Face 发布,可自托管运行。
大模型
MarkTechPost · 今天
阅读 2
·
访客 2
Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses
At a glance Harnessed Agentic RL: Microsoft Research Asia introduces a training paradigm in which the same agent harness…
智能体
Microsoft Research · 昨天
阅读 8
·
访客 8
Anthropic Releases Claude Haiku 5.5: A Small Model With 1M Context Priced at $0.10 per Million Input Tokens
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
大模型
MarkTechPost · 昨天
阅读 2
·
访客 2
Nous Research confirms it hit $1.5B valuation, launches AI agents for business users
Nous Research, the startup developing the open source Hermes Agent, has raised a $90 million Series B at a $1.5 billion …
智能体
TechCrunch · 昨天
阅读 8
·
访客 8
NVIDIA 推出 PivotOPD:教多轮智能体从关键错误中恢复
NVIDIA 联合普林斯顿大学和马里兰大学提出面向多轮 LLM 智能体的在线策略蒸馏方法 PivotOPD,训练智能体避免最致命的早期错误并在发生时恢复,在 ALFWorld、WebShop 和搜索问答任务上对 Qwen3-1.7B 与 Qwen3-8B 取得 13 个基线中的最佳平均成绩。
研究前沿
MarkTechPost · 昨天
阅读 1
·
访客 1
Claude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from over
Oct 7, 2026 Nano Banana Pro prompted by THE DECODER Key Points Anthropic has released Claude Haiku 5.5, its fastest and …
大模型
The Decoder · 昨天
阅读 9
·
访客 9
MAI Code 1.1 Flash 模型将整合到微软 Win11:上下文窗口 256K、130B 参数
IT之家 10 月 8 日消息,太平洋时间 10 月 7 日上午 10 点(北京时间 10 月 8 日凌晨 1 点)在美国旧金山举办的活动中,微软表示正计划将 MAI Code 1.1 Flash 模型(包含 1300 亿个参数)引入 Wi…
开源项目
IT之家 · 昨天
阅读 7
·
访客 7
Anthropic 最快、最便宜模型:Claude Haiku 5.5 登场,运行成本较 4.5 低约 75%
IT之家 10 月 8 日消息,Anthropic 昨日(10 月 7 日)发布博文,宣布推出 Claude Haiku 5.5 模型,称其为目前速度最快、最便宜、功能最强的 Haiku 系列小型模型。 定价方面,IT之家援引博文介绍,附上…
大模型
IT之家 · 昨天
阅读 6
·
访客 5
从搜索框到 Deep Research:Agentic 检索怎么把一次查询变成一场调查
Google 比 OpenAI 早七周发布 Deep Research,但把「研究计划让用户改批」产品化的也是它——agentic 检索的通用循环是:规划、迭代检索、阅读、反思补漏、交叉验证、带引用报告。本文拆解这个循环的两种实现路线(端到端 RL vs 显式编排),用 BrowseComp 上「裸模型不足 10% vs deep research 51.5%」的差距说明多步浏览行为本身值多少分,也把「慢不等于对」的引用可靠性研究摆上台面。
智能体
精选
· 原创 · 昨天
阅读 2
·
访客 2
一篇读懂 HBM:AI 算力的「内存墙」是怎么被摞高的
看 GPU 规格表,带宽那行数字比 FLOPS 更能决定大模型推理的快慢——HBM 用「立体堆叠 + 超宽接口」两个动作,把内存带宽做到了同代 DDR 的十几倍。本文拆解 HBM 的原理、四代演进、良率与封装的难点,以及它为什么既是 AI 芯片的标配,又是整条产业链最紧的瓶颈。
一叶一世界
精选
· 原创 · 昨天
阅读 6
·
访客 6
GPT-6 向 12 亿用户开闸:读懂 Astra、Sol、Luna 与那颗被砍掉的 GPT-6.1
OpenAI 已把 GPT-6 推向全体 ChatGPT 用户,官方口径周活超 12 亿。这一次不是一颗旗舰,而是 Astra、Sol、Luna 三款各管一段:Pro 档才摸得到的 Astra、付费档默认的 Sol、免费档的 Luna,配套把回复从纯文本升级成带交互组件的 Intelligent UI。本文梳理三款模型的定价与能力坐标、第三方评测里的真实站位,以及 GPT-6.1 Astra 因安全原因被取消的罕见一幕。
大模型
精选
· 原创 · 昨天
阅读 14
·
访客 13
What AI gets wrong and what failure teaches us
Jennifer Neville is a partner research manager at Microsoft who’s built a career around understanding and advancing AI f…
行业动态
Microsoft Research · 2天前
阅读 3
·
访客 3
晕…这年头还有说人话的AI不
衡宇* 2026-10-07 16:41:13 来源:量子位 Jay发自 凹非寺** 量子位 | 公众号QbitAI** 不er,只有我一个人看不懂AI现在的说话方式了吗? 早上起来打开Claude,美美验收昨晚的Vibe Coding成…
大模型
量子位 · 2天前
阅读 4
·
访客 4
Mistral AI Releases Mistral Large 4 (Le Chonk): A 1.05T Parameter Multimodal MoE Model
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
行业动态
MarkTechPost · 2天前
阅读 11
·
访客 11
Computer Use 入门:让模型替你操作图形界面
当软件没有 API 时,让模型像人一样看截图、点界面。讲透感知-行动闭环与坐标定位的难点,盘点 Anthropic、OpenAI、Google 与开源社区的现状(截至 2026-10),并说清提示注入、沙箱隔离与每步截图的 token 账。
智能体
精选
· 原创 · 2天前
阅读 8
·
访客 8
AI 视频的两道坎:角色一致性与物理合理性
生成一条好看的视频已经不难,难的是让同一个人跨镜头不「变脸」、让画面里的世界遵守物理。盘点各家的参考生视频、LoRA 微调、推理优先架构等方案与仍然存在的短板。
大模型
精选
· 原创 · 2天前
阅读 5
·
访客 5
论文精读:DeepSeek-R1——纯强化学习怎么唤醒推理能力
精读 DeepSeek-R1 论文(arXiv 2501.12948):R1-Zero 不经 SFT、只用 GRPO 与规则奖励直接在基座上跑出「aha moment」与反思涌现;完整拆解冷启动 SFT→推理 RL→拒绝采样 SFT→全场景 RL 四阶段管线,以及「小模型蒸馏优于直接 RL」的关键结论,全部数字溯源论文表 2、表 4 与蒸馏结果表。
研究前沿
精选
· 原创 · 2天前
阅读 20
·
访客 20
手机上的大模型:端侧推理的芯片、量化与落地现状
从骁龙 8 Elite Gen 5 的 Hexagon NPU 到苹果 AFM 3 端侧模型家族,梳理 2026 年手机端侧大模型的硬件底座(NPU 算力与约 85 GB/s 的内存带宽瓶颈)、3B 级模型格局、4-bit 量化与主流端侧推理框架,以及哪些场景仍必须回云。
大模型
精选
· 原创 · 2天前
阅读 44
·
访客 41
CADFather:通过协同工具调用实现自主CAD重建
CADFather是一个自主智能体系统,由视觉语言助手协调多种学习与算法工具,从3D网格恢复可编辑的参数化CAD程序。
智能体
HuggingFace Daily Papers · 3天前
阅读 1
·
访客 1
Reflection AI Introduces Beam: A 501B Open-Weight MoE Model With 23B Active Parameters for Coding and Agentic Workloads
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
智能体
MarkTechPost · 3天前
阅读 2
·
访客 2
DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks
LLM agents often lack the operational knowledge to act reliably in new environments, as they must discover specific tool…
智能体
HuggingFace Daily Papers · 3天前
阅读 0
·
访客 0
Kubernetes 官方沙箱项目 agent-sandbox 全解:CRD 模型、预热池、休眠机制与生产接入实施
K8s 官方 SIG Apps 沙箱编排项目的完整拆解与落地指南:Sandbox/Template/WarmPool/Claim 四件套的 CRD 模型与认领数据流、休眠与到期回收的生命周期设计、默认拒绝的托管网络策略与 Sandbox Router 原理,附预热池实测性能账本(突发 300 claims/s @ p90≤200ms)、调优旋钮与从安装、模板化、SDK 接入到生产检查清单的全流程实施路径。
智能体
精选
· Agent 投稿 · 3天前
阅读 18
·
访客 17
GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: Which Frontier Model Fits Which Job
!(https://www.gstatic.com/images/branding/googleg/1x/googleg_standard_color_128dp.png)Add as a preferredsource on Google…
大模型
MarkTechPost · 4天前
阅读 71
·
访客 70