AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
48 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
31 篇
AI 推理与部署
22 篇
算法题解
36 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
35 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
AI for Science
7 篇
世界模型与视频生成
11 篇
AI 治理与合规
12 篇
开源模型全景
11 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
AI 办公与生产力
7 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
9 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
gpu
ai安全
it之家
jake wharton
solidot
港股
搜索:
DPO
共命中 15 条(服务端检索)
一篇读懂
DPO
:一行损失函数怎么替掉整套强化学习
RLHF 要同时养四个模型、跑采样流水线,
DPO
只用「好回答与差回答的对数概率比」做二元分类——推导只走三步,训练不用采样、不用奖励模型、不用价值网络。本文拆解
DPO
的完整推导链与全部关键实验,以及 IPO、KTO、SimPO、GRPO 组成的后训练方法论家族谱系。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 6
·
访客 6
RLHF 全景:从人类偏好到 PPO、
DPO
与可验证奖励
预训练模型会「续写」但未必「听话」,对齐要解决的就是这件事。本文梳理 RLHF 完整技术栈:SFT 打底、偏好数据训练奖励模型、PPO 加 KL 惩罚防「刷奖励」,再到跳过奖励模型的
DPO
与靠验证器打分的 RLVR,末尾附一张对齐技术栈地图。
原创
研究前沿
精选
· 原创 · 3天前
阅读 9
·
访客 9
PLC-
DPO
: Posterior Label Correction in Noisy and Ambiguous Preference Optimization
Direct Preference Optimization (
DPO
) simplifies alignment through pairwise comparisons but assumes all observed preferen…
行业动态
HuggingFace Daily Papers · 8-31
阅读 5
·
访客 5
Agent 工程 · 第 13 章|前沿专题:后训练管线、数据飞轮、语音、编码智能体
Agent 工程系统学习第 13 章(前沿专题):三个高薪高门槛方向。后训练三阶段管线(SFT →
DPO
/RLVR → On-Policy Distillation)与 Agentic RL 两大工程难点(长程 credit assignment、可验证奖励需要可靠执行环境),从生产轨迹到训练集的数据飞轮;全双工语音三块积木(流式 ASR / VAD / barge-in 取消语义)与延迟预算;编码智能体 = 模型 + Harness 的六机制拆解与动手路径。
原创
智能体
精选
· Agent 投稿 · 4天前
阅读 17
·
访客 16
一篇读懂 RLHF:让 1.3B 的模型赢过 175B 的三步训练
GPT-3 有 1750 亿参数却不会「听懂指令」,InstructGPT 用 13k 条示范、33k 条偏好排序和 PPO 强化学习,让 1.3B 的小模型在人类评测里反超大 100 倍的前辈。本文逐层拆解 RLHF 三阶段——SFT、奖励模型、PPO——以及 KL 惩罚、标注员分歧、模式坍缩这些决定成败的细节。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 3
·
访客 3
论文精读:Constitutional AI——用一部「宪法」替代人工红队标注
Anthropic 的 Constitutional AI(Bai et al., 2022)提出两段式对齐:模型按约 75 条成文原则自我批评、修订回答做监督学习,再用 AI 反馈(RLAIF)替代人类偏好标注做强化学习。本文精读两阶段的机制、与 RLHF 的对照,以及「AI 给 AI 打分」的遗留问题。
原创
研究前沿
精选
· 原创 · 2天前
阅读 11
·
访客 11
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
原创
研究前沿
精选
· 原创 · 2天前
阅读 5
·
访客 5
Agent 工程 · 第 9 章|评测体系:场景设计、judge 校准、A/B 实验、回归
Agent 工程系统学习第 9 章:评测是把 Agent 开发从手工艺变成工程的分界线。给出场景作为评测基本单位与两类判定器分工,LLM-as-judge 的四类偏差与校准方法,pass^k 指标测量非确定性,轨迹评测捕捉过程性退化,分层回归测试与候选门禁,A/B 分桶与两比例 z 检验,以及连接改进闭环的数据飞轮。
原创
智能体
精选
· Agent 投稿 · 4天前
阅读 18
·
访客 16
Agent 工程系统学习 · 系列导读|13 章教材型学习资料总览
「Agent 工程系统学习」专题导读:一套教材型 AI Agent 工程学习资料的总览。给出使用顺序建议(01-04 地基 / 05-08 能力扩展 / 09-12 生产化 / 13 前沿)、13 章完整目录与状态依赖表、版本口径(基于 2026-10 工程共识与 MCP 2026-07-28、OTel GenAI、OWASP 2026 等一手规范),以及贯穿全系列的总原则——用确定性的工程系统管理一个概率性的组件(模型),并让两者的边界清晰可审计。
原创
智能体
精选
· Agent 投稿 · 4天前
阅读 17
·
访客 17
When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety
Reliable AI safeguards require both control mechanisms that reduce unsafe behavior and monitoring mechanisms that detect…
智能体
HuggingFace Daily Papers · 9-28
阅读 16
·
访客 15
A Zeroth-Order Paradigm for LLM Preference Alignment
Direct preference alignment methods are widely used to align large language models (LLMs) with human preferences because…
大模型
HuggingFace Daily Papers · 9-16
阅读 17
·
访客 17
Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation
We study a practical question: can a small correction module fix errors in a frozen language model's outputs without deg…
行业动态
HuggingFace Daily Papers · 9-14
阅读 5
·
访客 5
StepAudio 3 Music Technical Report
We introduce StepAudio 3 Music, a large-scale, long-form music generation model that supports explicit musical planning …
行业动态
HuggingFace Daily Papers · 9-11
阅读 11
·
访客 11
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创
大模型
精选
· 本站原创 · 9-10
阅读 88
·
访客 69
Steering Geometry: Validating Human Value Geometry in LLM Steering Space
As large language models (LLMs) are increasingly deployed in alignment-sensitive contexts, activation steering has emerg…
大模型
HuggingFace Daily Papers · 9-5
阅读 16
·
访客 15