搜索:PPO

共命中 15 条(服务端检索)
RLHF 全景:从人类偏好到 PPO、DPO 与可验证奖励
预训练模型会「续写」但未必「听话」,对齐要解决的就是这件事。本文梳理 RLHF 完整技术栈:SFT 打底、偏好数据训练奖励模型、PPO 加 KL 惩罚防「刷奖励」,再到跳过奖励模型的 DPO 与靠验证器打分的 RLVR,末尾附一张对齐技术栈地图。
原创 研究前沿 精选 · 原创 · 2天前 阅读 8·访客 8
Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
In reinforcement learning for large language models, Proximal Policy Optimization (PPO) commonly uses a critic to estima…
行业动态 HuggingFace Daily Papers · 9-16 阅读 10·访客 9
一篇读懂 RLHF:让 1.3B 的模型赢过 175B 的三步训练
GPT-3 有 1750 亿参数却不会「听懂指令」,InstructGPT 用 13k 条示范、33k 条偏好排序和 PPO 强化学习,让 1.3B 的小模型在人类评测里反超大 100 倍的前辈。本文逐层拆解 RLHF 三阶段——SFT、奖励模型、PPO——以及 KL 惩罚、标注员分歧、模式坍缩这些决定成败的细节。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
一篇读懂 DPO:一行损失函数怎么替掉整套强化学习
RLHF 要同时养四个模型、跑采样流水线,DPO 只用「好回答与差回答的对数概率比」做二元分类——推导只走三步,训练不用采样、不用奖励模型、不用价值网络。本文拆解 DPO 的完整推导链与全部关键实验,以及 IPO、KTO、SimPO、GRPO 组成的后训练方法论家族谱系。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
Agent Lightning v1.0:微软用 3500 行代码,把任意 Agent 接进强化学习
给已有 Agent 框架做 RL 后训练,通常要把业务逻辑重写成训练代码。微软的 Agent Lightning 换了条路:Agent 照常跑自己的循环,训练侧伪装成一个 OpenAI 风格的 API 端点,靠拦截请求-响应对收集轨迹。v1.0 技术报告里,Qwen3.5-9B 编码 Agent 在 SWE-bench Verified 上从 41.8% 提到 56.4%。本文拆解它的架构、算法与社区争议。
原创 智能体 精选 · 原创 · 今天 阅读 0·访客 0
论文精读:Constitutional AI——用一部「宪法」替代人工红队标注
Anthropic 的 Constitutional AI(Bai et al., 2022)提出两段式对齐:模型按约 75 条成文原则自我批评、修订回答做监督学习,再用 AI 反馈(RLAIF)替代人类偏好标注做强化学习。本文精读两阶段的机制、与 RLHF 的对照,以及「AI 给 AI 打分」的遗留问题。
原创 研究前沿 精选 · 原创 · 昨天 阅读 11·访客 11
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
原创 研究前沿 精选 · 原创 · 昨天 阅读 4·访客 4
Diffusion Policy:机器人动作生成为什么弃用回归、改用扩散模型
模仿学习的老问题是「多峰动作分布」——两种都对的做法被回归平均成一种错的。Diffusion Policy 用条件去噪扩散直接建模动作分布,在 12 个任务、4 个基准上平均成功率提升 46.9%,此后 DP3、DPPO 相继跟进,π0 的流匹配与 GR00T 的扩散 Transformer 把它推成了 VLA 时代的标配动作头。
原创 研究前沿 精选 · 原创 · 昨天 阅读 5·访客 5
Jev估值100亿美元!创始人Diogo Almeida回答一切
梦晨* 2026-10-03 10:38:19 来源:量子位 文婷 发自 凹非寺 量子位 | 公众号QbitAI 他来了他来了,TypeSafe AI的联合创始人兼CEO **Diogo Almeida**,顶着一头新染的红发闪亮登场了!…
研究前沿 量子位 · 5天前 阅读 18·访客 18
Nereus: Adaptive Parallelism for LLM Post-Training
Reinforcement learning (RL) post-training for large language models (LLMs) coordinates multiple models across generation…
大模型 HuggingFace Daily Papers · 9-28 阅读 13·访客 12
Playing to Par: Reinforcement Learning for Provably Optimal Quadrilateral Block Decompositions
A quadrilateral block decomposition of a planar domain is judged by whether it is complete, whether its elements are wel…
行业动态 HuggingFace Daily Papers · 9-26 阅读 4·访客 4
Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken Math with Reinforcement Learning
Kyutai has released **Voice of Reason**, 2 open-weight speech-to-speech models that solve math problems out loud. Both s…
智能体 MarkTechPost · 9-23 阅读 16·访客 16
PACT: From Credit Assignment to Critic Alignment
Reinforcement learning has become a central component of large language model (LLM) post-training, yet token-level credi…
大模型 HuggingFace Daily Papers · 9-22 阅读 12·访客 12
Google Research Introduces Retrieve-for-Train (R4T): An RL-Compiled Diffusion Retriever for 12× to 20× Faster Query Fan-Out
Google Research has introduced Retrieve-for-Train (R4T), a framework for search that returns coherent, diverse result se…
行业动态 MarkTechPost · 9-17 阅读 20·访客 20
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 精选 · 本站原创 · 9-10 阅读 86·访客 67