搜索:verl

共命中 7 条(服务端检索)
Agent Lightning v1.0:微软用 3500 行代码,把任意 Agent 接进强化学习
给已有 Agent 框架做 RL 后训练,通常要把业务逻辑重写成训练代码。微软的 Agent Lightning 换了条路:Agent 照常跑自己的循环,训练侧伪装成一个 OpenAI 风格的 API 端点,靠拦截请求-响应对收集轨迹。v1.0 技术报告里,Qwen3.5-9B 编码 Agent 在 SWE-bench Verified 上从 41.8% 提到 56.4%。本文拆解它的架构、算法与社区争议。
智能体 精选 · 原创 · 昨天 阅读 3·访客 3
推理模型深度解析:从 o1 的豪赌到 RLVR,大模型是怎么学会「多想一会儿」的
2024 年 9 月 o1 用「先想一会儿」在 AIME 上打出 83% 对 13%,2025 年 1 月 DeepSeek-R1 把整套方法开源复现,到 2026 年 10 月,推理档位已成各大模型 API 的标准旋钮。本文沿思维链、GRPO、RLVR 到 R1 四阶段流水线,拆解推理模型的完整炼成路径,也正视「激发还是塑形」「虚假奖励」「熵坍缩」三场未完的争论。
大模型 精选 · 原创 · 今天 阅读 0·访客 0
Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses
At a glance Harnessed Agentic RL: Microsoft Research Asia introduces a training paradigm in which the same agent harness…
智能体 Microsoft Research · 昨天 阅读 8·访客 8
SGLang 上手:RadixAttention 与 vLLM 之外的推理引擎选择
RadixAttention 用前缀树跨请求复用 KV Cache,是 SGLang 的招牌。本文讲机制差异,给 OpenAI 兼容服务上手命令与结构化输出、多 LoRA、投机解码现状,并对照 vLLM/Ollama 谈选型。
开源项目 精选 · 原创 · 2天前 阅读 9·访客 9
Nereus: Adaptive Parallelism for LLM Post-Training
Reinforcement learning (RL) post-training for large language models (LLMs) coordinates multiple models across generation…
大模型 HuggingFace Daily Papers · 9-28 阅读 16·访客 15
小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型
IT之家 9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算…
开源项目 IT之家 · 9-22 阅读 44·访客 44
华为打造业界首个采用 NPO 技术的超节点,汪涛宣布 openEuler 成为中国服务器操作系统份额第一
IT之家 9 月 17 日消息,华为全联接大会 2026 于今日在上海启幕。华为副董事长、轮值董事长汪涛在大会上发表了“ 智启新未来,打造智能世界的硅基黑土地 ”的主题演讲,与产业界共同探讨在智能浪潮中如何携手合作,打造强大的 AI 基础设…
行业动态 IT之家 · 9-17 阅读 14·访客 14