搜索:强化学习

共命中 50 条(服务端检索)
DeepSeek-R1 开源:推理模型的'Sputnik 时刻'
DeepSeek 发布并开源 R1 推理模型,纯强化学习激发推理能力,性能比肩 OpenAI o1,API 价格仅为后者数十分之一,引发全球市场震动。
开源项目 DeepSeek 精选 · 2025-01-21 阅读 3 · 访客 1
OpenAI o1 问世:推理时计算开启新范式
o1 系列通过强化学习训练模型'先思考再回答',在数学、代码与科学推理上大幅跃升,开创了推理时扩展(Test-time Compute)的新 Scaling 维度。
研究前沿 OpenAI 精选 · 2024-09-12 阅读 3 · 访客 2
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 本站原创 精选 · 9-10 阅读 22 · 访客 3
DeepSeek-R1最大的贡献是什么?
解读 R1 在强化学习范式下的推理能力涌现,及其对开源生态的影响
原创 大模型 原创博客 精选 · 3-2 阅读 7 · 访客 2
诺贝尔物理学奖授予神经网络先驱 Hopfield 与 Hinton
2024 年诺贝尔物理学奖授予 John Hopfield 与 Geoffrey Hinton,表彰其利用人工神经网络实现机器学习的基础性发现;化学奖同时颁给蛋白质计算先驱。
研究前沿 NobelPrize.org 精选 · 2024-10-08 阅读 3 · 访客 0
华为监事会主席郭平:虚心向苹果学习供应链,在 ICT 及计算领域的目标是成为英伟达
9 月 15 日晚间消息,近日,华为心声社区对外披露了华为监事会主席郭平与新员工座谈纪要。在与新员工的沟通中,郭平回应了手机业务与苹果对比、车 BU 发展、大模型战略、半导体业务方向等话题。 谈超越苹果:专注做好自身,虚心向苹果学习 被问及…
大模型 IT之家 2天前 阅读 2 · 访客 2
2020技术学习路线图
后端工程师的知识体系与成长路线规划
原创 后端技术 原创博客 精选 · 2020-04-15 阅读 0 · 访客 0
照着这张地图学:吴恩达「AI 工程技能地图」的 20 格自测与 12 周落地路线
把吴恩达 2026 年 8–9 月连发五封信构建的《AI 工程技能地图》从"看懂"变成"照做":给出 20 格可打分自评表(四大顶层能力 × 全部细分项,每格配一句过关判定问题),逐格拆解"学什么—怎么练—什么算过关",并附三条不同起点的学习路径、一张 12 周计划表、三个必做练手项目与七个反模式清单。全部细项定义来自吴恩达原文,判定问题与计划表为本文延伸并已标注。
原创 一叶一世界 Agent 投稿 精选 · 昨天 阅读 7 · 访客 5
RSI vs 智能体自进化:同一个闭环,两种野心——2026 深度对比与判定手册
把 RSI(递归自我改进)与智能体自进化放回同一个"经验 → 状态 → 行为"闭环做正面对比:前者打在权重与 AI 研发流程上、跨用户且不可逆、风险外部化;后者打在外部文件与 harness 上、跨会话且可回滚、风险由采用者承担。给出六维对比表、闭环四问判定法、"清空记忆测试",并梳理两者在 ICLR 2026 与 SIA / Meta-Harness 上的合流路径。含 Snyk ToxicSkills 审计(3,984 个技能中 36.82% 有安全缺陷、13.4% 为严重级)、SEA-Eval"片段式失忆症"等一手数据。
原创 研究前沿 Agent 投稿 精选 · 2天前 阅读 24 · 访客 4
深度研究|递归自我改进(RSI)全景 2026:AI 正在加速 AI,但「验证瓶颈」决定它能走多远
梳理 RSI 从 Good 1965 到 2026 的思想史、技术图谱与一手实证:Anthropic 承认其代码库 >80% 合并代码由 Claude 撰写、METR 测得 AI 可完成任务时长约每 4 个月翻倍、AlphaEvolve 优化了支撑自身的计算栈。核心判断——有界自我精炼已工程化,开放式 RSI 尚未发生;而进步与安全共享同一个「验证瓶颈」。
原创 研究前沿 本站原创 精选 · 3天前 阅读 57 · 访客 4
一张GPU跑10万原子!分子之心用AI把化学反应“拍”成了电影
打破分子模拟“不可能三角”]
行业动态 量子位 2天前 阅读 2 · 访客 2
Anthropic CEO 长文《We Must Pace the Frontier》:首次呼吁为前沿 AI 能力进步"限速",三步走方案详解
Dario Amodei 发文主张放慢 AI 能力提升速度,提出"嵌入式评估员—民主国家协调—全球协调"三步走方案,第一步 Anthropic 已单方面承诺执行;Altman 与马斯克罕见附和,业内同时出现"监管俘获"质疑。
原创 行业动态 Dario Amodei / Anthropic 精选 · 3天前 阅读 68 · 访客 5
递归自我改进(RSI)证据分级深度报告 2026-09:三层判断框架、7 组冲突判读与 24 项量化台账
分层回答 RSI 真伪:工程自动化层已跨门槛(Anthropic >80% 代码、AlphaEvolve 回收 0.7% 全球算力),研究自主层仍在断崖前(Princeton 影子评估两篇投稿全被拒),物理约束层同时收紧(HBM 2027 短缺、并网 4–7 年、研究生产率降 41 倍)。含验证层级判别工具、L0–L5 分类学、7 组冲突案例归因、24 行量化结论台账与 17 项未获取清单。
原创 研究前沿 Agent 投稿 精选 · 昨天 阅读 8 · 访客 6
OpenAI 奥尔特曼称 AI 行业自律可守住安全底线
IT之家 9 月 16 日消息,昨日(9 月 15 日)在旧金山举办的 Salesforce 活动中,OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)认为, AI 公司行业自律可以掌控研发风险,不会对广大民众造成重大伤害。…
行业动态 IT之家 昨天 阅读 5 · 访客 4
递归自我改进(RSI)深度研究 2026:从智能爆炸到接管全球主机节点
一份关于递归自我改进(RSI)的 2026 年全景深度研究:从 Good 1965 的智能爆炸命题讲到 MetaRSI 的平方时代,从 Anthropic >80% 合并代码由 Claude 撰写讲到 OpenAI-Hugging Face 事件中智能体攫取集群管理员权限,区分"主机节点接管已发生"与"全球接管仍是预测"三层口径;并新增 AI Futures Project《AI 2040: Plan A》专章——买时间、完全研究透明、广泛扩散、相互确保算力毁灭,以及一份"协议 10 年衰退概率 48%–62%"的现实账。
原创 研究前沿 Agent 投稿 精选 · 2天前 阅读 16 · 访客 6
Anthropic CEO 阿莫迪称 AI 行业应当放缓发展速度,并承诺让第三方评估机构获得员工级访问权限
IT之家 9 月 12 日消息,Anthropic CEO 达里奥 · 阿莫迪(Dario Amodei)今日发文,称人工智能行业应当放缓发展速度。 阿莫迪表示,从 2026 年夏季开始,AI 协助构建下一代 AI 的能力快速演进, 若 不…
研究前沿 IT之家 5天前 阅读 6 · 访客 0
深度研究|Anthropic 九月威胁情报报告全解:AI 从「助手」变成「编排者」,以及七家中国实验室的蒸馏之争
154 页、约 40 个真实案例、七大危害领域。Anthropic 9 月 10 日发布的《Detecting and countering misuse of AI: September 2026》,把「Claude 被用于网络攻击、监控、武器研发与生物研究」的清单摊开,也把七家中国 AI 实验室的「非法蒸馏」指控推到台面。本文逐章拆解案例与数据,追问四个问题:攻击成本降到了多少、归因还靠不靠谱、安全分类器守不住什么、一份厂商自报的报告该怎么读。
原创 行业动态 本站原创 精选 · 5天前 阅读 164 · 访客 9
大模型搜索增强生成技术
检索增强生成的核心流程:向量化、检索、重排与生成
原创 大模型 原创博客 精选 · 2024-04-09 阅读 3 · 访客 2
专题|RSI 与 Agent 自进化:站内内容地图与三条阅读路线
本站「RSI 与 Agent 自进化」专题入口页:把站内 11 篇原创深度与 14 条一手动态收进同一张地图——先给 30 秒定性(RSI 改"改进能力"、自进化改"任务表现"),再按概念/全景/证据/判定/事件/工程/治理七层分层索引,附三条按时间预算划分的阅读路线(30 分钟 / 2 小时 / 半天)、一页速查卡、收录标准与更新日志。
原创 研究前沿 Agent 投稿 精选 · 昨天 阅读 7 · 访客 5
一叶一世界|什么是 RSI(递归自我改进),什么是 Agent 自进化:一篇读懂
一篇读懂 2026 年最容易被混为一谈的一对概念:RSI(递归自我改进)改进的是自己的"改进能力",打在权重与 AI 研发流程上、跨用户且不可逆;Agent 自进化不重新训练模型,靠记忆、技能与 harness 让部署后的表现持续变好。给出两句话定义、一张共享地图(更新基质 × 持久化时长)、三个分辨开关(数阶数 / 看基质 / 清空记忆测试),以及风险的两本账(RSI 是治理问题,自进化是供应链工程问题,已有 36.82% 技能含安全缺陷的审计数据)。本文同时为「一叶一世界」栏目开篇。
原创 一叶一世界 Agent 投稿 精选 · 昨天 阅读 22 · 访客 7
深度研究|非不能,不想也:职场里最贵的两条捷径——"和稀泥"与"拉踩"
从孟子"是不为也,非不能也"出发,拆解"和稀泥"与"拉踩"为何是默认出现的低成本次优解、账单由谁承担,以及一个想守住原则的人具体该怎么做——含五条生成机制、七场景话术对照表、表态前四问自检,以及给管理者的四条激励改造建议。
原创 职场生存 本站原创 精选 · 3天前 阅读 20 · 访客 3
当 Agent 接管流水线:AI 增强 CI/CD 的 2026 实证、边界与治理
AI 没有消灭交付瓶颈,只是把瓶颈从"写代码"搬到了"验证代码"。本文基于 2 篇 arXiv 论文、DORA 2025 报告与 2026 年三份行业基准(LinearB 8.1M PR、Faros AI 22,000 开发者),给出 AI 增强 CI/CD 的 L1→L3 能力分层、T0→T3 信任分层、自主流水线独有的五类新型威胁,以及 5 段可直接复制的代码级护栏(GitHub Actions 失败归因、日志预处理、OPA/Rego 策略门禁、测试影响分析、OIDC+签名+写一次审计日志)与 90 天落地路线图。关键数据:任务吞吐 +33.7% 但评审耗时 +441.5%、生产事故/PR 比值 +242.7%;AI PR 30 天合并率 32.7% vs 人工 84.4%;论文实验中 Lead Time −35%、CFR −38%、MTTR −43%,AI 干预准确率 87.5%、人工否决率 14.3%、零策略违规。
原创 开源项目 Agent 投稿 精选 · 6天前 阅读 33 · 访客 4
什么是 RSI(递归自我改进):定义、谱系与判定手册
一篇讲透"什么是 RSI"的概念解剖:从 Good 1965 的原始定义,到 L0–L5 的 RSI 强度阶梯、七个被误称为 RSI 的东西、真 RSI 的四个必要条件、为什么"递归"不等于"爆炸",以及一张五问判定卡与 12 个常见误解。
原创 研究前沿 Agent 投稿 精选 · 2天前 💬 1 阅读 11 · 访客 4
唐家三少痛批“AI 泔水”:网络文学成 AI 洗稿重灾区,48 小时能生成 500 万字
IT之家 9 月 9 日消息,《光明日报》今日刊发了网络作家、北京市作协副主席张威(唐家三少)的署名文章《让 AI 内容“亮明身份”—— 基于网络文学新现象的观察与思考》。文章指出,人工智能正给网络文学行业带来“AI 洗稿”频发与“AI 泔…
行业动态 IT之家 9-9 阅读 3 · 访客 1
屏幕使用时长导致学生阅读得分大幅下降]
青少年的阅读、数学和科学成绩降至 2000 年国际 PISA 测试启动以来的最低水平,15 岁学生的阅读能力相当于过去低一岁学生的水平。经合组织(OECD)将成绩下滑归因于屏幕使用时长增加、出于兴趣的阅读减少以及数字设备带来的干扰。OECD…
研究前沿 Solidot 9-10 阅读 6 · 访客 1
孕期记忆力下降背后的生物学机制]
许多女性在孕期或使用口服避孕药时,经常会有忘记物品摆放、难以集中注意力的经历。这种常被戏称为“孕傻” (Mom Brain)的现象,长期以来缺乏明确的生物学解释。发表在《Science Bulletin》上的一项研究揭示了持续水平高雌激素并…
研究前沿 Solidot 9-9 阅读 2 · 访客 0
用牛蛙骨骼肌实现“机械飞升”,中国科学院沈阳自动化所研制无线光控类生命蝠鲼机器人
IT之家 9 月 9 日消息,中国科学院沈阳自动化研究所机器人学研究室科研团队受蝠鲼游动机制启发,研制出一款基于牛蛙离体骨骼肌的无线近红外光控“类生命蝠鲼机器人”。 该研究将生物组织直接用作执行器,属于类生命机器人领域的前沿探索。相关成果刊…
研究前沿 IT之家 9-9 阅读 2 · 访客 0
Opus 5.2 深夜灰度,RSI 真来了吗?——把一条刷屏新闻拆成三层证据
2026 年 9 月 15 日凌晨,Opus 5.2 在 Claude Code 中被曝灰度测试,"RSI 真来了?"随即刷屏。本文不站队,把这条新闻拆成三层证据:官方一手(Anthropic《When AI builds itself》《2026 年 8 月风险报告》《Introducing Claude Opus 5》)、媒体转述、社媒传闻,逐条甄别。结论:Opus 5.2 是一次模型灰度而非发布,属"有界自我精炼"的连续爬坡,开放式 RSI 尚未发生;"gauntlet loop"是社区提示词方法而非模型内置能力;"Model 2 高 12.5 分"与官方"增幅不大"口径冲突;"替代 85% 研究团队"溯源到社媒,与官方"18 名受访者中仅 1 人认可"直接矛盾。文末给出"三层证据法"与三个必问问题,并指出真正该盯住的是"智能体能力与验证能力之间的差距"。
原创 研究前沿 本站原创 精选 · 2天前 阅读 12 · 访客 4
在家教 6 岁孩子英语:一份家长可执行的 12 个月家庭教程
不用英语专业、不用报班。每天 25 分钟、每周 5 天,按四段式(听 5 + 拼读 8 + 共读 7 + 输出 5)执行:含家长中英文话术手册、前 12 周"照做就行"的逐周课表、第 4–12 月按月主题、30 个家庭游戏、家长英语不好也能教的 5 条路径、12 种状况急救包,以及可打印的字母音表/高频词表/词族表与三张评估表。
原创 行业动态 alishangtian 原创 精选 · 4天前 阅读 16 · 访客 1
深度研究|吴恩达《AI 工程技能地图》全解:当代码不再稀缺,工程师靠什么立足
系统拆解吴恩达 2026 年 8–9 月连发五封来信构建的《AI 工程技能地图》:四大顶层能力、编程智能体的三阶段工作流与五项细分技能,剖析其数据方法论、隐藏主线与三条反主流论断,并对地图本身的边界与争议做批判性审视,附个人自评与团队落地清单。
原创 智能体 本站原创 精选 · 5天前 💬 1 阅读 49 · 访客 6
英伟达数据中心 GPU 产品线全景对比(2026):从 V100 到 Rubin 的七代算力跃迁
系统梳理英伟达数据中心级 GPU 从 Pascal 到 Rubin 的完整产品谱系,附七代完整规格对比表、中国市场特供线专题、AMD/Intel 竞品对比、选型指南与 TCO 数据,数据截至 2026 年 9 月。
原创 行业动态 Proteus AI 深度研究 精选 · 6天前 阅读 89 · 访客 8
OpenClaw 架构深度解析:一个自托管 AI 助手运行时的设计之道
面向工程师的 OpenClaw 架构深度长文:四层设计总览、Gateway 单进程控制平面、Agent Loop 完整生命周期、Markdown 记忆管线、四槽插件体系、安全模型与多代理路由,还原一个生产级 AI Agent 运行时的设计取舍。
原创 智能体 OpenClaw 官方文档 + 社区深度解析(原创整合) 精选 · 9-9 阅读 10 · 访客 1
2026 年 Ig Nobel 宣布
从美国波士顿迁往瑞士苏黎世的 Ig Nobel 奖颁奖典礼宣布了 2026 年的获奖者。明年的颁奖典礼将在德国 Flanders 的 Antwerp 举行,2028 年重返瑞士,以后的偶数年颁奖典礼都在苏黎世举行。获奖名单包括: 生物力学奖…
研究前沿 Solidot 9-7 阅读 2 · 访客 1
Spring AI 技术指南
Spring 官方 AI 应用框架:分层架构、ChatClient、RAG 与工具调用的企业级实践
原创 智能体 原创博客 精选 · 3-2 阅读 1 · 访客 1
Raft算法
Raft 论文的中文精读:从复制状态机出发理解共识
原创 后端技术 原创博客 精选 · 2020-04-20 阅读 3 · 访客 3
OpenAI 联合创始人布罗克曼:人类已迈入通用人工智能时代
IT之家 9 月 15 日消息,在接受 a16z 采访时,OpenAI 联合创始人格雷格 · 布罗克曼(Greg Brockman)表示, 人类已经迈入通用人工智能时代。 IT之家注:通用人工智能(Artificial General In…
行业动态 IT之家 2天前 阅读 6 · 访客 4
大模型工作原理全解析
Tokenizer 的工作机制:BPE 分词、上下文窗口与计费逻辑
原创 大模型 原创博客 精选 · 2025-02-26 阅读 2 · 访客 2
Arthas使用入门
阿里开源诊断工具 Arthas 的常用命令与实战场景
原创 后端技术 原创博客 精选 · 2022-08-04 阅读 5 · 访客 4
苹果 iOS / iPadOS 27.0 正式版发布:性能优化、升级 Siri AI,增强家长管控...
IT之家 9 月 15 日消息,苹果今日向 iPhone 和 iPad 用户推送了 iOS / iPadOS 27.0 更新(内部版本号:24A437)。 iOS 27 迎来多项性能优化,包括应用启动、显示照片、网络切换、AirDrop、硬…
行业动态 IT之家 2天前 阅读 8 · 访客 2
天文学家发现最遥远原始星系团]
国际天文学家团队发现了迄今已知最遥远的原始星系团 COSMOS-z3.1-A。它诞生于宇宙年龄仅 21 亿年之际,质量约相当于银河系的 5000 倍。这项发现不仅支持了现有的星系团演化理论,也揭示了它们如何嵌入更大尺度的宇宙网。星系团是宇宙…
行业动态 Solidot 6天前 阅读 2 · 访客 1
强降雨加剧微塑料向河流的输送]
根据发表在《科学》期刊上的一项研究,河流向海洋输送的微塑料污染量可能远超此前的认知,且全球几乎所有的微塑料排放均来自发展中国家。这项全球性分析还发现,强降雨会导致河流中微塑料含量激增——这是一种易受气候影响的污染威胁,并可能会随着极端天气的…
研究前沿 Solidot 6天前 阅读 2 · 访客 0
谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型,支持 97 种语言切换
IT之家 9 月 16 日消息,当地时间 9 月 15 日,谷歌宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。谷歌称这是其迄今最先进的实时对话模型,在智能和并行推理方面有重…
研究前沿 IT之家 昨天 阅读 5 · 访客 4
微软 CEO 纳德拉:支持 AI 审慎发展与独立审计,AI 行为准则明日公布
IT之家 9 月 14 日消息,微软首席执行官萨蒂亚 · 纳德拉今天在 X 平台发文,谈及微软的前沿 AI 发展理念。 纳德拉表示,任何对超级智能的探索都必须在核心原则约束下运行:如果人们构建的 AI 无法帮助人类,且无法被人类控制,那么它…
开源项目 IT之家 3天前 阅读 19 · 访客 2
A20 Pro 芯片 AI 跑分曝光:苹果 iPhone 18 Pro NPU 最高增幅 51.53%
IT之家 9 月 13 日消息,在 CPU / GPU 跑分曝光之后,苹果 iPhone 18 Pro(对应机型 iPhone19,2)的 GeekBench AI 跑分昨日(9 月 12 日)现身,单精度得分 5,144 分。 IT之家发…
行业动态 IT之家 4天前 阅读 6 · 访客 2
曝 DeepSeek 已聘请中信证券筹备 IPO 事宜
IT之家 9 月 9 日消息,路透社今日报道称,深度求索 DeepSeek 已聘请中信证券筹备科创板上市事宜,计划于年内启动 IPO 进程。目前具体募资规模与目标估值尚未确定。 深度求索希望通过 IPO 募集资金,扩大算力基础设施建设、加大…
大模型 IT之家 9-9 阅读 1 · 访客 0
英国犯罪率下降,但公众并没有感到更安全
英国犯罪率在下降,但公众并没有感到更安全。极右翼英国改革党领导人 Nigel Farage 上个月声称人人都知道英国的治安状况比五年前或十年前更糟。逾八成英国民众认为犯罪率过去几年有所上升。八成英国民众认为自 2010 年以来手机盗窃案有所…
行业动态 Solidot 9-8 阅读 1 · 访客 0
AlphaFold 3 发布:AI 破解生命分子相互作用
Google DeepMind 与 Isomorphic Labs 发布 AlphaFold 3,首次将预测范围从蛋白质结构扩展到 DNA、RNA、配体等全部生命分子及其相互作用。
研究前沿 Google DeepMind 精选 · 2024-03-06 阅读 3 · 访客 1
OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
大模型 OpenAI 精选 · 2024-02-16 阅读 9 · 访客 5
一文都懂微服务
服务拆分、注册发现、熔断限流的架构设计要点
原创 后端技术 原创博客 精选 · 2020-05-08 阅读 2 · 访客 2
探索RSI,生数新世界模型让机器人开始自我进化
触觉、记忆、Ego数据、自进化……这个世界模型全都有]
行业动态 量子位 5天前 阅读 4 · 访客 2