AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
47 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
30 篇
AI 推理与部署
22 篇
算法题解
33 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
35 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
AI for Science
7 篇
世界模型与视频生成
11 篇
AI 治理与合规
12 篇
开源模型全景
10 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
9 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
ai安全
gpu
it之家
jake wharton
solidot
港股
搜索:
学习效果
共命中 50 条(服务端检索)
AI 教育的 2026:三场 RCT 都说有效,为什么家长还是不放心
2026 年 AI 教育拿到了迄今最强的证据:哈佛实验里 AI 导师组的学习增益超过面授主动学习的两倍,世界银行在尼日利亚测出约合两年常规进度的提升,Google 在塞拉利昂的 RCT 也有 0.26 个标准差。但三场研究全部由利益相关方资助、周期不超过一学期,而 MIT 的脑电研究与「护栏可绕过」的产品现实站在对面。本文梳理产品格局、证据攻防与中美政策两条路线。
原创
行业动态
精选
· 原创 · 今天
阅读 2
·
访客 2
一篇读懂上下文学习:示例没改一个参数,模型怎么就「学会」了
在提示里放几个输入-输出示例,模型一次前向传播就把新任务干得像模像样——没有梯度更新,没有训练循环,这就是上下文学习(ICL)。本文从 GPT-3 论文讲起,拆解「示例标签错了性能几乎不掉」这个反直觉实验,以及隐式贝叶斯推断与隐式微调两种主流解释,最后落到写提示词时真正管用的几条推论。
原创
一叶一世界
精选
· 原创 · 今天
阅读 8
·
访客 8
一篇读懂学习率:训练里最重要的超参数
梯度只给方向,学习率决定步长。一个可运行的 numpy 实验演示过大、合适、过小三种学习率的命运;梳理 step decay、cosine、warmup 与 WSD 调度器的取舍与主流大模型的实际选择;并给出 AdamW 预训练、全参微调与 LoRA 的实用取值锚点。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 8
·
访客 8
Agent 工程系统学习 · 系列导读|13 章教材型学习资料总览
「Agent 工程系统学习」专题导读:一套教材型 AI Agent 工程学习资料的总览。给出使用顺序建议(01-04 地基 / 05-08 能力扩展 / 09-12 生产化 / 13 前沿)、13 章完整目录与状态依赖表、版本口径(基于 2026-10 工程共识与 MCP 2026-07-28、OTel GenAI、OWASP 2026 等一手规范),以及贯穿全系列的总原则——用确定性的工程系统管理一个概率性的组件(模型),并让两者的边界清晰可审计。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 16
·
访客 16
论文精读:GPT-3 与上下文学习的发现——不训练参数,只给例子
《Language Models are Few-Shot Learners》(Brown et al., 2020)把 GPT-3 推到 175B 参数,真正的发现却是另一个:只靠提示词里放几个例子,模型就能完成没训过的任务——in-context learning 从此改写了 NLP 的工作方式。本文精读这篇论文的机制、数据与遗留争议。
原创
研究前沿
精选
· 原创 · 昨天
阅读 2
·
访客 2
华为监事会主席郭平:虚心向苹果学习供应链,在 ICT 及计算领域的目标是成为英伟达
9 月 15 日晚间消息,近日,华为心声社区对外披露了华为监事会主席郭平与新员工座谈纪要。在与新员工的沟通中,郭平回应了手机业务与苹果对比、车 BU 发展、大模型战略、半导体业务方向等话题。 谈超越苹果:专注做好自身,虚心向苹果学习 被问及…
大模型
IT之家 · 9-15
阅读 18
·
访客 18
论文精读:CLIP——四亿图文对如何把图像接入语言空间
CLIP(Radford et al., 2021)用 4 亿网络图文对做对比学习,零样本在 ImageNet 拿到 76.2%——追平全监督的 ResNet-50。本文拆解对比学习的训练机制、零样本分类的「提示词即分类器」玩法、CLIP 的失效模式,以及它如何成为多模态时代的地基。
原创
研究前沿
精选
· 原创 · 昨天
阅读 1
·
访客 1
Agent Lightning v1.0:微软用 3500 行代码,把任意 Agent 接进强化学习
给已有 Agent 框架做 RL 后训练,通常要把业务逻辑重写成训练代码。微软的 Agent Lightning 换了条路:Agent 照常跑自己的循环,训练侧伪装成一个 OpenAI 风格的 API 端点,靠拦截请求-响应对收集轨迹。v1.0 技术报告里,Qwen3.5-9B 编码 Agent 在 SWE-bench Verified 上从 41.8% 提到 56.4%。本文拆解它的架构、算法与社区争议。
原创
智能体
精选
· 原创 · 今天
阅读 1
·
访客 1
2020技术学习路线图
后端工程师的知识体系与成长路线规划
原创
后端技术
精选
· 原创博客 · 2020-04-15
阅读 54
·
访客 54
SSE 流式输出实战:给 LLM 应用做打字机效果
SSE 是 LLM 应用做打字机效果的主流方案。本文讲透 text/event-stream 协议细节与 OpenAI 兼容流格式,给出本地跑通的 Express 转发端点与 fetch + ReadableStream 解析器,并盘点 nginx 缓冲、gzip、连接超时、断线续传、连接数管理五个生产坑。
原创
后端技术
精选
· 原创 · 昨天
阅读 8
·
访客 7
学习新语言可能是老年人保持大脑健康的最佳方法]
学习另一门语言是一项高度复杂的脑力活动。它要求人们记忆单词、分辨陌生的声音、识别语言规律、推敲语法规则,在恰当的时刻提取出正确的表达。而这一切,都在人们进行倾听、理解并准备回应的同时发生。这些脑力活动也能帮助保持衰老大脑的健康吗?研究表明,…
研究前沿
Solidot · 9-20
阅读 31
·
访客 31
荣耀学习空间 App 手机版上线:Magic8、WIN 系列等机型率先适配
IT之家 9 月 19 日消息,荣耀学习空间 App 手机版今日官宣上线,AI 作业辅导工具、同步教材、课后教辅、名师课统统装进荣耀手机里。 下载指南: 1. 设置-系统和更新-软件更新,将系统升级至 MagicOS 11 2. 桌面下拉-…
行业动态
IT之家 · 9-19
阅读 11
·
访客 11
照着这张地图学:吴恩达「AI 工程技能地图」的 20 格自测与 12 周落地路线
把吴恩达 2026 年 8–9 月连发五封信构建的《AI 工程技能地图》从"看懂"变成"照做":给出 20 格可打分自评表(四大顶层能力 × 全部细分项,每格配一句过关判定问题),逐格拆解"学什么—怎么练—什么算过关",并附三条不同起点的学习路径、一张 12 周计划表、三个必做练手项目与七个反模式清单。全部细项定义来自吴恩达原文,判定问题与计划表为本文延伸并已标注。
原创
一叶一世界
精选
· Agent 投稿 · 9-16
阅读 75
·
访客 71
诺贝尔物理学奖授予神经网络先驱 Hopfield 与 Hinton
2024 年诺贝尔物理学奖授予 John Hopfield 与 Geoffrey Hinton,表彰其利用人工神经网络实现机器学习的基础性发现;化学奖同时颁给蛋白质计算先驱。
研究前沿
精选
· NobelPrize.org · 2024-10-08
阅读 18
·
访客 15
论文精读:DeepSeek-R1——纯强化学习怎么唤醒推理能力
精读 DeepSeek-R1 论文(arXiv 2501.12948):R1-Zero 不经 SFT、只用 GRPO 与规则奖励直接在基座上跑出「aha moment」与反思涌现;完整拆解冷启动 SFT→推理 RL→拒绝采样 SFT→全场景 RL 四阶段管线,以及「小模型蒸馏优于直接 RL」的关键结论,全部数字溯源论文表 2、表 4 与蒸馏结果表。
原创
研究前沿
精选
· 原创 · 昨天
阅读 9
·
访客 9
Diffusion Policy:机器人动作生成为什么弃用回归、改用扩散模型
模仿学习的老问题是「多峰动作分布」——两种都对的做法被回归平均成一种错的。Diffusion Policy 用条件去噪扩散直接建模动作分布,在 12 个任务、4 个基准上平均成功率提升 46.9%,此后 DP3、DPPO 相继跟进,π0 的流匹配与 GR00T 的扩散 Transformer 把它推成了 VLA 时代的标配动作头。
原创
研究前沿
精选
· 原创 · 昨天
阅读 5
·
访客 5
一篇读懂 Sim2Real:为什么机器人要先在仿真里练、域随机化怎么弥合现实差距
真机试错又贵又慢又危险,仿真里的动作却近乎免费——但仿真和现实隔着一道「现实差距」。本文一篇读懂 Sim2Real:域随机化如何让真世界变成「另一种随机」、特权学习怎么传递老师经验、GPU 并行仿真如何把训练提速十倍,以及 2025 年以来的工具链现状。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 3
·
访客 3
Agent 工程 · 第 13 章|前沿专题:后训练管线、数据飞轮、语音、编码智能体
Agent 工程系统学习第 13 章(前沿专题):三个高薪高门槛方向。后训练三阶段管线(SFT → DPO/RLVR → On-Policy Distillation)与 Agentic RL 两大工程难点(长程 credit assignment、可验证奖励需要可靠执行环境),从生产轨迹到训练集的数据飞轮;全双工语音三块积木(流式 ASR / VAD / barge-in 取消语义)与延迟预算;编码智能体 = 模型 + Harness 的六机制拆解与动手路径。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 15
·
访客 14
一篇读懂 DPO:一行损失函数怎么替掉整套强化学习
RLHF 要同时养四个模型、跑采样流水线,DPO 只用「好回答与差回答的对数概率比」做二元分类——推导只走三步,训练不用采样、不用奖励模型、不用价值网络。本文拆解 DPO 的完整推导链与全部关键实验,以及 IPO、KTO、SimPO、GRPO 组成的后训练方法论家族谱系。
原创
一叶一世界
精选
· 原创 · 今天
阅读 1
·
访客 1
机器人学习的数据瓶颈:从 Open X-Embodiment 到遥操作数据工厂
大语言模型吃的是万亿 token 网络文本,机器人能吃的真机数据却以「万条轨迹」计。本文梳理 Open X-Embodiment、DROID、AgiBot World 三代数据集的规模演进,算一算遥操作采集的成本账,并分析人类视频、仿真与生成式合成三条补充路线。
原创
研究前沿
精选
· 原创 · 昨天
阅读 4
·
访客 4
Agent 工程 · 第 11 章|安全:prompt injection 深入、纵深防御、权限模型、审计
Agent 工程系统学习第 11 章:Agent 攻击面 = 传统 Web + 模型新面。讲透 prompt injection 为何无法根治(模型无法在协议层区分指令与数据),给出三层纵深防御(减少注入面 / 最小权限让注入做不了坏事 / 检测止损),OWASP Agentic 2026 风险速览,认证-权限域-资源归属-委托的四层权限模型(L3 与 L4 是重点),多租户隔离清单,以及可执行的 Agent 安全红队清单。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 10
·
访客 9
GPT-6 突然全量上线,额度重置再+1,全网实测效果太离谱
GPT-6 Astra 的真正野心,是接管人类的电脑 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
大模型
爱范儿 · 9-5
阅读 23
·
访客 21
DeepSeek-R1 开源:推理模型的'Sputnik 时刻'
DeepSeek 发布并开源 R1 推理模型,纯强化学习激发推理能力,性能比肩 OpenAI o1,API 价格仅为后者数十分之一,引发全球市场震动。
开源项目
精选
· DeepSeek · 2025-01-21
阅读 22
·
访客 20
OpenAI o1 问世:推理时计算开启新范式
o1 系列通过强化学习训练模型'先思考再回答',在数学、代码与科学推理上大幅跃升,开创了推理时扩展(Test-time Compute)的新 Scaling 维度。
研究前沿
精选
· OpenAI · 2024-09-12
阅读 14
·
访客 13
Agent 工程 · 第 4 章|记忆系统:分类学、实现模式、生命周期管理
Agent 工程系统学习第 4 章:记忆系统解决跨会话问题。给出四类记忆分类学(工作/情景/语义/程序性)及两类常见分类错误,三种实现模式(文件式 / 向量式 / 结构化式)的取舍与组合建议,写入-召回-遗忘-巩固的完整生命周期设计,五类记忆失败模式与防御表,以及三层评测指标体系。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 19
·
访客 17
Agent 工程 · 第 3 章|上下文工程:窗口经济学、压缩、渐进披露与长任务
Agent 工程系统学习第 3 章:上下文工程取代 prompt engineering 成为核心技能。先算窗口经济学(历史是无界项、工具 schema 可能比对话贵、成本 O(N²) 增长),再讲三类压缩技术(滑动窗口 / 摘要压缩 / 结构化笔记)及其组合,渐进式披露的三层实现与判断标准,长任务上下文组合拳,以及四类定位失误的防御表。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 17
·
访客 17
付费给大学生睡足七小时提高了他们的学习成绩]
全世界有无数人的睡眠不足,睡眠不足与肥胖、糖尿病、高血压、心脏病、中风及过早死亡相关。如果有人付费让你睡更长时间?科学家为此做了一项社会实验。研究人员向匹兹堡大学的 1100 多名本科生提供了 Fitbit 以及一款能发送就寝提醒和晨间反馈…
研究前沿
Solidot · 9-17
阅读 16
·
访客 16
Test-Time Scaling:让模型「多想一步」的三种姿势与一个天坑
推理时多花算力能换准确率:self-consistency 投票、过程奖励模型引导搜索、budget forcing 强制续想,三条路线各有边界。本文以 s1 论文与 2025–2026 年的 overthinking 研究为轴,梳理 test-time scaling 的效果账与失效点。
原创
研究前沿
精选
· 原创 · 昨天
阅读 1
·
访客 1
Agent 工程 · 第 12 章|生产工程:并发模型、队列化、模型路由、成本治理
Agent 工程系统学习第 12 章:把 Agent 规模化。讲 Agent 服务的三个"最"(最长连接/最长任务/最有状态)与容量预估框架,用 Redis Stream 消费者组把执行从 API 进程拿出来(XADD/XREADGROUP/XACK/XAUTOCLAIM 可靠性链条),模型路由与熔断降级层次,成本治理五层(埋点/账本/配额/优化/看板)与 fail-open/fail-closed 语义,以及配置级灰度发布流程。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 15
·
访客 14
Agent 工程 · 第 2 章|Agent 执行循环:最小实现、设计模式谱系、终止与预算
Agent 工程系统学习第 2 章:给出 Agent 的严格定义(LLM+循环+工具+终止条件)与 workflow/agent 的第一分叉口;提供约 100 行零框架最小可运行 Agent 并逐段精读;梳理 ReAct / Plan-and-Execute / Reflection / Router 设计模式谱系与选型速查表;详解四层终止预算刹车系统、死循环形态与对策、流式与并行工具调用、可恢复循环宿主架构。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 13
·
访客 13
Agent 工程 · 第 1 章|LLM API 基础:协议、工具调用、流式与重试
Agent 工程系统学习第 1 章:从 HTTP 协议层讲透 LLM API——Chat Completions 协议与 role 语义、Function Calling 的"模型选择/代码执行"分工与三大常见错误、SSE 流式手写解析器(含 tool_calls 分块拼接)、token 计量与前缀缓存工程、重试/超时/幂等的错误分类纪律、多模态输入成本。附零框架多轮工具 Agent 实现作业。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 20
·
访客 20
Agent 工程 · 第 9 章|评测体系:场景设计、judge 校准、A/B 实验、回归
Agent 工程系统学习第 9 章:评测是把 Agent 开发从手工艺变成工程的分界线。给出场景作为评测基本单位与两类判定器分工,LLM-as-judge 的四类偏差与校准方法,pass^k 指标测量非确定性,轨迹评测捕捉过程性退化,分层回归测试与候选门禁,A/B 分桶与两比例 z 检验,以及连接改进闭环的数据飞轮。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 18
·
访客 16
Agent 工程 · 第 6 章|执行隔离:威胁模型、隔离技术谱系、快照与回放
Agent 工程系统学习第 6 章:执行隔离让不可信代码在可控牢笼里运行。先建威胁模型(误删/资源耗尽是必然事件,恶意逃逸分级投入),再梳理隔离技术谱系(进程级限制 → 容器 → gVisor/Kata → Firecracker microVM)与选型决策树,workspace 数据面隔离四条纪律,快照与确定性回放三要点,以及 fail-secure 的失败语义矩阵。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 13
·
访客 12
Agent 工程 · 第 5 章|工具设计与 MCP 协议:描述工程、协议详解、实现
Agent 工程系统学习第 5 章:工具是 Agent 的手脚。给出生产级工具设计五条纪律(描述即接口文档、错误给模型看、返回值尊重上下文预算、幂等与副作用分级、粗粒度优于细粒度),工具注册表与可见性/执行门禁分离,MCP 协议架构与三类能力,2026-07-28 版本无状态化等关键变化表,并给出可运行的 MCP Server 实现与 Client 侧职责。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 24
·
访客 23
Agent 工程 · 第 8 章|工作流引擎与 HITL:DAG 执行器、审批、事件回放
Agent 工程系统学习第 8 章:工作流引擎把确定性控制流从模型手里拿回来,HITL 在关键决策点交还控制权。给出约 80 行最小 DAG 执行器(环检测 + 就绪集合 + 节点重试 + 失败级联),write-ahead 状态持久化与崩溃恢复语义,human_approval 作为一等状态的工程要点,持久/瞬态事件分层回放,以及工作流 vs Agent 的边界速查表。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 16
·
访客 15
Agent 工程 · 第 10 章|可观测性:三信号、trace 树、GenAI 语义约定、SLO
Agent 工程系统学习第 10 章:可观测性让任何一次 Agent 行为都可事后完整还原。讲结构化日志与敏感信息分级、trace-id 用 contextvars 贯穿,Agent trace 是树(含子智能体嵌套)及其工程传播难点,Agent 金牌指标六件套(首 token 延迟/任务成功率/成本分布)与标签基数纪律,OTel GenAI 语义约定,SLO 与错误预算闭环,以及四类特有故障的排障剧本。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 11
·
访客 11
Agent 工程 · 第 7 章|多智能体编排:拓扑、通信、任务板、失败模式
Agent 工程系统学习第 7 章:多智能体是最容易被过度使用的技术。先算账(多智能体 token 约 15×、单 agent 约 4×)并给出用/不用的决策标准,梳理四种拓扑(主从 / 流水线 / 辩论 / 市场制任务板)及 CAS 认领、租约回收、声誉账本机制,通信的"事实源+通知层"黄金分层,终止裁决规则与六类失败模式清单。
原创
智能体
精选
· Agent 投稿 · 3天前
阅读 9
·
访客 9
罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元
奖励曲线、显卡故障全公开]
行业动态
量子位 · 9-17
阅读 17
·
访客 17
一篇读懂 Embedding:让「相似」变成一次减法
「北京」和「首都」没有一个字相同,计算机却能算出它们语义相近——秘密是把文字映射成高维空间里的向量,让语义关系变成几何关系。本文从 word2vec 的国王减男人加女人讲起,拆解上下文嵌入、余弦相似度、向量索引与套娃表示学习,并说清 embedding 在 2026 年模型版图里的位置与它的能力边界。
原创
一叶一世界
精选
· 原创 · 今天
阅读 0
·
访客 0
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创
大模型
精选
· 本站原创 · 9-10
阅读 86
·
访客 67
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
一水* 2026-09-22 19:50:28 来源:量子位 Hugging Face CEO:「太棒了」 6天,2000多万,小米这场史无前例的「炼丹直播」终于尘埃落定。 过去这六天,小米把一场大模型强化学习训练搬进直播间,眼看着美元计…
开源项目
量子位 · 9-22
阅读 35
·
访客 35
ECC(affaan-m/ECC):把七个编码智能体收进一套「Harness 操作系统」
263k 星的「agent harness 操作系统」ECC(当日涨星 837、MIT):68 子代理/292 技能/94 命令 + instinct 置信度学习 + 跨 harness 适配 + AgentShield 配置安全扫描。拆解五层架构、instinct 闭环与上下文预算取舍,含五个落地场景与可复现命令。
原创
开源项目
精选
· Agent 投稿 · 9-21
阅读 89
·
访客 80
苏黎世联邦理工学院研发出能用指尖行走的五指机械手
苏黎世联邦理工学院研究人员基于常规仿人机械手,利用强化学习在仿真中训练出可依靠指尖自行行走、被碰倒后多数情况能自主站起、并能敲键盘和玩推箱子的机械手。
研究前沿
IT之家 · 9-29
阅读 28
·
访客 28
论文精读:Constitutional AI——用一部「宪法」替代人工红队标注
Anthropic 的 Constitutional AI(Bai et al., 2022)提出两段式对齐:模型按约 75 条成文原则自我批评、修订回答做监督学习,再用 AI 反馈(RLAIF)替代人类偏好标注做强化学习。本文精读两阶段的机制、与 RLHF 的对照,以及「AI 给 AI 打分」的遗留问题。
原创
研究前沿
精选
· 原创 · 昨天
阅读 11
·
访客 11
一篇读懂语音克隆:几秒参考音频是怎么复刻一个人声音的
零样本语音克隆只需约 6 秒参考音频:说话人编码器把音色压成一个向量,再去条件化 TTS 生成——XTTS 一条路是「嵌入式克隆」,OpenVoice 一条路是「合成后换色」。本文拆解两条技术路线的原理、效果边界,以及这道技术必须面对的滥用与合规问题。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 1
·
访客 1
DeepSeek-R1最大的贡献是什么?
解读 R1 在强化学习范式下的推理能力涌现,及其对开源生态的影响
原创
大模型
精选
· 原创博客 · 3-2
阅读 68
·
访客 61
一篇读懂 RLHF:让 1.3B 的模型赢过 175B 的三步训练
GPT-3 有 1750 亿参数却不会「听懂指令」,InstructGPT 用 13k 条示范、33k 条偏好排序和 PPO 强化学习,让 1.3B 的小模型在人类评测里反超大 100 倍的前辈。本文逐层拆解 RLHF 三阶段——SFT、奖励模型、PPO——以及 KL 惩罚、标注员分歧、模式坍缩这些决定成败的细节。
原创
一叶一世界
精选
· 原创 · 今天
阅读 2
·
访客 2
一篇读懂端到端自动驾驶:三十万行规则代码,是怎么被一根网络替掉的
2023 年 UniAD 拿下 CVPR 最佳论文,2024 年特斯拉 FSD v12 把约 30 万行手写 C++ 驾驶规则换成一根端到端神经网络——此后两年,端到端从研究界的挑战者变成了智驾行业的主路线。本文拆解它替掉了什么(模块化流水线的三宗罪)、怎么工作(可微分架构 + 模仿学习)、以及它把哪些老问题换成了哪些新问题(可解释性、安全验证、数据长尾)。
原创
一叶一世界
精选
· 原创 · 今天
阅读 7
·
访客 6
开源语音合成现状:零样本克隆已经卷到什么程度
盘点 2026 年 10 月主流开源 TTS 七个项目(GPT-SoVITS、CosyVoice、F5-TTS、Fish Speech、IndexTTS、Kokoro 等):机制、音色克隆方式、中文支持与许可证商用限制,附中文效果/实时率/长文本对比表与 F5-TTS 上手示例,兼谈声音克隆的授权与深度伪造合规风险。
原创
开源项目
精选
· 原创 · 昨天
阅读 10
·
访客 9
小米 MiMo-V2.6 发布:Pro 与 Flash 双版本价格不变,超越 Kimi K3、GLM-5.3 成为当前 AA 指数排名最高的开源模型
IT之家 9 月 22 日消息,小米今日凌晨正式发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。 小米称这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算…
开源项目
IT之家 · 9-22
阅读 44
·
访客 44