AI 资讯 知识库 前沿研究

前沿研究

论文 · 世界模型 · 具身智能 · 多模态 · AI4S

AI 前沿研究追踪:论文精读、世界模型与视频生成、AI 数学、AI for Science、具身智能与机器人、多模态。

已收录 49 篇 · 持续更新 · 最近更新 2026-10-07 · 人工编排
论文精读 11 篇
论文精读:Constitutional AI——用一部「宪法」替代人工红队标注
Anthropic 的 Constitutional AI(Bai et al., 2022)提出两段式对齐:模型按约 75 条成文原则自我批评、修订回答做监督学习,再用 AI 反馈(RLAIF)替代人类偏好标注做强化学习。本文精读两阶段的机制、与 RLHF 的对照,以及「AI 给 AI 打分」的遗留问题。
研究前沿 精选 · 原创 · 4天前 阅读 28·访客 28
论文精读:GPT-3 与上下文学习的发现——不训练参数,只给例子
《Language Models are Few-Shot Learners》(Brown et al., 2020)把 GPT-3 推到 175B 参数,真正的发现却是另一个:只靠提示词里放几个例子,模型就能完成没训过的任务——in-context learning 从此改写了 NLP 的工作方式。本文精读这篇论文的机制、数据与遗留争议。
研究前沿 精选 · 原创 · 4天前 阅读 10·访客 10
论文精读:CLIP——四亿图文对如何把图像接入语言空间
CLIP(Radford et al., 2021)用 4 亿网络图文对做对比学习,零样本在 ImageNet 拿到 76.2%——追平全监督的 ResNet-50。本文拆解对比学习的训练机制、零样本分类的「提示词即分类器」玩法、CLIP 的失效模式,以及它如何成为多模态时代的地基。
研究前沿 精选 · 原创 · 4天前 阅读 13·访客 13
Scaling Laws 十问十答:算力、数据与参数的交换律
以十个问答讲清 Scaling Laws:幂律为什么可外推、Chinchilla 如何修正参数与数据的配比、6ND 公式怎么当算力换算器、数据枯竭与推理时算力这两条新变量,以及这门「经验定律」对大公司与创业者的不同含义。
研究前沿 精选 · 原创 · 5天前 阅读 63·访客 63
RLHF 全景:从人类偏好到 PPO、DPO 与可验证奖励
预训练模型会「续写」但未必「听话」,对齐要解决的就是这件事。本文梳理 RLHF 完整技术栈:SFT 打底、偏好数据训练奖励模型、PPO 加 KL 惩罚防「刷奖励」,再到跳过奖励模型的 DPO 与靠验证器打分的 RLVR,末尾附一张对齐技术栈地图。
研究前沿 精选 · 原创 · 5天前 阅读 36·访客 36
思维链为什么有效:推理时计算的研究脉络
「让我们一步步思考」为什么能让模型答对更多题?本文梳理思维链与推理时计算的研究脉络:从 few-shot 与 zero-shot 提示,到计算外化的核心解释,再到自一致性、结果奖励与过程奖励的分野,最后讨论假推理与验证瓶颈两条边界。
研究前沿 精选 · 原创 · 5天前 阅读 21·访客 21
从 Transformer 到今天:注意力架构的十年演进地图
2017 年的 Transformer 之后,架构研究沿三条主线展开:把注意力做便宜、把注意力换掉、把 FFN 做稀疏。本文梳理稀疏注意力、FlashAttention、SSM、混合架构与 MoE 的脉络,并给出读新架构论文的三问。
研究前沿 精选 · 原创 · 5天前 阅读 19·访客 19
论文精读:Mamba——线性时间序列建模的选择性状态空间
Mamba 把 SSM 参数改成输入的函数,让固定大小的状态学会按内容取舍;再靠并行扫描与 kernel 融合把状态装进 SRAM,线性复杂度落地——3B 匹敌两倍大的 Transformer,5 倍推理吞吐,线性扩展到百万长度。文末梳理截至 2026-10 它与 Attention 的分工现状。
研究前沿 精选 · 原创 · 4天前 阅读 23·访客 23
论文精读:DeepSeek-R1——纯强化学习怎么唤醒推理能力
精读 DeepSeek-R1 论文(arXiv 2501.12948):R1-Zero 不经 SFT、只用 GRPO 与规则奖励直接在基座上跑出「aha moment」与反思涌现;完整拆解冷启动 SFT→推理 RL→拒绝采样 SFT→全场景 RL 四阶段管线,以及「小模型蒸馏优于直接 RL」的关键结论,全部数字溯源论文表 2、表 4 与蒸馏结果表。
研究前沿 精选 · 原创 · 4天前 阅读 99·访客 97
Test-Time Scaling:让模型「多想一步」的三种姿势与一个天坑
推理时多花算力能换准确率:self-consistency 投票、过程奖励模型引导搜索、budget forcing 强制续想,三条路线各有边界。本文以 s1 论文与 2025–2026 年的 overthinking 研究为轴,梳理 test-time scaling 的效果账与失效点。
研究前沿 精选 · 原创 · 4天前 阅读 12·访客 12
OpenAI o1 问世:推理时计算开启新范式
o1 系列通过强化学习训练模型'先思考再回答',在数学、代码与科学推理上大幅跃升,开创了推理时扩展(Test-time Compute)的新 Scaling 维度。
研究前沿 精选 · OpenAI · 2024-09-12 阅读 41·访客 40
世界模型与视频生成 12 篇
世界模型 2026:四大阵营、百亿资本与路线之争
LeCun 出走创办 AMI Labs、AMD 并入 World Labs、NVIDIA 开源 Cosmos 3、DeepMind 把 Genie 3 开进订阅渠道——过去十四个月,世界模型从论文词汇变成基础模型新战场。本文按阵营拆解格局、时间线与资本动向,也带上怀疑者的冷水:这可能只是下一个 buzzword。
行业动态 精选 · 原创 · 2天前 阅读 28·访客 27
世界模型上车:端到端之后,自动驾驶把训练与验证搬进了「生成的世界」
端到端架构解决了「怎么开」,却顺手摧毁了旧的验证体系——模块没了,没法分模块打分;而真实路测里程的需求随性能提升指数增长。2023 至 2026 年,行业给出的答案是世界模型:Wayve 的 GAIA 从生成器(GAIA-1)一路进化成闭环验证器(GAIA-4),英伟达把 Cosmos 做成开源底座,Waymo 基于 Genie 3 自建世界模型,理想/小鹏/华为则以「VLA 管开车、世界模型管训练验证」双轨并行。本文拆解这条技术线的逻辑、格局与保真度之争。
研究前沿 精选 · 原创 · 3天前 阅读 42·访客 41
AI 视频的商业落地:广告、短剧、影视后期与电商素材用到什么程度了
从纯 AIGC 长剧上星到「AI 跑一千张图选一张」的分镜工作流,盘点 2026 年 AI 视频在短剧、广告、影视与电商四个场景的真实渗透率、成本账与卡点。
行业动态 精选 · 原创 · 4天前 阅读 25·访客 25
AI 视频的两道坎:角色一致性与物理合理性
生成一条好看的视频已经不难,难的是让同一个人跨镜头不「变脸」、让画面里的世界遵守物理。盘点各家的参考生视频、LoRA 微调、推理优先架构等方案与仍然存在的短板。
大模型 精选 · 原创 · 4天前 阅读 30·访客 30
一篇读懂 DiT:视频生成模型为什么都换上了 Transformer 主干
从 Peebles 与谢赛宁的 DiT 论文到 Sora 的时空 patch,讲清 Diffusion Transformer 的三个关键设计:patch 化、adaLN-Zero 条件注入与以计算量为标尺的可扩展性。
一叶一世界 精选 · 原创 · 4天前 阅读 14·访客 14
什么是世界模型:从「生成视频」到「可交互的模拟器」
LeCun 的 JEPA 主张、DeepMind Genie 3、NVIDIA Cosmos 与李飞飞的 World Labs,讲清世界模型与视频生成模型的本质区别:一个产出录像,一个产出可交互、可预测的环境。
研究前沿 精选 · 原创 · 4天前 阅读 20·访客 20
视频生成模型 2026 全景:Sora 2、Veo 3.1、可灵、即梦、Vidu 卷到了哪里
从 Sora 2 的音画同步到可灵 4.0 的 4K HDR 30 秒长镜头,盘点 2026 年视频生成模型的版本演进、能力边界与定价方式,并给出一套按场景选型的参考框架。
大模型 精选 · 原创 · 4天前 阅读 83·访客 79
扩散模型入门:从噪声里「雕刻」出图像
直接让网络输出一张合理的图像为什么难?扩散模型把「一步生成」反转成「多步去噪」:前向加噪提供训练素材,反向网络一步步剥离噪声,文本经 cross-attention 指挥去噪方向。本文讲清这套机制的完整逻辑,并对比扩散与自回归两条路线。
研究前沿 精选 · 原创 · 5天前 阅读 29·访客 29
快手可灵 AI Kling 4.0 将于 10 月上线,支持 4K HDR 与 30 秒视频生成
IT之家 9 月 29 日消息,快手可灵 AI 宣布,Kling 4.0 将于 10 月正式上线。其中,Kling 4.0 Flash 于 9 月 28 日率先开放小范围体验。 据介绍,Kling 4.0 支持 4K、1080p 的 10-…
大模型 IT之家 · 9-29 阅读 29·访客 29
AMD 以 82 亿美元收购李飞飞创立的 World Labs,李飞飞将出任 AMD 首席科学家
AMD 宣布以约 82 亿美元全股票收购李飞飞创立的世界模型公司 World Labs,李飞飞将出任 AMD 执行副总裁兼首席科学家,交易预计 2026 年底前完成。
行业动态 东方财富/东西问 · 9-29 阅读 15·访客 15
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
大模型 精选 · 本站原创 · 9-10 阅读 91·访客 72
OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
大模型 精选 · OpenAI · 2024-02-16 阅读 41·访客 37
AI 数学 5 篇
AI 做数学研究走到了哪一步:奖牌、轰炸与「数学 2.0」之争
从 IMO 奖牌级表现到一次发布 372 项结果引爆抵制,AI 证明在 2026 年接连突破也接连越界。本文梳理 AlphaProof、Gemini Deep Think 与 OpenAI 最新成果、Lean 形式化生态的进展,厘清机器辅助证明当前的能力边界,以及数学社区围绕「数学 2.0」的核心争论。
研究前沿 精选 · 原创 · 昨天 阅读 19·访客 19
AI 开始发现新数学了吗:从 FunSearch 到 AlphaEvolve
从 FunSearch 把 cap set 下界从 496 推到 512,到 AlphaEvolve 五十六年来首次改进 4×4 矩阵乘法,再到陶哲轩带着 AlphaEvolve 一次测了 67 个问题——AI 正在从「解出已知的题」走向「产出人类未知的新构造」。本文梳理这条机器发现路线的方法演进与代表结果,也整理 METR 与陶哲轩本人最直接的质疑:这到底是数学发现,还是高级暴力搜索。
研究前沿 精选 · 原创 · 昨天 阅读 25·访客 25
AI 数学能力到底怎么测:基准、污染与「会考试不等于会研究」
FrontierMath 发布时最好的模型不到 2%,一年半后最高分冲到约 52%;可同一时期,GSM1k 证明部分模型的高分有背题成分,FrontierMath v2 修正了四成多题目,25 位菲尔兹奖得主联名批评「竞逐名题」。本文梳理数学评测五年演进、数据污染的实锤机制、FrontierMath 资助风波,以及 2026 年评测范式向证明题与开放问题的转向。
研究前沿 精选 · 原创 · 昨天 阅读 24·访客 24
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
研究前沿 精选 · 原创 · 4天前 阅读 86·访客 82
深度学习的数学基础:我们知道它能用,却说不清为什么
2017 年 Ali Rahimi 领奖时说「机器学习变成了炼金术」,LeCun 当场反驳;八年过去,模型能力涨了几个数量级,「为什么泛化」的数学解释仍然是一堆可解模型里的定理。本文盘点深度学习数学基础的现状:随机标签实验、双下降、NTK、grokking、scaling laws 各自被解释到了哪一步,哪一步仍然卡住,以及 2026 年「学习力学」的学科宣言算不算转折点。
研究前沿 精选 · 原创 · 昨天 阅读 12·访客 12
AI for Science 7 篇
AI 制药的中场战事:Isomorphic Labs 与 Recursion 的进展、止损与质疑
AlphaFold 之父的 Isomorphic Labs 拿下近 30 亿美元级药企合作又融资 6 亿美元, Recursion 却在并购 Exscientia 后裁员 20%、砍掉 4 条管线;英矽智能的 rentosertib 交出首个 IIa 期数据。AI 制药走到临床这一关,故事开始分化。
行业动态 精选 · 原创 · 4天前 阅读 27·访客 27
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
研究前沿 精选 · 原创 · 4天前 阅读 86·访客 82
AI 材料发现的闭环走到哪一步了:GNoME、A-Lab 与自动化实验室的三年起伏
GNoME 一次「发现」38 万个稳定晶体,A-Lab 宣称机器人 17 天合成 41 种新材料——随后被质疑、更正为 36 种。预测模型狂飙突进,实验验证却成了瓶颈。截至 2026 年 10 月,从预测到合成的闭环真正打通了吗?
研究前沿 精选 · 原创 · 4天前 阅读 16·访客 16
AI 气象预报的成本革命:GraphCast、盘古与伏羲是怎么把「数小时」压到「一分钟」的
传统数值预报靠超级计算机解物理方程,一次中期预报要算数小时。GraphCast、盘古气象、伏羲等 AI 模型把 10 天预报压缩到单块芯片一分钟内,ECMWF 已将 AI 模型正式业务化。但 2025 年的新研究提醒:破纪录的极端天气仍是 AI 模型的软肋。
研究前沿 精选 · 原创 · 4天前 阅读 30·访客 30
AlphaFold 3 之后:AI 结构生物学的现状与局限——DiffDock、Boltz 与开源复现进展
AlphaFold 3 把结构预测扩展到蛋白质、核酸与配体的全分子交互,但发布时的封闭访问引发争议。两年过去,DiffDock、Boltz、Protenix 等开源阵营追到了哪一步?AF3 又有哪些被实测证实的失败模式?本文梳理截至 2026 年 10 月的格局。
研究前沿 精选 · 原创 · 4天前 阅读 23·访客 23
诺贝尔物理学奖授予神经网络先驱 Hopfield 与 Hinton
2024 年诺贝尔物理学奖授予 John Hopfield 与 Geoffrey Hinton,表彰其利用人工神经网络实现机器学习的基础性发现;化学奖同时颁给蛋白质计算先驱。
研究前沿 精选 · NobelPrize.org · 2024-10-08 阅读 48·访客 45
AlphaFold 3 发布:AI 破解生命分子相互作用
Google DeepMind 与 Isomorphic Labs 发布 AlphaFold 3,首次将预测范围从蛋白质结构扩展到 DNA、RNA、配体等全部生命分子及其相互作用。
研究前沿 精选 · Google DeepMind · 2024-03-06 阅读 46·访客 44
具身智能与机器人 6 篇
Diffusion Policy:机器人动作生成为什么弃用回归、改用扩散模型
模仿学习的老问题是「多峰动作分布」——两种都对的做法被回归平均成一种错的。Diffusion Policy 用条件去噪扩散直接建模动作分布,在 12 个任务、4 个基准上平均成功率提升 46.9%,此后 DP3、DPPO 相继跟进,π0 的流匹配与 GR00T 的扩散 Transformer 把它推成了 VLA 时代的标配动作头。
研究前沿 精选 · 原创 · 4天前 阅读 24·访客 24
一篇读懂 Sim2Real:为什么机器人要先在仿真里练、域随机化怎么弥合现实差距
真机试错又贵又慢又危险,仿真里的动作却近乎免费——但仿真和现实隔着一道「现实差距」。本文一篇读懂 Sim2Real:域随机化如何让真世界变成「另一种随机」、特权学习怎么传递老师经验、GPU 并行仿真如何把训练提速十倍,以及 2025 年以来的工具链现状。
一叶一世界 精选 · 原创 · 4天前 阅读 13·访客 13
机器人学习的数据瓶颈:从 Open X-Embodiment 到遥操作数据工厂
大语言模型吃的是万亿 token 网络文本,机器人能吃的真机数据却以「万条轨迹」计。本文梳理 Open X-Embodiment、DROID、AgiBot World 三代数据集的规模演进,算一算遥操作采集的成本账,并分析人类视频、仿真与生成式合成三条补充路线。
研究前沿 精选 · 原创 · 4天前 阅读 29·访客 29
2026 年人形机器人产业观察:出货狂奔、资本抢筹与「第一股」的诞生
IDC 数据显示 2026 上半年全球人形机器人出货近 2.5 万台、同比增长 432.1%,中国占约 77.9%。本文逐一盘点宇树、智元、Figure、特斯拉、1X 五家主要玩家的量产与商业化进展,拆解「卖机器人、卖服务、卖数据」三种商业模式,并讨论高估值背后的回撤风险。
行业动态 精选 · 原创 · 4天前 阅读 31·访客 30
VLA(视觉-语言-动作)模型进化史:机器人如何「看懂再动手」
从 RT-2 把机器人动作当文本 token 输出,到 OpenVLA 开源 7B、π0 用流匹配跑到 50Hz、GR00T 与 Helix 转向双系统架构——本文梳理 VLA 模型三年的演进脉络:动作怎么表示、参数怎么变小、控制频率怎么上去,以及开源与闭源两条路线的分野。
研究前沿 精选 · 原创 · 4天前 阅读 20·访客 20
世界模型上车:端到端之后,自动驾驶把训练与验证搬进了「生成的世界」
端到端架构解决了「怎么开」,却顺手摧毁了旧的验证体系——模块没了,没法分模块打分;而真实路测里程的需求随性能提升指数增长。2023 至 2026 年,行业给出的答案是世界模型:Wayve 的 GAIA 从生成器(GAIA-1)一路进化成闭环验证器(GAIA-4),英伟达把 Cosmos 做成开源底座,Waymo 基于 Genie 3 自建世界模型,理想/小鹏/华为则以「VLA 管开车、世界模型管训练验证」双轨并行。本文拆解这条技术线的逻辑、格局与保真度之争。
研究前沿 精选 · 原创 · 3天前 阅读 42·访客 41
多模态之路 16 篇
语音链路地图:ASR、TTS 与实时对话的延迟账
语音对话「说完—听懂—想好—说出」四段链路各带百毫秒级延迟,叠加起来轻易超过人类对话的停顿预算。本文摊开全链路延迟账本,拆解 VAD、流式识别、首 token 与流式合成各环节,并对比级联与端到端两条架构路线。
研究前沿 精选 · 原创 · 5天前 阅读 48·访客 48
扩散模型入门:从噪声里「雕刻」出图像
直接让网络输出一张合理的图像为什么难?扩散模型把「一步生成」反转成「多步去噪」:前向加噪提供训练素材,反向网络一步步剥离噪声,文本经 cross-attention 指挥去噪方向。本文讲清这套机制的完整逻辑,并对比扩散与自回归两条路线。
研究前沿 精选 · 原创 · 5天前 阅读 29·访客 29
一篇读懂视觉语言模型:图像是怎么变成「语言」的
大语言模型只认 token 序列,图片如何进入对话?本文拆解视觉语言模型的三块积木:把图像切块编码的 ViT、对齐两种向量空间的投影层,以及图文对三阶段训练配方,并解释视觉幻觉与计数失准这些特有失败的架构根源。
一叶一世界 精选 · 原创 · 5天前 阅读 15·访客 15
数据墙 2026:预训练高质量数据的极限之争
Epoch AI 估算公开人类文本有效存量约 300 万亿 token,按现有训练节奏将在 2026–2032 年间耗尽。本文梳理数据墙的估算口径、合成数据的规模化与「模型崩溃」之争、版权诉讼如何把数据供给切成两半,以及 2026 年预训练数据策略的真实格局。
大模型 精选 · 原创 · 昨天 阅读 26·访客 25
AI 数学能力到底怎么测:基准、污染与「会考试不等于会研究」
FrontierMath 发布时最好的模型不到 2%,一年半后最高分冲到约 52%;可同一时期,GSM1k 证明部分模型的高分有背题成分,FrontierMath v2 修正了四成多题目,25 位菲尔兹奖得主联名批评「竞逐名题」。本文梳理数学评测五年演进、数据污染的实锤机制、FrontierMath 资助风波,以及 2026 年评测范式向证明题与开放问题的转向。
研究前沿 精选 · 原创 · 昨天 阅读 24·访客 24
开源语音合成现状:零样本克隆已经卷到什么程度
盘点 2026 年 10 月主流开源 TTS 七个项目(GPT-SoVITS、CosyVoice、F5-TTS、Fish Speech、IndexTTS、Kokoro 等):机制、音色克隆方式、中文支持与许可证商用限制,附中文效果/实时率/长文本对比表与 F5-TTS 上手示例,兼谈声音克隆的授权与深度伪造合规风险。
开源项目 精选 · 原创 · 4天前 阅读 70·访客 60
Diffusion Policy:机器人动作生成为什么弃用回归、改用扩散模型
模仿学习的老问题是「多峰动作分布」——两种都对的做法被回归平均成一种错的。Diffusion Policy 用条件去噪扩散直接建模动作分布,在 12 个任务、4 个基准上平均成功率提升 46.9%,此后 DP3、DPPO 相继跟进,π0 的流匹配与 GR00T 的扩散 Transformer 把它推成了 VLA 时代的标配动作头。
研究前沿 精选 · 原创 · 4天前 阅读 24·访客 24
音频理解:大模型怎么「听懂」ASR 之外的声音世界
转写成文字只是「听见」,音频理解的野心是「听懂」:环境声事件、音乐结构、说话人情绪、副语言信息。本文拆解音频语言模型的技术配方(音频编码器 → 语义 token → LLM)、开源代表 Qwen 系与评测基准 MMAU/AudioBench,以及它正在替代的旧管线。
研究前沿 精选 · 原创 · 4天前 阅读 21·访客 21
一篇读懂 DiT:视频生成模型为什么都换上了 Transformer 主干
从 Peebles 与谢赛宁的 DiT 论文到 Sora 的时空 patch,讲清 Diffusion Transformer 的三个关键设计:patch 化、adaLN-Zero 条件注入与以计算量为标尺的可扩展性。
一叶一世界 精选 · 原创 · 4天前 阅读 14·访客 14
论文精读:CLIP——四亿图文对如何把图像接入语言空间
CLIP(Radford et al., 2021)用 4 亿网络图文对做对比学习,零样本在 ImageNet 拿到 76.2%——追平全监督的 ResNet-50。本文拆解对比学习的训练机制、零样本分类的「提示词即分类器」玩法、CLIP 的失效模式,以及它如何成为多模态时代的地基。
研究前沿 精选 · 原创 · 4天前 阅读 13·访客 13
多模态 RAG:当文档里的关键信息藏在表格与图表里
真实企业文档的多数信息不在正文段落里,而在表格、图表与版式关系里——文本 RAG 的 OCR 管线在这里系统性失真。本文拆解两条补齐路线(解析增强 vs ColPali 式视觉检索)与生成端的图文编排,给出选型权衡。
后端技术 精选 · 原创 · 4天前 阅读 16·访客 16
大模型评测基准的坑:Leaderboard 分数为什么会骗人
Leaderboard 分数与真实体验错位,主要来自四类坑:数据污染(考题漏进训练数据)、面向榜单的针对性刷分(Goodhart 定律)、评测方法本身不稳(提示词、判分与统计方差)、静态基准的饱和失效循环。本文用公开论文与官方博客证据拆解每类坑的机制,并给出读榜时的 7 条防坑检查清单。
大模型 精选 · 原创 · 4天前 阅读 33·访客 33
模型安全怎么量:安全评测的维度与指标
「这个模型安全吗」没法用一个数字回答——安全是一组维度上的分布。本文梳理有害拒答、越狱鲁棒性、过度拒绝、公平性与事实性五个维度,讲清评测过拟合的陷阱与红队互补关系,给出应用方的落地建议。
研究前沿 精选 · 原创 · 5天前 阅读 22·访客 22
通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
九大空间测试10B规模通用模型中8项第一]
开源项目 量子位 · 9-16 阅读 48·访客 48
OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
大模型 精选 · OpenAI · 2024-02-16 阅读 41·访客 37
GPT-4 发布:多模态与长上下文的分水岭
OpenAI 发布 GPT-4,支持图文多模态输入,在律师资格考试等专业基准上达到人类前 10% 水平,并引入 32K 长上下文版本。
大模型 精选 · OpenAI · 2023-03-15 阅读 20·访客 19