大众叙事里,Deep Research 是 OpenAI 在 2025 年 2 月「引爆」的。时间线其实倒了过来:Google 在 2024 年 12 月 11 日就把 Deep Research 挂上了 Gemini Advanced,比 OpenAI 早了七周;而且 Google 的版本从第一天起就把「多步研究计划」显式展示给用户、允许修改后再执行——这个「人批计划」的交互设计直到 2026 年仍是各家产品的重要差异点。两年过去,deep research 已经从旗舰功能卷成了标配:免费档可用、开放 API、还能接进你自己的数据源。本文不聊行业战争(那篇交给本站的《AI 搜索的 2026》),只拆技术骨架:这类系统到底在怎么工作,哪些是学出来的、哪些是编排出来的,以及它慢吞吞跑十分钟之后给出的答案,可信度到底几何。
先把时间线捋直
把主要玩家的节点放在一张表里(配额与价格均以发布时口径为准):
| 产品 | 首发 | 起点 | 配额/价格 |
|---|---|---|---|
| Gemini Deep Research | 2024-12-11 | Gemini 1.5 Pro(注意:不是同日发布的 2.0 Flash,官方博客让用户手动切到 1.5 Pro with Deep Research) | AI Pro 订阅档;2025-03 起向全体用户免费开放 |
| OpenAI Deep Research | 2025-02-02 | o3 的 browsing 优化版,端到端 RL 训练 | Pro $200/月,100 次/月;2025-02-25 起 Plus 10 次、Pro 上调 120 次 |
| Perplexity Deep Research | 2025-02-14 | 自家 Sonar 搜索栈 | 免费 5 次/天;Pro $20/月 500 次/天,主打 2–4 分钟速出 |
| Claude Research | 2025-04-15 | Claude + agentic flow | 随订阅计划;特色是同时检索 web 与用户的 Google Workspace |
| Grok DeepSearch / DeeperSearch | 2025-02 / 2025-03 | Grok 3 | DeeperSearch 官方定位「credible over speed」 |
| Kimi-Researcher | 2025-06 | 端到端 agentic RL(官方称无 SFT) | 自报 HLE pass@1 26.9%,当时持平 OpenAI |
之后的两步把形态定型:2025-06-27 OpenAI 开放 Deep Research API(o3 系列获得 web search 能力);2025-07-17 的 ChatGPT agent 把「深度检索」与「浏览器操作」合并成一个通用 agent——「bridging research and action」,调查与行动从此共享同一套循环。Google 这边同样三步走:2025-03-13 免费(覆盖 45 种以上语言)→ 2025-04-08 升级 Gemini 2.5 Pro → 2025-11-18 随 Gemini 3 重做全流程,12 月又把重构后的 deep research agent 开放给开发者。到 2026 年,这个能力已经沉到平台层:ChatGPT 侧的 deep research 可接入 apps/connectors 与 MCP 服务器做私域调查,「给你公司内部知识库写一份尽调报告」成了标准用法。
通用循环:一次调查的六个动作
剥开各家包装,agentic 检索的循环可以拆成六步。一是查询规划:把用户问题分解成子问题与研究计划——Gemini 把这步产品化给用户改批;OpenAI 和 Kimi 则把「怎么规划」内化进模型。二是迭代检索:执行搜索后「根据学到的东西发起新的搜索」(Google 官方原话)——这是它与单轮 RAG 的本质区别:搜索词不是一次写定的,是过程中动态生成的。三是阅读与抽取:OpenAI 系统卡明确列出 search、click、scroll、interpret files 四项能力,都是在自建浏览数据集上用强化学习练出来的,不是规则脚本。四是反思与补漏:开源实现里这一步最直白——流行的极简项目 dzhng/deep-research(目标五百行以内)每一轮从结果中提取 learnings、发现缺口,depth 参数没耗尽就带着新问题递归深入。五是约束与安全:读网页的 agent 天然多一层不可信输入面——系统卡把 prompt injection 列为两大增量风险之一,缓解手段包括不允许 agent 导航到任意构造的 URL。六是生成带引用的报告:所有产品殊途同归的出口,引用链接是这类产品与普通聊天的外观分界线。
两条路线:学出来的循环 vs 编排出来的循环
六步循环有两种造法。端到端 RL 路线(OpenAI、Kimi):不给显式流程,用强化学习奖励「找到关键信息或写出综合报告」,让模型自己学会何时搜、搜什么、何时停——Kimi 官方甚至强调「无 SFT、纯 RL」。显式编排路线(Gemini 的 plan-execute、Perplexity 的快速迭代、几乎全部开源实现):流程写死在框架里,LLM 负责每一步的局部决策。开源生态基本全在后一列:HuggingFace 在 OpenAI 发布后 24 小时内启动复现,用 smolagents 的 CodeAgent 加搜索工具在 GAIA 上拿到约 54%(对比 OpenAI 自报 67.36%);GPT Researcher 则早在 2023 年 5 月就开始做「自主研究 agent」,比这波热潮早了快两年。
哪条路线对?一个基准数据很有说服力:OpenAI 专为浏览类任务造的 BrowseComp(1,266 道需要多跳定位的问题)上,裸推理模型(o1)成绩不足 10%,deep research 达到 51.5%。两者用的是同一代模型底子——差的那 40 多分,主要不是「模型更聪明」,而是「持续多步浏览」这个行为本身。这个行为既可以是 RL 学出来的,也可以是编排出来的;GAIA 上 HF 用通用 agent 框架复现出 54% 说明循环结构比模型规模更关键,而 Kimi 用纯 RL 追平自报分数又说明两条路线最终会师。
开源阵营:把循环抄回家
值得单独一提的是,这个循环的开源复刻速度快得惊人。OpenAI 发布后 24 小时内,HuggingFace 就启动了复现(open-deep-research,基于 smolagents 的 CodeAgent,最终 GAIA 均分约 54%);LangChain 的 open_deep_research 走 provider 无关路线,搜索工具与 MCP server 都可插拔;GPT Researcher 则是「前朝遗老」——2023 年 5 月就存在、约三万 stars、自称第一个开源 deep research agent,如今已迁移到 LangChain 的 Deep Agents 框架上。这些开源版的共同启示在 dzhng/deep-research 的 README 里写得最直白:核心循环不到五百行代码——「deep research」的护城河从来不在循环代码本身,而在三样东西:足够强的底座模型、干净的搜索与抓取管道、以及 RL 阶段烧掉的那批浏览数据。前两样开源世界都有平替,第三样暂时没有,这就是开源复现普遍落后官方版 10 个百分点左右的主要缺口。
基准速查:分数在怎么爬
| 基准 | 说明 | 关键刻度 |
|---|---|---|
| Humanity's Last Exam | 专家级难题 | OpenAI DR 发布时 26.6%(浏览+Python 工具)→ Kimi-Researcher 26.9%(2025-06)→ 2026-10 第三方榜单头部约 61–65% |
| GAIA | 通用助手真实任务(人类约 92%) | OpenAI DR 67.36%(当时 SOTA)→ HF 开源复现约 54% → 2025 年下半年开源系统已反超 |
| BrowseComp | 多跳信息定位 | deep research 51.5% vs 裸模型 <10% |
| SimpleQA | 短事实问答 | Perplexity 自报 93.9%;同赛道多家都自报 SOTA——供应商自报口径打架的典型现场 |
HLE 那条曲线值得多看一眼:一年半多一点的时间,头部成绩从 26.6% 爬到 60% 以上——「专家级考试」从几乎不及格卷到接近饱和。这既是 deep research 循环的胜利,也意味着它正在重演 SWE-bench 式的饱和剧本(基准的寿命问题,本站《SWE-bench 兴衰记》有过完整拆解)。
慢不等于对:引用可靠性的账单
十分钟的调查换来的报告,可信度并不与耗时成正比。独立测试接连给出了难看的数字:哥伦比亚新闻评论 Tow Center(2025-03)测了 8 款 AI 搜索引擎,结论是「它们全都不擅长引用新闻」,部分工具错误引用率超过 60%;BBC(2025-10)发现新闻议题上 51% 的 AI 回答有显著问题,其中引用 BBC 内容的回答 19% 含事实错误;欧洲广播联盟联合 14 国机构的更大规模测试(2025-10)给出 45% / 81% 的「有显著问题 / 存在问题」两档数字,且跨语言跨地区一致。学术侧的 DeepTRACE 审计(arXiv:2509.04499)补了一个重要细节:开启 deep research 配置后引用准确率能推到 80% 以上——深调查模式确实比快速回答更可靠,但该研究同时发现用 LLM 当评审与人类标注的相关性只有 0.62,「用 AI 审计 AI」本身也有噪声。多轮报告生成环节同样有学术论文专门记账(《Deep Research Agents are Unreliable at Multi-turn Report Generation》以引用忠实度、论断有据性等指标系统性记录了不可靠之处)。这些失真的外部性已经显形:Pew 的研究观察到 AI 摘要出现时用户点击原文的比例明显下降(具体降幅各方口径不一),已有小型出版商报告广告收入大幅下滑——本站《AI 搜索的 2026》详述过这场流量战争的进程。Gary Marcus 在产品发布次日写下的批评(《Deep Research, Deep Bullshit》)至今仍是合适的提醒:问题不是「幻觉」这个词,而是系统没有真值锚定——它擅长把一篇像样的报告组织出来,不保证每个句子都对。
结语
Agentic 检索的真正创新不在某个模型,而在把「检索」从一次性调用变成了带反思的循环——规划、迭代、阅读、补漏,每一步都可以是学出来的或编排出来的,重要的是循环本身:BrowseComp 上那 40 多分的差距属于多步浏览行为,不属于更大的参数量。两年里这个循环已经标准化到开源复现只需几百行代码,下一程的分化点在别处:接私有数据的连接器生态、报告之外的「行动」能力,以及最要紧的——让引用真正可信。在那之前,对它输出的正确姿势依然是把它当成一位「速度快、线索多、需要复核」的研究助理,而不是一台真理机器。
参考资料
- Gemini Deep Research — Google 官方博客(2024-12-11):最早的 deep research 产品发布文,含「研究计划可改批」交互。
- Introducing deep research — OpenAI(2025-02-02,官方 CDN 镜像):o3 browsing 优化版与 5–30 分钟工作时长口径。
- Deep Research System Card — OpenAI(2025-02-25):RL 训练的四项浏览能力与 prompt injection 风险。
- Introducing Perplexity Deep Research(2025-02-14):免费配额与 2–4 分钟定位。
- BrowseComp — OpenAI(2025-04)(论文 arXiv:2504.12516):裸模型 <10% vs deep research 51.5% 的对照出处。
- Kimi-Researcher 官方页(2025-06):端到端 agentic RL 路线代表。
- dzhng/deep-research — GitHub:极简开源实现的循环结构(depth/breadth 递归)。
- AI Search Has a Citation Problem — CJR/Tow Center(2025-03):八引擎引用测试。
- BBC 新闻 AI 回答研究(2025-10):51% / 19% 两个数字的出处。
- DeepTRACE: Auditing Deep Research AI Systems — arXiv:2509.04499:深调查模式可靠性与 LLM-as-judge 局限。
读者留言
COMMENTS 暂无还没有留言,来说第一句?