编码智能体 2026 横评:Claude Code、Codex、Cursor、Gemini CLI 与开源两强怎么选

先说结论:这不是六选一,而是三张面孔加两块开源拼图

编码智能体的竞争在 2026 年走到了一个清晰的分水岭:单纯「模型加终端」的产品已经没有生存空间,活下来的玩家都在把智能体往平台方向做。截至 2026-10-10,市场格局可以概括成三张面孔加两块拼图:Anthropic 的 Claude Code 与 OpenAI 的 Codex 代表「订阅制全家桶」路线,模型、CLI、IDE 扩展、云端并行任务和桌面端一体供应;Cursor 代表「IDE 派」路线,把智能体深度织进编辑器体验;Google 的 Gemini CLI 走「免费额度换生态」路线,用开源客户端和慷慨配额铺量;开源侧则是 Aider 的极简主义与 OpenHands 的转身——后者已经改名 Agent Canvas,从「自己做一个编码智能体」转向「统一调度所有编码智能体」的自托管控制中心。

选型速查:已有 Claude Pro/Max 订阅、重终端工作流,选 Claude Code;已有 ChatGPT 订阅、需要云端并行任务和最多端的覆盖,选 Codex;IDE 重度用户、想要规划模式和代码评审一体化,选 Cursor;预算敏感、想脚本化批量调用大上下文模型,先试 Gemini CLI 免费层;想绑定任意模型(含本地模型)且离不开 git 的极客,用 Aider;想在一处统一运行多家智能体的团队,关注 Agent Canvas。

下文所有定价与功能口径均来自 2026-10-10 抓取的官方定价页与官方文档,来源见文末;各产品迭代极快,过期结论请以官方页面为准。

定价与用量:订阅池、免费层与 API 直付三套账

先看一张总表,再拆开算账。定价是这一轮竞争里分化最明显的地方:三大厂商都不约而同地放弃了「按请求计费」的直白模式,转向订阅用量池——所有活动(聊天、CLI、云端任务)从同一个池子里扣,按 5 小时滚动窗口限速,再叠加每周上限。

工具 入门付费档 高阶档 免费层 计费逻辑
Claude Code Pro 每月 20 美元(年付折合 17) Max 5x 每月 100 美元起、Max 20x 为 20 倍 Pro 用量 免费版不含 Claude Code 订阅池 + 5 小时滚动窗口 + 周限
Codex 随 ChatGPT Plus 每月 20 美元 Pro 每月 500 美元(解锁 GPT-6.1 Sol Ultrafast) Free/Go 档可在桌面端用 Luna 模型 订阅池,签到即用
Cursor Pro 每月 20 美元 Pro+ 每月 60 美元、Ultra 每月 200 美元 Hobby 有限额度 用量池 + 超额按 API 费率现付
Gemini CLI 免费层即可日常使用 Gemini Code Assist 付费版(企业配额) Google 账号每分钟 60 次、每天 1000 次 免费配额 + 企业版
Aider 开源免费,自付 API 费 无 无 纯 API 直付
Agent Canvas(OpenHands) 开源免费,自备智能体订阅 无 无 自托管,自带钥

几笔账值得算细。Claude 的订阅池是全家共享的:官方定价页明确写所有活动(聊天与 Claude Code)共用一个池子,付费档在 5 小时窗口之上叠加周限,触顶后可以按标准 API 费率购买额外用量。这意味着重度终端用户实际上是在买「确定性」——Max 5x 档每月 100 美元起,附赠每月 100 美元 API 额度,Max 20x 附赠 200 美元。Cursor 的官方文档给了一个有用的锚点:每天使用智能体的典型用户月消耗约 60 到 100 美元,重度用户常超 200 美元——这解释了 Ultra 档存在的理由,也提醒你 Pro 档自带的用量对日抛型用户并不宽裕;团队版对第三方模型还要加收每百万 token 0.25 美元的通道费。Gemini CLI 的免费层是六款里唯一能「白嫖到日用」的:Google 账号 OAuth 登录后每分钟 60 次、每天 1000 次请求,配的是带 100 万 token 上下文窗口的 Gemini 3——这套配额对个人开发者和小团队几乎是降维打击,Google 用它买的显然是生态份额。

还有第三套账容易被忽略:绕开订阅、直接付 API。Claude 的 API 价目(每百万 token)Sonnet 5.5 为 2 美元输入、10 美元输出,Opus 5.5 为 4 比 20,Haiku 5.5 低至 0.10 比 0.50——配合 CI 里的批量任务,API 直付反而比订阅更可控。Codex CLI 同样允许 API key 模式,只是官方把「Sign in with ChatGPT」标为推荐路径。Aider 则从一开始就只认 API:它的用户天然知道每晚跑了多少 token。

能力与工作流形态:同一件事的三种做法

六款工具解决的其实是同一个问题——「把需求变成合入主干的代码」——但工作流形态分成了三条路线。下面这张图是三条路线的骨架差异:

flowchart LR
    DEV["开发者"] --> CLI["终端智能体:Claude Code / Codex CLI / Gemini CLI / Aider"]
    DEV --> IDE["IDE 智能体:Cursor"]
    CLI -->|headless 或 hooks| CI["CI 流水线与定时任务"]
    IDE -->|规划模式与 Bugbot| REVIEW["评审与合入"]
    CLI --> CLOUD["云端并行任务:Codex 云端 / Claude 云端例程"]
    CLOUD --> REVIEW

终端派的共同点是「仓库即上下文」:智能体直接读你的代码库、改文件、跑命令、提交 git。Claude Code 在这条路上走得最远,官方文档列出的能力清单已经像一个操作系统:子智能体并行分工、生命周期 hooks、可打包分发的 skills、headless 模式(-p 参数接管道输入,例如把日志尾部或 git diff 喂给它)、跨设备接力的 Remote Control,以及让第三方打包能力的插件系统——插件可以捆绑 skills、子智能体定义、hooks 与 MCP 服务器,其中带 JavaScript hooks 模块(官方叫 mod)的插件甚至能画面板、加命令,官方市场 claude-plugins-official 在首次交互时自动挂载。Codex CLI则用 Rust 重写了核心,Apache-2.0 开源,GitHub 上约 12.8 万颗星;它的特点是「端」最全——CLI、VS Code 与 Cursor 的 IDE 扩展、浏览器云端版、macOS 与 Windows 桌面端(2026 年 7 月 9 日并入 ChatGPT 桌面应用)、Linux 桌面预览(2026 年 8 月 11 日,支持从 Claude Code 与 Cursor 导入配置)、手机端远程配对,甚至 Chrome 扩展。Gemini CLI 的形态最朴素,但工程化细节做得扎实:preview、stable、nightly 三条发布通道每周二滚动,内置 Google 搜索接地、GEMINI.md 上下文文件、会话检查点、--output-format json 无头模式,还有一个官方 GitHub Action 做 PR 评审和 issue 分诊。

IDE 派只有 Cursor 一个代表,但它的体验壁垒是真实存在的:Plan 模式先提问澄清、检索代码库、产出可编辑的实施计划再动手;Agent 内建文件编辑、代码库检索、终端执行、浏览器操作等工具且不设调用次数上限;更大的活儿交给 Projects 的协调者智能体拆解分派,配本地检查点与运行中转向。官方文档对 Plan 模式的定位很诚实——适合多文件任务、模糊需求和架构决策,「快速改动或做过很多遍的任务,直接进 Agent 模式就行」。

云端派是 2026 年的新变量:Codex 的云端任务支持 GitLab(8 月 19 日 beta)、接入了 Amazon Bedrock 作为模型提供方(6 月 1 日),Anthropic 也在把 Cowork 类任务迁往云端。工作流的含义很具体:本地终端负责交互式迭代,云端并行跑互不干扰的长任务,人只做最后的评审合入。这个形态对「一次提多个需求」的团队友好,但评审带宽会迅速成为瓶颈——后面细说。

一句话小结

终端派胜在可组合与可脚本化,IDE 派胜在体验闭环,云端派胜在并行度;三者在 2026 年正在互相渗透,选择的本质是选「你的注意力放在哪个界面」。

开源两强:Aider 的极简主义与 OpenHands 的转身

开源侧 2026 年最有意思的不是某个新模型接入,而是一减一增的两条路线。Aider 代表「减」:这个 Python 写的结对编程工具至今保持着极简的架构——用 repo map 给大仓库做全景索引、每个改动自动 git 提交并生成规范的提交信息、watch 模式监听编辑器注释驱动编码。它的最新版 v0.86.0加上了对 GPT-5 全系、Grok-4 和新一代 Gemini 模型的支持,发布说明里那句「本次发布 88% 的代码是 Aider 自己写的」既是产品 demo 也是路线宣言。约 4.4 万颗星、680 万次安装、每周处理约 150 亿 token——作为「只做好一件事」的工具,它活得很好。

OpenHands 代表「增」,而且增得相当决绝:这个曾以 OpenDevin 之名出道、目标是复刻闭源智能体的项目,如今在 GitHub 上改名 Agent Canvas,官方定位变成「面向编码智能体与自动化的自托管开发者控制中心」——它不再执着于自家智能体的排名,而是把 Claude Code、Codex、Gemini、OpenCode 或任何兼容 ACP 的智能体接进统一的界面,底下是 Python 的 software-agent-sdk 与一个能在单机跑多个智能体的 Agent Server REST 服务,周边配套了调度、webhook、运行历史,以及 Slack、GitHub、Linear、Notion 的集成。约 9 万颗星、MIT 协议、镜像版本 1.26.0,维护活跃。这次转身的行业信号比产品本身更重要:当智能体足够多,「调度智能体的智能体」就成了新的集成层。与之配套的还有 Zed 发起的 Agent Client Protocol(ACP),用「编辑器对智能体」的 JSON-RPC 标准化扮演当年 LSP 的角色——Agent Canvas 明确宣布兼容 ACP,Cursor 的 IDE 扩展市场里也能跑别家智能体,工具层的互操作正在从口号变成接口。

真实落地体验:榜单、抱怨与一个共同的教训

先看能力基准,再看社区抱怨,两边的结论指向同一处:账单与限额是 2026 年的主旋律。

看基准要多留一个心眼。SWE-bench Verified 仍是编码智能体的事实基准,但 2026 年的榜单数字波动大到值得单独说明:第三方榜单 vals.ai(9 月 1 日口径)把 Claude Opus 5 配 Mini-SWE-agent 统一环境排到 97% 一线,BenchLM 10 月口径的最高分也在 96% 左右;而 4 月前后中文评测引用的数字普遍还在 80% 上下(OSCHINA 横评引用 Claude Code 得分 80.9%)。这么大的跨度不是谁在造假,而是 harness 差异——一篇题为「Dissecting the SWE-Bench Leaderboards」的分析估计,评测口径差异平均带来约 6.2 个百分点的虚高,官方站自己也把默认视图切到了统一 mini-SWE-agent 环境来缩小口径差。对选型的含义很直接:榜单数字当信号看,别当保证用,同一个模型换个脚手架能差出好几分。

再看抱怨,三家各有各的痛。Claude Code 的痛点集中在周限:2025 年 7 月引入周限时官方口径是「影响不足 5% 的用户」,随即在社交媒体上引来反弹;到 10 月,GitHub 上题为「周限让 Claude 订阅不可用」的 issue 描述正常使用一两天就耗尽一周额度;DevOps.com 在 2026 年 4 月更是报道了 200 美元档 Max 用户 20 分钟内触顶的案例。「5 小时窗口很宽裕、按周算就见底」的结构性矛盾,重度用户至今没有等到舒服的解法。Codex 的抱怨同样围绕限额:OpenAI 官方社区 4 月的讨论串里,200 美元档 Pro 用户报告 5 小时窗口两次在两小时内用完、周上限一天几乎见底;9 月底 OpenAI 调整 Pro 档(Developers Digest 报道用量价值约砍半)并新开 500 美元档时,社区的第一反应是审视而非欢呼——好在额度争议之外,模型线本身的迭代速度(两个月内 Sol、6.1 Sol、Ultrafast 三连发)是公认的加分项。Cursor 的痛点在计费透明度:2025 年从固定请求数改成分层用量池后,论坛里不乏「付费了还在第一周烧掉 10 美元额度」的老用户抱怨,200 美元的 Ultra 档也被批评「比其他开发工具加起来还贵」;不过把「日抛型用户月耗 60 到 100 美元」白纸黑字写进官方定价文档这份坦诚,在行业里并不多见。

把三家抱怨放在一起读,能看到同一个教训:订阅池的定价逻辑与智能体的消耗曲线天然错位。聊天时代按「条」感知用量,智能体时代按「任务」烧 token,一次多文件重构的消耗可以是一句提问的几百倍——厂商用 5 小时窗口、周限、用量池保护毛利,用户则为「这个活到底能不能干完」的确定性付出溢价。中文社区的横评(腾讯云、知乎等 2026 年多篇评测)在选型结论上倒是出奇一致:Cursor 补全与心流体验独一档,Claude Code 强在大型重构与代码审查,Codex 强在批量修改与自动化——这与本文选型表的判断一致,差别只在你更信自己的任务画像还是别人的雷达图。

选型建议:按场景对号入座

把前面的材料压成一张决策表。结论前置:六款工具没有全能冠军,选型的第一变量是你已有的订阅和团队的主界面,第二变量是任务粒度——大粒度的多文件任务交给带规划模式的工具,小粒度的批量任务交给 headless 与 CI。

工具 最适合的场景 最大的代价 一句话画像
Claude Code 重终端工作流 + 已有 Pro/Max 订阅 + 想用插件生态沉淀团队规范 周限触顶后的确定性下降,全家共用一个池 平台化终端智能体
Codex ChatGPT 订阅用户 + 需要云端并行与最全的多端覆盖 模型线迭代快,旧模型退役频繁 绑定订阅的全端选手
Cursor IDE 重度用户 + 要规划、评审、补全一体化的团队 重度用量下账单爬坡快 体验闭环的 IDE 派
Gemini CLI 预算敏感 + 脚本化批量任务 + 大上下文需求 生态与自动化纵深弱于前两者 免费额度的生态敲门砖
Aider 极客 + 任意模型(含本地)+ git 原教旨主义 无云端并行、无团队管理面 一把趁手的螺丝刀
Agent Canvas 想统一调度多家智能体的自托管团队 需要自己当运维 智能体的调度台

三条补充判断。第一,先盘点订阅再选工具:Claude Pro、ChatGPT Plus、Cursor Pro 三者价格同为每月 20 美元档,编码智能体都是「顺带」权益,为工具单开订阅之前先看存量。第二,把评审带宽当容量规划做:云端并行任务把产出速率提高了一个量级,但合入速率没有变——没有配套的评审流程(Bugbot 之类的机器评审、CI 门禁、小步合入纪律),并行只会更快地堆出 PR 积压。第三,开源方案的成本是显性的:Aider 与 Agent Canvas 本身免费,但模型 API 是自付的;用量稳定在每天数小时的重度场景,先粗算一笔 API 账再决定要不要放弃订阅池的「确定性溢价」。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?