2026 年 10 月的旗舰大模型市场,罕见地挤进了同一个横评窗口:GPT-6 在 10 月 7 日至 8 日完成 ChatGPT 全量推送,Claude Haiku 5.5 在同一周把小模型单价打到地板,Google、智谱、DeepSeek、月之暗面、阿里的旗舰也全部在位。结论先行:编程与 Agent 的能力天花板目前在 Claude Opus 5.5 与 GPT-6 Astra 之间,性价比主力是 GPT-6.1 Sol 与国产旗舰,海量调用的地板价由 GPT-6 Luna 与 Haiku 5.5 共同定义;100 万 token 上下文已是旗舰标配,真正的成本分野从长上下文怎么计费开始。文中所有价格与规格均截至 2026-10-10。
格局速览:两条新闻定调的横评时点
本周的两条新闻恰好构成横评的两个坐标轴——能力与价格。
第一条是 GPT-6 全量开闸。据 OpenAI 官方公告,GPT-6 于 10 月 7 日先向 Plus、Pro、Business 与 Enterprise 用户推送,10 月 8 日扩展到全部 Free 与 Go 用户;付费档对应 GPT-6 Sol,免费与 Go 档对应 GPT-6 Luna,逐步接替上一代 GPT-5.6 Sol 与 GPT-5.6 Luna,并带来能在回答里直接生成可交互界面的 Intelligent UI(OpenAI 官方公告,另见钛媒体的中文综述)。API 侧的定价表则更早挂出:旗舰 gpt-6-astra、中档 gpt-6.1-sol 与低价 gpt-6-luna 三档并列(OpenAI 定价页)。
第二条是 Claude Haiku 5.5 降价。Anthropic 于 10 月 7 日发布 Haiku 5.5:10 万 token 以内的请求输入 $0.10、输出 $0.50(每百万 token,下同),较 Haiku 4.5 直降约 90%,官方口径下综合运行成本低约 75%;它首次为 Haiku 系引入 adaptive thinking,Artificial Analysis 综合智能指数从上代的 17 分升至 43 分(见前述钛媒体综述)。旗舰侧,9 月 22 日发布的 Claude Opus 5.5 把价格从 Opus 4.5 的 $5/$25 降到了 $4/$20。
于是 10 月的旗舰格局是三层:闭源三强(OpenAI、Anthropic、Google)正面互搏;国产四强(GLM-5.3、DeepSeek V4-Pro、Kimi K3、Qwen3.8-Max)以几分之一的价格贴身跟进;开放权重阵营里,据 Artificial Analysis 综合智能指数(2026-09 下旬数据),小米 MiMo-V2.6-Pro 以 46.32 分排在开放权重第一,高于 GLM-5.3 的 45 分与 Kimi K3 的 44 分。开源旗舰本文只作价格参照行,不展开版图与许可证。
小结:能力与价格两条轴在这一周同时移动,正是做横评的好时点。
能力定位:各家旗舰到底强在哪
Anthropic 把宝押在编程与 Agent 的真实产出上。 Anthropic 官方发布称,Opus 5.5 在默认推理强度(medium)下即得 52.5%,超过 max 档的 Fable 5.1(51.8%)与上代 Opus 5(46.6%),也压过 GPT-5.6 Sol 的最好成绩;第三方 SWE-bench Pro 榜单(benchlm.ai,2026-10-09)显示 Opus 5.5 以 89.9% 领跑,Sonnet 5.5 为 81.3%,Fable 5.1 为 81.2%。一个值得注意的背景是:SWE-bench Verified 这类老榜已近饱和,vals.ai 数据显示 Opus 5 早达到约 97%,Anthropic 干脆未公布 Fable 5.1 的 Verified 成绩。
OpenAI 的差异化在「让模型动手」。 据 DataNorth 等第三方评测转述,gpt-6-astra 在真实计算机操作基准 OSWorld 2.0 上拿到 72.6%,较前代明显跳涨。但评测社区也在泼冷水:Atlas Cloud 9 月初的评测提醒直言 Astra 的跑分「是证据,不是部署结论」,多个榜单类目已经饱和;SignalMelo 对 Reddit 与 X 上开发者讨论的汇总则显示,社区对 GPT-6 Sol 的定价普遍好评,对模型本身评价两极。
Google 的 Gemini 3.1 Pro 走多模态长文档路线。 第三方评测转述其在 ARC-AGI-2 上得 77.1%;官方未在 API 定价页强调跑分,而是把它作为消费级套餐(AI Pro 及以上)的默认旗舰,入口覆盖面在三家里最广。
国产四强各有主打。 阿里官方称 Qwen3.8-Max(2.4 万亿参数、激活约 95B 的 MoE)PaperBench 得 93.0 分,并在 OSWorld-Verified 与 Vision Arena 领先(Qwen 官方发布);智谱官方称 GLM-5.3 编程与 Agent 能力对标 Claude Fable 5;DeepSeek V4-Pro(1.6 万亿参数、MIT 许可)延续高性价比口碑;月之暗面 Kimi K3(2.8 万亿参数、开放权重)代表国产开源的参数上限。行业报道还提示了一个反方向趋势:多家厂商开始推千亿级小旗舰,「大模型集体变小」与阿里、DeepSeek 押注 10 万亿参数的豪赌并行。
小结:跑分层面没有全能王——编程看 Claude,Agent 看 GPT-6,多模态长文档看 Gemini,性价比与开源看国产;读所有榜单都应带着「饱和」与「口径」两个疑问。
上下文窗口:1M 成了标配,计价才是分水岭
先把硬规格摆平:GPT-6 系上下文约 105 万 token(输入超过 27.2 万切换长上下文档);Anthropic 现役全系 1M(官方文档口径为 Claude 4.6 及以后型号,Haiku 5.5 按段计价);Gemini 3.1 Pro 为 1M;国产四家 GLM-5.3、DeepSeek V4-Pro、Qwen3.8-Max 均 1M,Kimi K3 为 1,048,576(Moonshot 官方定价页)。「100 万上下文」在 2026 年 10 月已不构成差异化卖点。
输出上限的差异更值得看:DeepSeek V4-Pro 支持最高 38.4 万 token 输出,是已知旗舰里最宽的;Anthropic 现役机型标称 12.8 万,Opus 5.5 与 Sonnet 5.5 可经 Message Batches API 以 beta 参数拿到 30 万输出;Qwen3.8-Max 为 131,072,思考模式下思维链另可到约 26.2 万;GPT-6 系标称 12.8 万。
真正影响钱包的是计价分层:Gemini 3.1 Pro 输入超过 20 万 token 后单价上台阶;GPT-6 系超过 27.2 万后同样切长文档;Claude 反其道行之,官方文档原话是「90 万 token 的请求与 9 千 token 按同价计费」;Haiku 5.5 则以 10 万 token 为界换高档。窗口标称 1M 与「真跑满 1M 的账单」是两回事。
小结:窗口数字趋同之后,长上下文计费规则才是这一代旗舰的真实差距所在。
API 定价:把每一档的账算清
主对比表如下。单价均为每百万 token;美元为各厂美国官方牌价,人民币为国内刊例价,不做汇率换算,均截至 2026-10-10。
| 模型 | 厂商 | 上下文 | 输入价 | 输出价 | 订阅入口 | 定位 |
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 约 105 万 | $10 | $50 | Pro $200/月 | Agent 与计算机操作旗舰 |
| GPT-6.1 Sol | OpenAI | 约 105 万 | $2 | $10 | Plus $20/月 | 付费档主力,性价比核心 |
| Claude Fable 5.1 | Anthropic | 100 万 | $10 | $50 | 限量供应,API 为主 | 旗舰档,长程 Agent |
| Claude Opus 5.5 | Anthropic | 100 万 | $4 | $20 | Pro $20/月 | 编程与 Agent 默认旗舰 |
| Gemini 3.1 Pro | 100 万 | $2 | $12 | AI Pro $19.99/月 | 多模态长文档,消费入口最广 | |
| GLM-5.3 | 智谱 | 100 万 | ¥8 | ¥28 | Coding Plan 套餐 | 国产编程旗舰 |
| DeepSeek V4-Pro | DeepSeek | 100 万 | 峰 $1.32 | 峰 $3.96 | 纯 API | MIT 开源,峰谷计价 |
| Kimi K3 | 月之暗面 | 约 105 万 | ¥20 | ¥100 | 纯 API | 2.8 万亿参数开放权重 |
| Qwen3.8-Max | 阿里 | 100 万 | ¥12 | ¥36 | 百炼 Token Plan | 多模态办公旗舰 |
表注:Gemini 3.1 Pro 输入超 20 万 token 时为输入 $4、输出 $18;GPT-6 系输入超 27.2 万 token 时 gpt-6-astra 为 $20/$75、gpt-6.1-sol 为 $4/$15;DeepSeek 为峰时价(UTC 周一至周五 01:00–04:00 与 06:00–10:00 为峰,官方定价页),谷时减半;人民币价分别见智谱官方定价、Moonshot 官方定价与阿里云百炼模型目录(Qwen3.8-Max 为 2026 年 8 月发布刊例)。
四条账目规则值得展开:
- 缓存命中才是 Agent 时代的真实单价。 Opus 5.5 缓存读 $0.20(官方称降至 0.05 倍率)、Kimi K3 命中价 ¥2 对牌价 ¥20、DeepSeek V4-Pro 峰时命中 $0.044、GLM-5.3 命中 ¥2、Qwen3.8-Max 命中 ¥1.5——对多轮工具调用负载,命中率往往比牌价更能决定月账单。
- 批处理与时段折扣普遍在五折上下。 OpenAI 的 Batch/Flex、Anthropic 的 Batch API、Google 的 Batch API 均为半价;DeepSeek 用峰谷时段、阿里百炼用夜间 22:00 至次日 08:00 的 Credits 四折做变体。
- 长上下文溢价三家三种做法。 Gemini 按输入 20 万 token 分档,OpenAI 按 27.2 万分档,Claude 全窗同价——同样塞满 1M 窗口,Claude 的账单结构最可预测。
- 跨厂比价前先对齐分词口径。 Anthropic 官方文档提示 Claude 4.7 及以后机型换用新分词器,同文本 token 数约多 30%,直接拿单价对比会失真。
小结:这一代旗舰的牌价差在 10 倍以上,但真实成本由缓存、批处理、时段与分词四个修正项共同决定。
订阅方案:同一笔钱,三种买法
ChatGPT 侧:Free 之上是 Go(约 $8/月,部分市场)、Plus $20/月、Pro $200/月,Business 与 Enterprise 按席位计费;GPT-6 全量之后,付费档跑 Sol、免费档跑 Luna,Intelligent UI 全员可用(官方公告)。
Google 侧档位最多也最碎(Google AI 套餐页):Free 档上下文仅 3.2 万 token;AI Plus $7.99/月解锁 12.8 万;AI Pro $19.99/月给到 Gemini 3.1 Pro 与 100 万上下文,含 Deep Research;AI Ultra 自 $99.99/月起。免费档与付费档的上下文差距在三家里最悬殊。
Anthropic 侧名义价格最高,但额度口径激进:Pro $20/月(年付 $214.99)、Max 5x $124.99/月、Max 20x $249.99/月;据钛媒体在 Haiku 5.5 发布时的转述,官方口径下 $20 档的额度约相当于 $1,200 的 API 价值。
一点个人观察(观点,非事实):以对话为主的普通重度用户,订阅仍是性价比最高的入口,$20 一档三家正好同价,按生态与工具链选即可;但跑生产负载时,订阅限额与 API 牌价是两本账,不要互相换算,更不要拿订阅价去推导「API 一 token 值多少钱」。
小结:订阅比的是生态与限额,API 比的是单价与缓存,两套体系分开算。
选型建议:按场景对号入座
| 场景 | 首选 | 备选 | 一句话理由 |
|---|---|---|---|
| 复杂编程与大型重构 | Claude Opus 5.5 | GLM-5.3 | SWE-bench Pro 89.9% 领跑且 1M 不加价 |
| 高频生产 Agent | GPT-6.1 Sol | GPT-6 Astra | $2/$10 加 $0.10 缓存,闭源中档最激进 |
| 超长文档与多模态 | Gemini 3.1 Pro | Claude Opus 5.5 | 原生多模态,注意 20 万 token 分档 |
| 海量低成本调用 | GPT-6 Luna | Claude Haiku 5.5 | $0.10/$0.50 的地板价 |
| 国内合规与私有化 | DeepSeek V4-Pro | Kimi K3 | MIT 许可,谷时再省一半 |
| 个人订阅用户 | ChatGPT Plus | Claude Pro | 同为 $20/月,按生态与限额选 |
三条补充判断(含观点,均已注明出处):
- 编程与大型重构,现阶段公开证据最硬的是 Claude Opus 5.5:SWE-bench Pro 领先(benchlm.ai,2026-10-09)加上 Anthropic 官方「默认档超上代旗舰」的口径,叠加 1M 窗口不加价,长仓库重构的账单最可控。预算敏感的团队可按智谱官方「对标 Fable 5」的说法先用 GLM-5.3 跑通同一题集再定。
- 高频生产 Agent 优先看单位产出成本:GPT-6.1 Sol 的 $2/$10 与 $0.10 缓存读,是闭源中档里最激进的价格组合;Astra 的 OSWorld 2.0 成绩(第三方评测转述 72.6%)说明它适合放在关键链路,Sol 适合放量。
- 国产旗舰的合理用法是「同题对比」:Qwen3.8-Max 与 GLM-5.3 牌价接近,Kimi K3 输出 ¥100 偏贵但开放权重可私有化,DeepSeek V4-Pro 的峰谷计价适合能错峰执行的流水线;开源参照系里 MiMo-V2.6-Pro 的登顶也提醒我们,开放权重阵营的天花板已经贴住闭源中档。
最后提醒:本文是 2026-10-10 的快照。社区已在讨论下一代的踪迹(如传闻中的 Kimi K4 与 GLM-5.5),横评结论的保质期大概只有一个季度——把本文当月度对账单用,别当年鉴。
参考资料
- OpenAI 定价文档 ——
gpt-6-astra/gpt-6.1-sol/gpt-6-luna全部单价、缓存与长上下文档的官方出处。 - OpenAI:GPT-6 and Intelligent UI for everyone —— GPT-6 全量推送时间线与 Sol/Luna 分档的官方公告。
- Anthropic 官方定价文档 —— Opus 5.5、Sonnet 5.5、Fable 5.1、Haiku 5.5 单价、缓存倍率与长上下文计费规则。
- Anthropic 模型概览 —— 现役阵容、1M 上下文与 12.8 万输出的官方口径。
- Google Gemini API 定价 —— Gemini 3.1 Pro Preview 与 Flash 系价格及 20 万 token 分档。
- Google AI 订阅套餐 —— Free / AI Plus / AI Pro / AI Ultra 档位与上下文额度。
- DeepSeek API 定价 —— V4-Pro 与 V4.1-Flash 的峰谷价、1M 上下文与 38.4 万输出上限。
- 钛媒体:GPT-6 全球上线、Claude Haiku 5.5 降价,这个假期 AI 圈也没停 —— 横评时点两条关键新闻的中文综述,含 Haiku 5.5 降价幅度与订阅额度口径。
读者留言
COMMENTS 暂无还没有留言,来说第一句?