2026 年夏天,开放权重模型的参数规模跨过了一个心理关口。7 月中旬(北京时间 7 月 17 日),月之暗面发布 Kimi K3,总参数 2.8 万亿,官方称之为「全球首个开放的 3T 级模型」,全量权重随后放出;不到一个月,阿里在 8 月 3 日正式发布 Qwen3.8 旗舰,8 月上旬开放了 2.4 万亿参数版本的权重。「万亿参数」在 2024 年还是闭源实验室的专属数字,如今任何人都可以从 HuggingFace 把它拉到自己机房。本文基于两个项目的 GitHub 仓库、HuggingFace 模型卡与官方博客(均于 2026-10-11 核查),回答三个问题:这两块万亿级的「技术牌」具体成色如何;稀疏 MoE、低精度量化这些技术如何让万亿参数在经济上可行;以及标题数字背后有哪些必须说清的另一面。
格局:开放权重阵营的「万亿双雄」
先看全景。2026 年的开放权重阵营由中国厂商主导,万亿级梯队目前只有两家:Kimi K3(2.8T)与 Qwen3.8 的开放版本(2.446T)。第二梯队里,DeepSeek 的 V4.1-Flash(552B 主干加 196B 稀疏访问记忆,MIT 许可,9 月 10 日发布)以 KV 缓存极限优化为卖点;智谱 6 月发布的 GLM-5.2 约 744B(激活约 40B,MIT);腾讯混元 Hy3 约 295B(激活约 21B);MiniMax 6 月的 M3 参数未完整披露。行业形态被 Fireworks AI 总结为一句话:万亿总参数的 MoE,每个 token 只激活 100 亿到 400 亿参数。
| 模型 | 机构 | 发布时间 | 总参 / 激活 | 许可证 |
|---|---|---|---|---|
| Kimi K3 | 月之暗面 | 2026-07 | 2.8T / 104B | 自定义 Kimi K3 License |
| Qwen3.8 开放版 | 阿里通义 | 2026-08 | 2.446T / 95B | 自定义 qwen3.8-max |
| DeepSeek V4.1-Flash | DeepSeek | 2026-09 | 552B + 196B 记忆 | MIT |
| GLM-5.2 | 智谱 | 2026-06 | 约 744B / 约 40B | MIT |
| 混元 Hy3 | 腾讯 | 2026-08 | 约 295B / 约 21B | 未查到一手文本 |
需要澄清一个容易混淆的点:Qwen 家族首个突破万亿参数的模型是 2025 年 9 月的 Qwen3-Max-Preview(超 1T,但仅通过 API 提供、不放权重);这次 8 月开放权重的 Qwen3.8(仓库名 Qwen3.8-2.4T-A95B)是家族首个开放权重的万亿级模型——「首个万亿」与「首个开放权重的万亿」是两回事。
Kimi K3:首个 3T 级开放权重的成色
K3 的 GitHub README 与 HuggingFace 模型卡给出的规格相当扎实。总参数 2.8T(safetensors 分片合计约 2.78T),每 token 激活 104B,激活比约 3.7%——896 个路由专家中每个 token 只激活 16 个,外加 2 个共享专家。注意力侧是 93 层中 69 层采用 KDA(Kimi Delta Attention,线性注意力谱系)加 24 层全注意力的 Gated MLA,配合注意力残差连接;原生上下文 1,048,576(1M tokens);内置 401M 参数的 MoonViT-V2 视觉编码器,文本、图像、视频理解开箱即用。最关键的工程决策是从 SFT 阶段就做量化感知训练:MXFP4 权重加 MXFP8 激活,让 2.78T 参数的 checkpoint 压到约 1.56 TB。
成绩单(官方自报的 K3 max 档)如下,对比对象是当前两大闭源旗舰:
| 基准 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| GPQA Diamond | 93.5 | 94.1 | 92.6 |
| SWE-Marathon | 42.0 | 39.0 | 35.0 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 88.0 |
| BrowseComp | 91.2 | 90.4 | 88.0 |
读法要公允:在最难的软件工程长任务 FrontierSWE 上 K3 是 81.2,落后 Claude Fable 5 的 86.6;HLE-Full 有工具档 56.0,同样低于 Fable 5 的 63.0。官方博客自己也承认「仍落后于最强专有模型」。同时它的 API 定价(输出 $15/M tokens、缓存命中输入 $0.30/M)配合官方宣称编程负载下超 90% 的缓存命中率,把「用得起的万亿模型」从口号往前推了一步。据多个中文媒体报道,K3 发布数小时后登顶了某代码工具竞技场榜单,报道称这是中国模型首次——此说未见榜单原始数据佐证,姑妄听之。
Qwen3.8:阿里牌面与开放的边界
Qwen3.8 的开放权重版本在架构上同样激进:总参 2.446T、激活 95B(激活比约 3.9%),512 个专家每 token 路由 10 个加 1 个共享;92 层里四分之三的层用 Gated DeltaNet(线性注意力谱系)、四分之一用传统门控注意力,并采用多步 MTP 训练。原生上下文 262K,可扩展至约 1M。模型卡自报 SWE-bench Pro 67.7、GPQA Diamond 92.6、PaperBench 93.0,但在 SWE-bench Pro 与最强闭源对比(80.0)及 DeepSWE(56.6 对 73.0)上仍有明显差距——值得注意的是,部分成绩标注在「Qwen3.8-Max 产品层」,与纯开源权重的结果可能不一致,引用时要留意口径。
更有信息量的是「开放」的边界。其一,开放的是纯文本版:模型卡明确说明视觉输入只在官方托管的 API 版提供,开源权重没有多模态能力——与 K3 原生视觉形成鲜明对照。其二,许可证从 Apache 2.0 转向自定义协议:此前 Qwen 系列旗舰长期以 Apache 2.0 开放,这次万亿旗舰换成了名为 qwen3.8-max 的自定义许可,报道普遍解读为阿里在旗舰档收紧了开放策略。权重在 HuggingFace 无需审批即可下载,社区已有 34 个量化版本,但「开放权重」与「宽松开源」在这块牌子上分了家。
万亿为何在此时可行:三根技术支柱
把 K3 与 Qwen3.8 的规格放在一起,能看清 2026 年万亿参数经济学的三根支柱。
flowchart LR
A[总参数量决定容量上限] --> B[支柱一 稀疏 MoE]
A --> C[支柱二 低精度量化]
A --> D[支柱三 注意力降本]
B --> B1[K3 激活比 3.7% / Qwen 3.9%]
C --> C1[MXFP4 QAT 压缩 checkpoint]
D --> D1[线性注意力 + KV 缓存分离]
第一根支柱是稀疏 MoE 把「容量」与「单 token 成本」解耦。两家激活比都在 4% 以下:总参数决定模型的知识容量上限,激活参数决定每个 token 的算力开销,两者从此各算各的账。这也是为什么「万亿总参、百亿激活」成了 2026 年旗舰的统一形态——MiniMax M2.7 早在 2025 年就验证了 4.3% 激活比的可行性。
第二根支柱是低精度训练与量化。K3 从 SFT 阶段就做量化感知训练(MXFP4 权重、MXFP8 激活),checkpoint 直接就是量化格式,2.78T 参数只占 1.56 TB 存储——作为对照,Qwen3.8 未量化的 BF16 权重要 4.89 TB。低精度同时压缩了训练显存、权重存储与推理带宽,是从「跑得动」到「存得下」的关键一步;行业里 FP8 变体(GLM-5.2-FP8 等)已是开放模型的标准配置。
第三根支柱是注意力侧的持续降本。长上下文的成本大头在注意力与 KV 缓存:K3 用 69 层 KDA 线性注意力把全注意力压到 24 层,并向 vLLM 贡献了 KDA 前缀缓存;Qwen3.8 用 Gated DeltaNet 覆盖四分之三的层;DeepSeek V4.1-Flash 的配套论文标题干脆就叫「把 KV 缓存推向极限」。叠加 Mooncake 式 KV 缓存分离架构(K3 官方称编程负载缓存命中率超 90%),长上下文推理的单价被持续压低。三根支柱叠加,才有「输出 $15/M tokens 的 3T 模型」这种一年前不存在的价格结构。
部署现实:开放的是权重,不是「人人可跑」
这里必须泼一盆冷水:开放权重不等于个人可跑。K3 的 1.56 TB 量化权重意味着最低 8×H100(640GB 显存)起步,现实配置是 16 至 32 张 H200 或 8×B300;官方部署建议是「64 卡以上的 supernode」;512GB 统一内存的 Mac Studio M3 Ultra 装不下完整版;租一个推理节点每小时 40 至 100 美元起。换言之,真正在本地跑万亿模型的是云厂商与大型机构,绝大多数开发者实际经手的是 API 或第三方托管(Qwen3.8 开放版经托管方输出约 $6/M tokens)。社区生态确实热闹——K3 在 HuggingFace 月下载约 116 万、56 个社区量化版本,但主流玩法是量化切片加多卡,不是「笔记本上跑旗舰模型」叙事的延续。评估「开放」的价值时,门槛这项要如实计入。
「开源」名实之辩与批评声音
围绕这两个模型还有三层争论,写代码前值得想清楚。第一层是许可证:两家旗舰都是自定义许可——K3 允许免费商用,但 MaaS 年营收超 2000 万美元需另签协议,产品月活超 1 亿须在界面标注「Kimi K3」;Qwen 则干脆弃用了 Apache 2.0。按 OSI 的开源 AI 定义与 Debian 的分发标准,它们都算不上「开源」;讽刺的是 2026 年许可证最干净的反而是定价激进的 DeepSeek(MIT)与智谱(MIT)。OSI 定义本身因允许「披露数据信息而非数据本身」也在挨批,Debian 已因此拒绝分发主流开放权重模型——「开源 AI」的定义战远未结束。
第二层是参数营销的质疑:2.8T 总参对应 104B 激活,标题数字与实际算力开销差 27 倍,CSDN 等评论直指这是拿「容量上限」当「模型大小」来传播,并批评 K3 技术报告隐去训练算力数据(训练成本至今无官方数字)。第三层是 benchmark 可信度:此前 Kimi 系模型有过自报成绩与独立复测差距明显的记录(有独立复测称 HLE 成绩仅约官方自报的六成),第三方独立榜单 BenchLM 给 K3 的综合分(71.88,第 11 名)也明显低于官方叙事。这些批评不改变「开放模型逼近闭源旗舰」的大趋势——官方模型卡自认仍落后最强闭源约一代 benchmark,但多方分析认为差距已收窄到 3 至 6 个月,个别基准(如 GLM-5.1 在 SWE-Bench Pro 超过 GPT-5.4)已有反超——却提醒我们:读成绩单先看谁家自报、激活多少、许可几条。
写在最后
万亿参数开放权重的落地,技术上是稀疏 MoE、低精度量化与注意力降本三线并进的水到渠成,商业上是中国厂商以开放换生态的集体选择。对使用者,本文的实操结论是:评估这类模型时盯三个数字——激活参数(真实算力成本)、权重体积(真实部署门槛)、许可条款(真实商用边界),而不是标题里的总参数量;选型上 MIT 系(DeepSeek、GLM)许可最干净,K3 适合要原生多模态与 1M 上下文且能接受自定义许可的场景,Qwen3.8 开放版则是纯文本场景下生态与工具链最顺的选择。本文作者判断(推测,非事实结论):参数量竞赛的营销价值正在超过工程价值,下一阶段的分化点会在数据质量、长上下文缓存与多模态原生的组合上——万亿只是入场券,不是护城河。
参考资料
- MoonshotAI/Kimi-K3(GitHub README):架构、参数、benchmark 与部署建议的一手来源。
- Kimi K3 模型卡(HuggingFace):权重体积、量化格式与社区生态数据。
- Kimi K3 官方博客(kimi.com):API 定价、缓存命中率与官方自认局限。
- Qwen/Qwen3.8-2.4T-A95B 模型卡(HuggingFace):Qwen3.8 开放权重版架构与许可。
- 2.8 万亿!全球参数最大的开源模型发布(科技日报,2026-07-17):发布时间的中文官方媒体佐证。
- Kimi K3 LICENSE(GitHub):商用与署名条款原文。
- DeepSeek-V4.1-Flash:Pushing the Limits of KV Cache(arXiv,2026-09):KV 缓存优化路线的技术细节。
读者留言
COMMENTS 暂无还没有留言,来说第一句?