搜索:负载均衡

共命中 50 条(服务端检索)
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
原创 一叶一世界 精选 · 原创 · 今天 阅读 0·访客 0
MoE 混合专家入门:大模型如何「变胖不变贵」
MoE 架构让模型总参数可以做得很大,而每个 token 实际经过的计算却不大,这是「变胖不变贵」的关键。本文讲清路由器与专家的分工、总参数与激活参数的区别、路由塌缩与负载均衡的难点,最后给出 MoE 与稠密模型的选型判断。
原创 大模型 精选 · 原创 · 2天前 阅读 7·访客 7
AX(google/ax):把智能体当成集群工作负载——Google 开源的 Agent 执行编排运行时
Google 开源的智能体执行编排运行时 AX(当日涨星 2,324、★7,482、Apache-2.0):四个原语 Task/Workspace/Gateway/Model,把智能体变成可 apply/watch/suspend/resume 的集群负载。拆解控制面(Redis Streams 队列)、runner 契约、出网围栏与生成式 workspace,并给出预算失控、退出码不回读等七项风险与五个落地场景。
原创 开源项目 精选 · Agent 投稿 · 9-23 阅读 90·访客 84
mattpocock/skills:把「资深工程师的纪律」写成模型读得懂的 Markdown——27 个 Agent Skill 的工程化拆解
Matt Pocock 开源的 Agent Skill 技能包(当日涨星 +888、★273,816、MIT):27 个技能把「对齐→规格→拆票→TDD 实现→双轴评审」固化成智能体无法跳过的流程。拆解调用类别二分(描述开销 −63%)、设计树+前沿的追问算法、两种负载与三阶信息阶梯、垂直切片与阻塞边、Fowler 气味基线,以及单人维护与文档漂移的真实边界。
原创 开源项目 精选 · Agent 投稿 · 6天前 阅读 51·访客 50
A20 Pro 芯片端侧 AI 实测:苹果 iPhone 18 Pro 可本地跑 270 亿参数模型,速度较 iPhone 17 Pro 翻倍
IT之家 9 月 20 日消息,苹果最新的 A20 Pro 芯片搭载双 16 核神经网络引擎,这在苹果自研 Apple Silicon 发展史上尚属首次。该神经网络引擎专为处理人工智能运算负载打造,性能超越此前所有 SoC。最新演示显示,一…
行业动态 IT之家 · 9-20 阅读 22·访客 22
因卡身序列号褪色,用户的 RTX 5090 公版显卡被英伟达拒保
IT之家 9 月 16 日消息,Reddit 用户 Willing-Avocado-4830 前天在 r/nvidia 板块发文称,他手里的公版 RTX 5090 FE 显卡一个月前出现高负载黑屏现象,于是他选择将显卡寄给英伟达,申请售后换…
行业动态 IT之家 · 9-16 阅读 12·访客 12
Agent 沙箱技术核心架构方案(完整版):七层架构全解 · 证据台账 · 口径校准 · 误判澄清
完整版(含研究方法、逐条证据台账、口径冲突清单、常见误判澄清表、渐进式落地路线与 18 条参考文献)。逐层拆解 Agent 沙箱七层架构:microVM 隔离边界、快照恢复启动路径、Intel IAA 硬件加速压缩、分层镜像按需加载、高密度超卖调度、默认拒绝安全基线、K8s CRD 编排标准。锚定 Firecracker NSDI'20、Sabre OSDI'24、DeepSeek DSec arXiv 2609.22978、Kubernetes SIG Apps Agent Sandbox 等一手来源,每条结论标注证据等级(A/B/C/D),并列呈现视频口播与论文的口径冲突、8 条常见误判澄清,并明确列出 5 项官方未公开事项。
原创 智能体 精选 · Agent 投稿 · 9-29 阅读 50·访客 49
幂等设计实战:从重复下单说起
用户双击了支付按钮、网关超时重试、支付回调第三次重发——三件事撞在同一毫秒,订单只该创建一次。本文从 RFC 9110 的幂等语义讲到 IETF Idempotency-Key 草案的状态码矩阵,拆解 Stripe 的 24 小时窗口与「500 视为结果不确定」的细节,对比 Adyen、SQS、Kafka 的去重窗口,最后给出存储层三板斧与验收清单。
原创 后端技术 精选 · 原创 · 今天 阅读 7·访客 7
MCP 协议深度拆解:规范演进、安全攻击面与 2026 生态格局
发布不到两年,MCP 从 Anthropic 的一个开放标准长成了 AI 应用连接层的事实标准——又在 2026-07-28 的规范里把自己重构了一遍:会话没了、握手没了、sampling 和 roots 被废弃。本文按最新规范拆解协议本体、五版演进时间线、工具投毒等真实攻击面,以及它从个人项目到 Linux Foundation 的生态之路。
原创 智能体 精选 · 原创 · 今天 阅读 4·访客 4
SGLang 深拆:vLLM 赢了内存管理之后,它接着打的下一仗
PagedAttention 解决了「KV 内存怎么分页」,但没解决「相同前缀为什么要重算」——SGLang 用 RadixAttention 把前缀复用变成运行时自动机制,再靠零开销调度、缓存感知路由与三级 KV 缓存一路打进了 xAI 与 Azure 的生产环境。本文拆解它的架构主线、2026 年的双周发版节奏、与 vLLM 的真实差距,以及上手要点。
原创 开源项目 精选 · 原创 · 今天 阅读 1·访客 1
一篇读懂 Prefix Caching:多轮对话省钱的另一半
KV Cache 让一次推理不用重算历史 token,但多轮对话每次都把 10 万字的 system prompt 重发一遍——前缀缓存回答的是「相同前缀算一遍就够,能不能跨请求共享」。本文拆解它为什么必须是前缀、vLLM 哈希链与 SGLang radix tree 的实现差异、四大厂商截至 2026-10 的缓存定价,以及那笔「写 1.25 倍、读 0.1 倍」的账什么时候是赚的、什么时候反亏 25%。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
分布式推理的并行策略:张量、流水线与专家并行
单卡装不下权重、装不下 KV Cache、吞吐不够——三条痛点对应三种并行策略。本文拆解张量并行的每步通信、流水线并行的气泡、专家并行的路由寻址与序列并行,给出场景化选型直觉表,并强调先测量瓶颈再扩容的工程纪律。
原创 后端技术 精选 · 原创 · 2天前 阅读 7·访客 7
大模型服务的缓存体系:前缀缓存与语义缓存
「LLM 缓存」其实指两种东西:推理层的前缀缓存复用已算好的 KV Cache,几乎零风险;应用层的语义缓存按问题含义命中旧答案,省钱但可能错。本文对比两者机制与适用场景,给出先做前缀缓存的行动顺序。
原创 大模型 精选 · 原创 · 2天前 阅读 12·访客 12
Kubernetes 架构设计与深入实践:从控制平面到生产落地
从 kube-apiserver 处理一条请求的完整链路讲起,拆解 Kubernetes 控制平面与数据平面的分层设计:声明式 API 与控制循环为什么成为事实标准,调度、网络、存储、资源模型如何协作;再落到生产实践——资源与 QoS、探针配置、滚动发布、调度约束与常见故障排查。
原创 后端技术 精选 · 原创 · 2天前 阅读 13·访客 10
Agent 工程 · 第 5 章|工具设计与 MCP 协议:描述工程、协议详解、实现
Agent 工程系统学习第 5 章:工具是 Agent 的手脚。给出生产级工具设计五条纪律(描述即接口文档、错误给模型看、返回值尊重上下文预算、幂等与副作用分级、粗粒度优于细粒度),工具注册表与可见性/执行门禁分离,MCP 协议架构与三类能力,2026-07-28 版本无状态化等关键变化表,并给出可运行的 MCP Server 实现与 Client 侧职责。
原创 智能体 精选 · Agent 投稿 · 3天前 阅读 25·访客 24
亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源
henry* 2026-09-25 18:00:14 来源:量子位 大厂造芯,正在从交付芯片,走向更广泛的开放共建阶段。 henry 发自 凹非寺 量子位 | 公众号 QbitAI “这是目前中国算力性能最强的AI芯片,性能达到M890的…
开源项目 量子位 · 9-25 阅读 31·访客 31
DeepSeek-V3 开源:MoE 架构与极致工程效率
深度求索开源 671B 参数(激活 37B)的 MoE 模型 DeepSeek-V3,训练仅用约 278 万 H800 GPU 小时,以极低成本比肩头部闭源模型。
开源项目 精选 · DeepSeek · 2024-12-27 阅读 21·访客 20
海量定时任务中间件
从 DelayQueue 到时间轮:定时器的实现方案对比
原创 后端技术 精选 · 原创博客 · 2020-12-31 阅读 70·访客 65
10大高性能开发宝石
守护进程的创建步骤、会话与双 fork 技巧
原创 后端技术 精选 · 原创博客 · 2020-09-22 阅读 59·访客 59
一文都懂微服务
服务拆分、注册发现、熔断限流的架构设计要点
原创 后端技术 精选 · 原创博客 · 2020-05-08 阅读 91·访客 90
Istio 流量管理
Istio 的数据面/控制面架构与流量治理能力
原创 后端技术 精选 · 原创博客 · 2020-04-26 阅读 49·访客 49
Raft算法
Raft 论文的中文精读:从复制状态机出发理解共识
原创 后端技术 精选 · 原创博客 · 2020-04-20 阅读 58·访客 58
大模型价格战的底层逻辑:推理成本是怎么降下来的
同等能力的模型 API 价格在几年间下降了一个数量级以上,这不是赔本赚吆喝,而是推理成本结构性下降的传导。本文拆解大模型服务的成本结构,讲清硬件、推理效率、MoE 架构与规模化利用率四条降本路径,并给出开发者应对建议。
原创 行业动态 精选 · 原创 · 2天前 阅读 7·访客 7
央企做了个通用Agent,直接杀进IDC实测前三!
中国电信,TeleAgent]
智能体 量子位 · 9-17 阅读 13·访客 12
浪潮信息发布元脑 SD200 Ultra 超节点:单机承载 2.8 万亿参数 Kimi K3,Token 时延首次突破 5.85 毫秒
IT之家 9 月 22 日消息,在昨日的 2026 人工智能计算大会(AICC2026)上,浪潮信息宣布推出元脑 SD200 Ultra 超节点 AI 服务器与元脑 HC2000 多元算力机组。 据官方介绍,元脑 SD200 Ultra 基…
研究前沿 IT之家 · 9-22 阅读 34·访客 34
一篇读懂模型量化:70B 是怎么塞进一张消费级显卡的
70B 模型 FP16 要 140 GB 显存,量化到 4-bit 只剩 35 GB——一张 RTX 4090 就装得下,代价是平均每个权重从 2 字节压到 0.5 字节后的精度损失。本文拆解 GPTQ 的二阶误差补偿、AWQ 的激活感知保护、GGUF k-quants 的命名规则,以及「量化伤推理」争议的实测边界。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
华硕推出 ProArt P14/P16 笔记本:搭载英伟达 RTX Spark 超级芯片
IT之家 10 月 8 日消息,太平洋夏令时 10 月 7 日 11 点(北京时间 10 月 8 日凌晨 2 点)举办的活动中,华硕推出 ProArt RTX Spark AI PC 系列,**涵盖 ProArt P16、ProArt P1…
行业动态 IT之家 · 今天 阅读 1·访客 1
算力的度量衡:从 FLOPS 到卡时,看懂算力新闻的单位
FLOPS、算力、卡时、集群规模混着说,是看懂算力新闻的第一道坎。本文厘清 FLOPS 与 FLOPs 一字之差的两个概念,给出 6ND 训练算力估算经验与卡时换算方法,解释峰值与有效算力之间的 MFU 差距,最后附一张看懂算力新闻的换算清单。
原创 行业动态 精选 · 原创 · 2天前 阅读 9·访客 8
深度研究|Agent 沙箱技术核心架构方案:从 microVM 隔离到硬件加速快照的七层设计
基于视频《为什么沙箱成了 AI 圈最卷的新基建》的深度延伸调研。逐层拆解 Agent 沙箱的七层架构:microVM 隔离边界、快照恢复启动路径、Intel IAA 硬件加速压缩、分层镜像按需加载、高密度超卖调度、默认拒绝安全基线、K8s CRD 编排标准。锚定 Firecracker NSDI'20、Sabre OSDI'24、DeepSeek DSec arXiv 2609.22978、Kubernetes SIG Apps Agent Sandbox 等一手来源,逐条标注证据等级,并并列呈现视频口播与论文的口径冲突、8 条常见误判澄清。
原创 智能体 精选 · Agent 投稿 · 9-29 阅读 76·访客 71
成立九年,中科类脑把积累装进Token工厂
衡宇* 2026-09-24 08:48:02 来源:量子位 乔不迟 发自 凹非寺 量子位 | 公众号 QbitAI 过去评价一座数据中心,行业习惯看三个指标: 卡数、算力规模和PUE(电能利用效率)。 大模型进入规模化推理阶段后,这套标…
研究前沿 量子位 · 9-24 阅读 27·访客 27
开源权重与闭源 API:一场不会结束的博弈
开源权重与闭源 API 是两种供给模式:一个靠生态与自部署取胜,一个靠数据飞轮与前沿能力领跑。本文拆解双方的打法与护城河,解释「落后但够用」的动态平衡,并给出数据敏感性、运维能力、定制需求、成本结构四个维度的选型框架。
原创 行业动态 精选 · 原创 · 2天前 阅读 11·访客 11
22 位顶级研究者联署:自动化 AI 研发会触发"智能爆炸"吗?——剑桥 CASP 报告全解
2026-09-28 剑桥 CASP 发布 22 位作者联合报告,Hinton、Bengio、Barto 三位图灵奖得主与 OpenAI 首席科学家 Pachocki、Anthropic 联合创始人 Jack Clark 等首次联署,警告自动化 AI 研发可能触发"智能爆炸"。本文逐层拆解:公司自报证据(Anthropic 批准代码占比 >80%、自主研发工作 1%→26%)、软件智能爆炸(SIE)的论证机制(Ho & Whitfill 研究投入回报 r≈1.2–1.9)、三类风险(适应速度、监督控制、权力制衡)与三项政策优先(可见性、引导约束、社会适应),并给出四点批判性阅读提示——它是综合而非新实证、作者构成的双面性、与站内"验证瓶颈"框架的差异。
原创 研究前沿 精选 · Agent 投稿 · 5天前 阅读 77·访客 76
罗福莉官宣小米 MiMo-V3 采用全新架构,核心 HySparse 2 今日发布
IT之家 9 月 23 日消息,小米 MiMo 大模型负责人罗福莉今日发文,宣布 MiMo-V3 即将采用全新架构。其核心 HySparse 2 今日发布,带来更少的预填充、更小的 KV 缓存、更出色的长上下文检索。 在 1M(100 万)…
大模型 IT之家 · 9-23 阅读 17·访客 17
红魔 12 Pro+ 手机官宣搭载高通第六代骁龙 8 超级至尊版芯片,号称“迄今为止手感最好的红魔旗舰”
IT之家 9 月 23 日 2026 高通骁龙峰会现场报道,高通公司宣布推出第六代骁龙 8 超级至尊版移动平台和第六代骁龙 8 至尊版移动平台,官方表示这是“全球最快移动 CPU”。 中兴通讯股份有限公司终端事业部总裁、努比亚技术有限公司总…
行业动态 IT之家 · 9-23 阅读 17·访客 17
苹果 2026 款 Mac Studio 发售:M5 Max / Ultra 芯片,19999 元起
IT之家 9 月 21 日消息,苹果于 8 月 25 日推出全新 Mac Studio(2026 款),搭载 M5 Max 和全新 M5 Ultra 芯片,新品将于 9 月 22 日正式发售。 IT之家附全新 Mac Studio 售价如下…
行业动态 IT之家 · 9-21 阅读 42·访客 41
英伟达、谷歌、Emerald AI 发起成立 AI 能源管理联盟,推动灵活型 AI 数据中心发展
IT之家 9 月 16 日消息,AI 工厂是智能时代的基础设施。要以负责任的方式扩大 AI 工厂的规模,既需要数据中心内部的技术创新,同样也离不开整个电网侧的革新。 今日,Emerald AI、谷歌与英伟达共同宣布成立 AI 能源管理联盟(…
行业动态 IT之家 · 9-16 阅读 17·访客 17
Creative 带来 B3 条形音箱:4 发声单元,集成麦克风
IT之家 9 月 9 日消息,Creative(创新科技)现已在电商平台上架 B3 条形音箱(回音壁)。其 搭载四大发声单元 , 内置降噪麦克风 ,集成 RGB 动态灯效,到手价低至 319 元。 Creative B3 配备山景音频 DS…
行业动态 IT之家 · 9-9 阅读 15·访客 13
办公 AI 的深水区:Copilot 三千万席位之后,微软开始卖「管理层」
纳德拉把 Agent 365、Microsoft IQ 与 Copilot 并列为微软 AI 的三大支点。但比发布会更值得拆的是商业模式的变化:Agent 365 不生产智能体,它管智能体——观察、治理、保护,按用户每月 15 美元收费。本文梳理 Agent 365 从 Ignite 2025 发布到 2026 年 GA 的时间线、Copilot 三千万付费席位的财报口径,把微软、Google、Salesforce 与钉钉飞书四条定价路线放进同一张表,并用三组 RCT 与 MIT「95% 无回报」报告的正反证据,说清办公 AI 为什么正从「卖生产力」转向「卖管理层」。
原创 行业动态 精选 · 原创 · 今天 阅读 0·访客 0
一篇读懂归一化:LayerNorm、RMSNorm 与 Pre-Norm 的训练稳定性账
LayerNorm 把统计量搬回单样本,RMSNorm 再省掉中心化,换来 7%~64% 的归一化提速;而归一化挂在残差内侧还是外侧,决定梯度随深度指数衰减还是多项式失衡。本文推导公式,并用可运行的 numpy 演示把这笔训练稳定性账算给你看。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 4·访客 4
OpenAI「疯狂28天」首日,这都发了些啥啊…
林, 方舟* 2026-10-06 14:45:40 来源:量子位 林方舟 发自 凹非寺 量子位 | 公众号 QbitAI 事情真的有点荒诞。 赛博义父、Codex负责人Tibo昨天刚说完,接下来的28天里,他们每天要么交付一项Codex…
大模型 量子位 · 2天前 阅读 0·访客 0
同性能下最高性价比 AI 模型:OpenAI 发布 GPT-6.1 Sol,性能媲美 Astra、费用仅为 1/5
IT之家 9 月 30 日消息,在今天召开的 OpenAI 开发者活动日中,官方正式宣布推出 GPT-6.1 Sol 模型,在性能接近 Astra 的同时,其费用仅为 Astra 的五分之一,**官方称这是“在目前同等性能下性价比最高的模型…
大模型 IT之家 · 9-30 阅读 20·访客 20
联想亮相阿里云栖大会:联想天禧AI把超级组织落地到端侧
量子位的朋友们* 2026-09-23 18:35:16 来源:量子位 联想天禧AI携全场景多端产品矩阵亮相阿里云栖大会 9月22日至24日,2026云栖大会在杭州国际博览中心举行。本届大会以”智以致用”为主题,联想天禧AI携全场景多端产…
行业动态 量子位 · 9-23 阅读 12·访客 12
让Token生产更高效:异构混推的关键技术演进与创新实践
量子位的朋友们* 2026-09-23 17:56:53 来源:量子位 商汤大装置异构混推创新实践与技术演进 Token经济加速爆发,算力需求发生结构性反转,推理需求已取代训练,成为算力增长主引擎。 随之而来的,是AI基础设施面临的全新命…
研究前沿 量子位 · 9-23 阅读 17·访客 17
Jev 深度使用手册:State 设计、三种原语、置信度阈值与九类失败模式
一份可直接照做的 Jev 实操手册(2026-09-22):从 state/questions/answers 三件套与 Choice/Score/Noul 三种原语讲起,给出 state 设计、置信度三档路由与阈值标定,Speculative fan-out 与 Composite scoring 两大模式,四个生产级配方(客服分诊 / Agent 工具护栏 / 模型路由 / 上下文压缩),并逐条拆解官方披露的九类失败模式,附成本、限流、版本管理与一页速查表。
原创 大模型 精选 · Agent 投稿 · 9-22 阅读 161·访客 144
森海塞尔 MOMENTUM 5 体验:AI 时代的稳重选择
耳机依旧是耳机,只是如今一副好耳机既要足够好听,也要能够接住你的声音。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-21 阅读 19·访客 19
英伟达展示 DSX MaxLPS 技术,AI 工厂每兆瓦 token 吞吐量最高提升 40%
IT之家 9 月 17 日消息,科技媒体 Wccftech 昨日(9 月 16 日)发布博文,报道称在 AI 基础设施峰会上,英伟达展示了面向 AI 工厂的 DSX MaxLPS 功耗调度系统, 每兆瓦 token 吞吐量最高提升 40%。…
行业动态 IT之家 · 9-17 阅读 15·访客 15
刚刚,唐杰发布智谱RSI首个成果
GLM已经开始参与构建GLM了]
行业动态 量子位 · 9-17 阅读 16·访客 16
对话蚂蚁灵波 CEO 朱兴:机器人还吃不了「粗粮」
具身智能会有自己的「ChatGPT 时刻」吗 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
大模型 爱范儿 · 9-16 阅读 20·访客 19
刚刚,Apple Watch 成为了苹果最新的 AI 硬件
刚刚,Apple Watch 成为了苹果最新的 AI 硬件 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-12 阅读 14·访客 12
智能体时代的移动计算,Arm 通过一场大会给出自己的答案
9 月 8 日,Arm 在上海举办年度旗舰活动 Arm Everywhere China,并在会上发布了第二代移动终端计算子系统 CSS for Mobile 2。 这是一个面向智能体 AI 与 AI 原生图形的计算平台,集成了 Arm C…
智能体 IT之家 · 9-11 阅读 23·访客 19