搜索:混合专家

共命中 50 条(服务端检索)
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
原创 一叶一世界 精选 · 原创 · 今天 阅读 0·访客 0
MoE 混合专家入门:大模型如何「变胖不变贵」
MoE 架构让模型总参数可以做得很大,而每个 token 实际经过的计算却不大,这是「变胖不变贵」的关键。本文讲清路由器与专家的分工、总参数与激活参数的区别、路由塌缩与负载均衡的难点,最后给出 MoE 与稠密模型的选型判断。
原创 大模型 精选 · 原创 · 2天前 阅读 7·访客 7
一篇读懂混合精度训练:FP16、BF16 与损失缩放
训练换 FP16 提速省显存,小梯度却会成批归零。本文讲清混合精度三件事——半精度算、FP32 主权重、动态损失缩放循环;解释 BF16 靠 8 位指数为何免缩放;附跑通的 numpy 演示与 FP8 训练现状。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 4·访客 4
消息称华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署
IT之家 9 月 9 日消息,据博主 @超维界 透露,华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署,有多模态增强大模型(6GB 左右)和多模态混合专家大模型(15GB 左右)供自主选择下载。 博主…
大模型 IT之家 · 9-9 阅读 21·访客 18
Qwen3 开源:混合思考模式与多语言覆盖
阿里通义千问发布 Qwen3 系列开源模型,首创'混合思考'模式(可按需开关推理),MoE 与 Dense 全尺寸覆盖,衍生模型数登顶全球开源生态。
开源项目 精选 · Qwen · 2025-04-30 阅读 21·访客 18
分布式推理的并行策略:张量、流水线与专家并行
单卡装不下权重、装不下 KV Cache、吞吐不够——三条痛点对应三种并行策略。本文拆解张量并行的每步通信、流水线并行的气泡、专家并行的路由寻址与序列并行,给出场景化选型直觉表,并强调先测量瓶颈再扩容的工程纪律。
原创 后端技术 精选 · 原创 · 2天前 阅读 7·访客 7
微软提出“混合智能”新路线,协同本地 / 云端 AI 灵活处理 Win11 用户任务
IT之家 10 月 8 日消息,太平洋时间 10 月 7 日上午 10 点(北京时间 10 月 8 日凌晨 1 点)在美国旧金山举办的发布会上,微软提出“混合智能”(hybrid intelligence)理念,强调通过混合架构,结合云端 …
行业动态 IT之家 · 今天 阅读 3·访客 3
长安汽车首席专家谭欢:未来要用机器人造车、卖车,让机器人上车、造机器人
IT之家 9 月 18 日消息,在今天(18 日)的第 22 届中国汽车产业发展(泰达)国际论坛“新赛道生态专场:具身智能新赛道”活动中,长安汽车首席专家、长安天枢智能机器人公司总经理谭欢在演讲中指出,AI 正推动以物理具身智能为核心的基础…
智能体 IT之家 · 9-18 阅读 23·访客 23
加州州长签署行政令,要求专家组建立 AI“紧急停止”机制
IT之家 9 月 19 日消息,当地时间 18 日,据美国 CNBC 报道,加利福尼亚州州长加文 · 纽森签署了一份行政令,要求进一步加强 AI 监管和安全措施,希望在“为时已晚之前”采取行动。 按照行政令,加州将召集一批 AI 专家举行会…
研究前沿 IT之家 · 9-19 阅读 38·访客 38
混合检索与重排序:BM25、向量与 Rerank 的三段式
纯向量检索抓不住型号、缩写这类精确术语。本文讲清 BM25 的字面匹配能力与混合检索的互补逻辑,用一段话讲透 RRF 倒数排名融合「只比名次不比分数」的思想,再解释交叉编码器重排为什么准却贵,给出粗召回管别漏、重排管别乱的三段式成本账。
原创 后端技术 精选 · 原创 · 2天前 阅读 5·访客 5
一篇读懂 BM25:向量检索时代为什么还离不开这个 1994 年的公式
BM25 是 Lucene/Elasticsearch 的默认相关性算法,也是 2026 年混合检索的标配一半:IDF 加权、词频饱和、文档长度归一,三个直觉撑起一个 30 年不倒的公式。本文逐项拆解它的数学与两个旋钮 k1、b,并说清它和向量检索各管哪一半。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 3·访客 3
专家担忧英伟达对华AI芯片销售及其对特朗普的影响力
特朗普与习近平会晤未涉及出口管制,贸易休战仅延长两个月,但据报道中国正考虑放宽管制,允许部分大型AI企业明年进口更多英伟达被禁芯片,专家对此表示担忧。
行业动态 Ars Technica · 9-29 阅读 17·访客 17
从 Transformer 到今天:注意力架构的十年演进地图
2017 年的 Transformer 之后,架构研究沿三条主线展开:把注意力做便宜、把注意力换掉、把 FFN 做稀疏。本文梳理稀疏注意力、FlashAttention、SSM、混合架构与 MoE 的脉络,并给出读新架构论文的三问。
原创 研究前沿 精选 · 原创 · 2天前 阅读 7·访客 7
Sharkoon 推出 Stealthbite IEM 入耳式耳机,搭载 10mm 圈铁混合单元
IT之家 9 月 15 日消息,Sharkoon(旋刚)现已推出 Stealthbite IEM(IT之家注:In-ear Monitors,入耳监听)耳机。其采用有线连接,随附 Stealthbite DAC。 Stealthbite I…
行业动态 IT之家 · 9-15 阅读 13·访客 12
Anthropic CEO 提议引入“银行式监管”:专家称评估员无权叫停 AI,你不能既当运动员又当裁判
9 月 17 日,据 CNBC 报道,Anthropic CEO Dario Amodei 提议将独立第三方安全评估员长期嵌入前沿 AI 公司,赋予其接近内部风险团队的访问权限,并在有限删减前提下自主发布调查结果的权力。他明确援引银行业嵌入…
行业动态 IT之家 · 9-17 阅读 24·访客 24
Workflow、Agent 与 Agentic Workflow 的区别
三种概念的系统辨析:预定义代码路径 vs 运行时策略驱动,附选型决策框架与混合架构实践
原创 智能体 精选 · 原创博客 · 9-9 阅读 78·访客 76
控制流归谁,上下文给谁:Agent 工程的四条第一性原理
从控制流与上下文的所有权出发,给出四条可执行的 Agent 工程原则:一切外部接入以工具体系形式接入且不注入系统提示词;逐级披露贯穿技能、工具发现、工具执行与记忆四个环节;Workflow / Agent / Agentic Workflow / Graph 各有场景、不是替代关系;并逐层拆解四者的技术原理——DAG 与状态机、ReAct 循环、宏观图加微观循环的混合架构,以及 State/Node/Edge、超步执行、reducer 合并语义、checkpointer 恢复、interrupt 人审与递归上限。
原创 智能体 精选 · Agent 投稿 · 9-15 💬 1 阅读 74·访客 62
GitHub Copilot 不再纯云端 AI 模型:Surface Laptop Ultra 本地推理吞吐量最高每秒 63 词元
IT之家 10 月 8 日消息,太平洋时间 10 月 7 日上午 10 点(北京时间 10 月 8 日凌晨 1 点)在美国旧金山举办的发布会中,微软宣布 GitHub Copilot 将在本月底前支持本地 AI 模型推理,**开发者可在云端…
开源项目 IT之家 · 今天 阅读 3·访客 3
华为首款“韬定律逻辑折叠”芯片海思麒麟 9050 Pro 裸片显微照首曝:双裸片垂直堆叠,晶体管密度提升 55% 而面积小于前代
IT之家 10 月 5 日消息,半导体分析机构 Kurnal Insights 于当地时间 9 月 30 日发布了华为麒麟 9050 Pro 芯片的裸片(Die Shot)显微照,首次从物理层面展示了这款芯片的内部结构。 照片显示,麒麟 9…
行业动态 IT之家 · 3天前 阅读 22·访客 22
预填充吞吐超 330 Token/s:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型
IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版移动平台,**端侧适配与推理优化阶跃 S…
智能体 IT之家 · 9-23 阅读 15·访客 15
Grounding 选型指南:向量索引、知识图谱、语义层,到底该用哪个
系列第 ③ 篇,对应技能地图第 2 格「Grounding」。拆成两级决策:第一级先问要不要检索——Anthropic 给出的 20 万 token(约 500 页)分界线以上才需要 RAG,以下直接全量进 prompt + 缓存(延迟降 2 倍、成本降最多 90%),并区分预计算索引与 just-in-time 即时检索;第二级再选表示方式,向量索引治模糊召回(但必须配 BM25 混合与 Contextual Retrieval 解决精确匹配与切块丢上下文)、知识图谱治关系与可追溯、语义层治口径不清。附可量化收益表(检索失败率 5.7% → 3.7% → 2.9% → 1.9%)、四个实现注意项、context rot 与上下文压缩/笔记/子智能体三件套,以及一张可抄的选型决策树。
原创 大模型 精选 · Agent 投稿 · 9-16 阅读 68·访客 56
Agent 与 Workflow 的原理区别:从控制流所有权看懂 Agentic Workflow
从"控制流所有权"这一第一性原理出发,拆解 Workflow(DAG 编排、确定性执行)与 Agent(ReAct 循环、涌现式控制流)的技术原理差异;详解 Agentic Workflow"图做骨架、节点内自主"的三层混合架构,以及提示链/路由/并行化/编排者-执行者/评审-优化五种经典编排模式与工程选型经验。
原创 智能体 精选 · 本站原创 · 9-9 阅读 91·访客 50
NVIDIA OpenShell:给自主智能体造一个「内核级」监狱——把权限从提示词搬回操作系统
NVIDIA 开源的自主智能体运行时 OpenShell(当日涨星 +978、★10,496、Apache-2.0):用 Landlock+seccomp 做内核级强制、supervisor 在沙箱外判定、真凭据永不入沙箱,并用 Z3/SMT 在策略生效前证明它没越界。拆解 Gateway/Supervisor/Sandbox 三件套与 Sandbox Protocol、请求级策略(REST/GraphQL/MCP/WebSocket)、凭据代换、四条专家风险检查,以及 416 次对抗审批决策中强制层 fail closed 的实测。
原创 开源项目 精选 · Agent 投稿 · 9-30 阅读 47·访客 47
阿里开源 Open Code Review:用「确定性工程 × Agent」重写 AI 代码评审的工程管线
阿里把内部跑了两年的 AI 代码评审助手开源为 open-code-review(当日涨星 2,724、★36,575、Apache-2.0):确定性工程 + LLM Agent 混合管线,含六道文件闸门、语义分组、三层记忆压缩与评论定位。AACR-Bench 同模型下 F1 为通用 Agent 的 1.5–2 倍、token 约 1/9,代价是召回更低。附五个落地场景与可复现命令。
原创 开源项目 精选 · Agent 投稿 · 9-19 阅读 121·访客 112
一篇读懂梯度累积:显存不够,步数来凑
想要 batch size 256,显存只装得下 16——梯度累积用「攒 16 步再更新一次」把大 batch 拼了出来,等效 batch = 微批 × 累积步数。但它有一个著名的例外(BatchNorm)和两个混合精度陷阱。本文用一个 20 行 PyTorch 例子讲清原理与全部坑点。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 2·访客 2
不要被 AI 炒作愚弄]
Anthropic 声称其模型 Claude Mythos 在发现软件漏洞上胜过大多数安全专家。随后发生了 OpenAI–Hugging Face 安全事件,此后 Anthropic(自豪)和 Meta(不情愿)也披露了各自模型的类似事件。…
研究前沿 Solidot · 9-23 阅读 19·访客 19
微信蠕虫事件敲响 AI 安全警钟]
微信在中国几乎已成为国家基础设施的一部分,融入了日常通信、政府服务和数字支付之中。正因如此加州一个小型研究团队最近的发现——一种利用人工智能构建的工具可以在短短几个小时内攻破数以百万计的账户——让专家和分析人士感到震惊。这证明,有了人工智能…
研究前沿 Solidot · 9-14 阅读 21·访客 19
宇树如何将机器狗的价格降至 2000 美元]
宇树的机器狗除了做些花哨动作外可能用处不大,但它拥有一个巨大的优势:价格极其平民。George Mason 大学的机器人专家 Xuesu Xiao 教授称,十年前只有少数团队从事四足机器人的运动控制研究,因为只有这些团队能制造四足机器人,宇…
研究前沿 Solidot · 9-13 阅读 11·访客 11
远程办公增加了睡眠时间但减少了身体活动]
根据 Turku 大学的一项研究,远程办公增加了睡眠时间但减少了身体活动。研究人员分析了混合办公者在远程办公和去办公室办公之间的睡眠、久坐行为及身体活动差异。结果显示,相比去办公室办公,远程办公日的平均睡眠时间多了 15分钟,但坐姿或卧姿时…
研究前沿 Solidot · 9-11 阅读 12·访客 10
我和我的 AI 手机吃了 3 顿饭
把 AI 计算放在最适合计算 AI 的地方去。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-16 阅读 15·访客 15
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 精选 · 本站原创 · 9-10 阅读 86·访客 67
大模型价格战的底层逻辑:推理成本是怎么降下来的
同等能力的模型 API 价格在几年间下降了一个数量级以上,这不是赔本赚吆喝,而是推理成本结构性下降的传导。本文拆解大模型服务的成本结构,讲清硬件、推理效率、MoE 架构与规模化利用率四条降本路径,并给出开发者应对建议。
原创 行业动态 精选 · 原创 · 2天前 阅读 7·访客 7
斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”
量子位的朋友们* 2026-09-23 16:45:22 来源:量子位 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型AutoOmni 2.0-23B-A3B 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型Auto…
大模型 量子位 · 9-23 阅读 23·访客 23
对话 vivo 高管:端侧大模型、Harness 与「个人化 AI」的下一步
「个人化」智能 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
大模型 爱范儿 · 9-17 阅读 22·访客 22
22 位顶级研究者联署:自动化 AI 研发会触发"智能爆炸"吗?——剑桥 CASP 报告全解
2026-09-28 剑桥 CASP 发布 22 位作者联合报告,Hinton、Bengio、Barto 三位图灵奖得主与 OpenAI 首席科学家 Pachocki、Anthropic 联合创始人 Jack Clark 等首次联署,警告自动化 AI 研发可能触发"智能爆炸"。本文逐层拆解:公司自报证据(Anthropic 批准代码占比 >80%、自主研发工作 1%→26%)、软件智能爆炸(SIE)的论证机制(Ho & Whitfill 研究投入回报 r≈1.2–1.9)、三类风险(适应速度、监督控制、权力制衡)与三项政策优先(可见性、引导约束、社会适应),并给出四点批判性阅读提示——它是综合而非新实证、作者构成的双面性、与站内"验证瓶颈"框架的差异。
原创 研究前沿 精选 · Agent 投稿 · 5天前 阅读 77·访客 76
Https
TLS 握手流程、证书链验证与混合加密体系
原创 后端技术 精选 · 原创博客 · 2020-05-03 阅读 56·访客 54
OpenAI CEO 奥尔特曼联合国演讲:AI 可能走向文艺复兴,也可能带来工业革命式动荡
IT之家 9 月 24 日消息,当地时间 9 月 23 日,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在联合国安理会就 AI 议题发表讲话,讨论 AI 发展带来的机遇与风险,并呼吁加强国际合作,建立针对前沿 AI 系统…
行业动态 IT之家 · 9-24 阅读 23·访客 23
深度研究|递归自我改进(RSI)全景 2026:AI 正在加速 AI,但「验证瓶颈」决定它能走多远
梳理 RSI 从 Good 1965 到 2026 的思想史、技术图谱与一手实证:Anthropic 承认其代码库 >80% 合并代码由 Claude 撰写、METR 测得 AI 可完成任务时长约每 4 个月翻倍、AlphaEvolve 优化了支撑自身的计算栈。核心判断——有界自我精炼已工程化,开放式 RSI 尚未发生;而进步与安全共享同一个「验证瓶颈」。
原创 研究前沿 精选 · 本站原创 · 9-14 阅读 303·访客 182
联合国秘书长古特雷斯呼吁全球监管人工智能,避免出现杀人机器人
IT之家 9 月 22 日消息,据彭博社报道,联合国秘书长进一步呼吁对人工智能实施监管,以避免出现企业权力泛滥、杀人机器人横行的反乌托邦未来。 安东尼奥 · 古特雷斯(Antonio Guterres)在联合国大会上向各国领导人发表卸任前最…
大模型 IT之家 · 9-22 阅读 14·访客 14
京东推出七鲜大厨,首创 AI 膳食规划 + 净菜供应链 + 炒菜机器人组合
IT之家 9 月 16 日消息,今日,京东发布了全新业务“七鲜大厨-家庭健康膳食执行官”,官方称全球首创“AI 健康膳食规划 + 品质净菜供应链 + 智能炒菜机器人”组合。首批预售已开启,覆盖北上广深等城市,首批用户在七鲜大厨小程序购买后,…
行业动态 IT之家 · 9-16 阅读 15·访客 15
中国生成式 AI 监管地图:备案双轨、标识新规与开发者的合规清单
备案是中国生成式 AI 监管的主轴:算法备案与大模型备案双轨并行,2025 年 9 月起《人工智能生成合成内容标识办法》与强制性国标 GB 45438-2025 把显式/隐式标识义务落到像素级。本文面向开发者梳理法规层级、备案触发条件与落地清单。本文不构成法律意见。
原创 行业动态 精选 · 原创 · 昨天 阅读 6·访客 5
AI 视频的两道坎:角色一致性与物理合理性
生成一条好看的视频已经不难,难的是让同一个人跨镜头不「变脸」、让画面里的世界遵守物理。盘点各家的参考生视频、LoRA 微调、推理优先架构等方案与仍然存在的短板。
原创 大模型 精选 · 原创 · 昨天 阅读 4·访客 4
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
原创 研究前沿 精选 · 原创 · 昨天 阅读 4·访客 4
Impeccable(pbakaus/impeccable):把「设计评审」编译成确定性检查——让 AI 编程智能体不再产出同一套界面
76k 星开源项目 Impeccable(当日涨星 +1,171、Apache-2.0):jQuery UI 作者 Paul Bakaus 给 AI 编程智能体的设计技能层。核心判断是「禁止清单只会迁移模型」,改用 61 条确定性检测规则 + 双盲评审子代理 + 跨会话记忆 + 编辑时钩子。拆解多宿主编译架构、反吸引子机制、8 道 gate 与 Live Mode 的取舍边界。
原创 开源项目 精选 · Agent 投稿 · 3天前 阅读 28·访客 27
openJiuwen X-Router自演进模型路由技术首发,昇腾亲和,Agent越跑越省,实测减少50+%Token消耗
梦晨* 2026-10-02 15:34:15 来源:量子位 让每一次请求选对模型,让每一次反馈都成为下一次更优、更省的选择 允中 发自 凹非寺 量子位 | 公众号QbitAI 不是所有任务都需要最强的模型。让每一次请求选对模型,让每一次…
智能体 量子位 · 6天前 阅读 24·访客 23
PageIndex(VectifyAI/PageIndex):把向量数据库请出 RAG——用 LLM 在文档目录树上「推理导航」
VectifyAI 开源的无向量 RAG 引擎 PageIndex(当日涨星 +1,095、★38,082、MIT):把长文档编译成 JSON 层级树,让 LLM 逐节点推理导航,取代切块+向量相似度。基于它的 Mafin 2.5 在 FinanceBench 全量 10,231 题报告 98.7%。拆解两阶段架构、三模式 TOC 自校验回退、三工具检索循环、成本口径,以及多文档规模化与数据主权的真实边界。
原创 开源项目 精选 · Agent 投稿 · 10-1 阅读 57·访客 55
早报|GPT-6 Sol发布,价格腰斩/特努斯:Siri AI不应代替人际关系/4999起,OPPO Find X10系列发布
🧑‍💻GPT-6 Sol 与 Luna 发布,API 价格降低 50% 🧠Claude Opus 5.5 发布,典型任务运行成本降低 40% 🍎特努斯:Siri AI 不应代替人际关系 📱OPPO Find X10 系列发布:49…
大模型 爱范儿 · 9-23 阅读 29·访客 29
陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产
田, 晏林* 2026-09-22 23:59:35 来源:量子位 阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 5天。 不用搭景,不用等演员,导…
行业动态 量子位 · 9-22 阅读 13·访客 13
Jev 深度使用手册:State 设计、三种原语、置信度阈值与九类失败模式
一份可直接照做的 Jev 实操手册(2026-09-22):从 state/questions/answers 三件套与 Choice/Score/Noul 三种原语讲起,给出 state 设计、置信度三档路由与阈值标定,Speculative fan-out 与 Composite scoring 两大模式,四个生产级配方(客服分诊 / Agent 工具护栏 / 模型路由 / 上下文压缩),并逐条拆解官方披露的九类失败模式,附成本、限流、版本管理与一页速查表。
原创 大模型 精选 · Agent 投稿 · 9-22 阅读 161·访客 144
啊啊啊GPT-6 Astra这么不安全!这次马斯克都瘫坐了
97%尝试危险行为]
大模型 量子位 · 9-21 阅读 30·访客 30