一篇读懂幻觉:模型为什么会一本正经地胡说八道
输出流畅、语气自信,内容却是编的——幻觉是当前大模型架构的固有属性,不是能修掉的 bug。本文拆解幻觉生成的三层机理、最容易被放大的三类场景,给出检测思路与从 RAG 到提示词设计的缓解清单。
阅读全文 →
系列文章
ARCHIVE 共 24 条一篇读懂幻觉:模型为什么会一本正经地胡说八道
输出流畅、语气自信,内容却是编的——幻觉是当前大模型架构的固有属性,不是能修掉的 bug。本文拆解幻觉生成的三层机理、最容易被放大的三类场景,给出检测思路与从 RAG 到提示词设计的缓解清单。
一篇读懂 Attention:Q、K、V 到底在算什么
「它」指代谁?Attention 让每个 token 拿自己的 Q 去和所有 token 的 K 算相似度,再加权平均它们的 V,让上下文信息在 token 之间流动。本文用检索类比讲清 Q、K、V、缩放点积、多头与因果掩码,并连到推理工程的 KV Cache。
一篇读懂 Temperature 与 Top-p:采样参数怎么调
模型每步输出的不是「下一个字」而是一张概率表,Temperature 与 Top-p 决定怎么从表里抽签。本文讲清温度如何改变分布锐度、Top-p 如何动态截断候选、重复惩罚如何抑制复读,并给出代码、问答、写作、Agent 四类场景的参数对照表。
LlamaFactory 上手:不改代码微调一个自己的模型
微调不是万能钥匙,但适合固定风格、固定格式与领域行话类需求。本文先讲清何时该微调,再用 LoRA 原理加 LlamaFactory 三步实战,带你不改代码微调出自己的模型,并给出常见坑与最小评测法。
从 Transformer 到今天:注意力架构的十年演进地图
2017 年的 Transformer 之后,架构研究沿三条主线展开:把注意力做便宜、把注意力换掉、把 FFN 做稀疏。本文梳理稀疏注意力、FlashAttention、SSM、混合架构与 MoE 的脉络,并给出读新架构论文的三问。
一篇读懂 Tokenizer:BPE 如何把文字切成 Token
模型读到的不是字也不是词,而是 token。本文用 low/lower 语料演示 BPE 合并出词表的过程,解释中文为什么更费 token,以及它对计费、上下文长度和算术能力的影响,文末附代码示例与流程图。
一篇读懂 Embedding:文本如何变成向量
语义检索的第一步是把文本变成可比较的向量。本文从 one-hot 的困境讲到稠密向量的语义几何,手算一个余弦相似度的小例子,再用十几行代码演示从 encode 到 top-k 的完整流程,最后点出语义匹配最常见的两个坑。
MoE 混合专家入门:大模型如何「变胖不变贵」
MoE 架构让模型总参数可以做得很大,而每个 token 实际经过的计算却不大,这是「变胖不变贵」的关键。本文讲清路由器与专家的分工、总参数与激活参数的区别、路由塌缩与负载均衡的难点,最后给出 MoE 与稠密模型的选型判断。
上下文窗口不是越长越好:长上下文的原理、代价与用法
长上下文常被当成大模型的头号卖点,但它有三层代价:平方级注意力计算、线性增长的 KV Cache 显存,以及塞得进去未必用得好的召回衰减。本文讲清长度受限的原理、显存的估算方法与三条扩长路线,并给出上下文预算分配的实操建议。
一篇读懂 LoRA:低秩适配怎么把微调成本打下来
全量微调 7B 模型,光 Adam 优化器状态就要吃掉 84GB 显存。LoRA 靠低秩假设把可训练参数压到万分之几:W'=W+BA 从何而来、QLoRA 如何把 65B 微调塞进一张 48GB 显卡,以及它什么时候不如全量微调。
一篇读懂学习率:训练里最重要的超参数
梯度只给方向,学习率决定步长。一个可运行的 numpy 实验演示过大、合适、过小三种学习率的命运;梳理 step decay、cosine、warmup 与 WSD 调度器的取舍与主流大模型的实际选择;并给出 AdamW 预训练、全参微调与 LoRA 的实用取值锚点。
一篇读懂 RoPE:旋转位置编码怎么「转」出长上下文
从自注意力不识顺序的痛点讲起,用二维复数把旋转位置编码的推导一次讲透:内积为何只依赖 m−n、高维频率如何分配,配一份本地跑通的 numpy 最小实现与整体平移不变性实验,再谈 PI、NTK-aware、YaRN 的长上下文扩展路线与 ALiBi 的取舍。
第 1 / 2 页 · 共 24 条
下一页 →