AI
AI
资讯
alishangtian.com
首页
大模型
智能体
开源项目
研究前沿
行业动态
专题
专题 · TOPICS
一叶一世界
48 篇
Agent 工程系统学习
14 篇
Agent 沙箱技术专题
13 篇
大模型基本功
31 篇
AI 推理与部署
22 篇
算法题解
36 篇
AI 编程实战
12 篇
RAG 实战手册
20 篇
后端技术
35 篇
模型微调实战
9 篇
推理模型
8 篇
端侧智能
8 篇
论文精读
11 篇
AI 行业观察
9 篇
AI 安全与攻防
20 篇
多模态之路
14 篇
具身智能与机器人
6 篇
AI for Science
7 篇
世界模型与视频生成
11 篇
AI 治理与合规
12 篇
开源模型全景
11 篇
Kubernetes 深入实践
6 篇
MLOps 与 LLM 工程化
7 篇
AI 音频与音乐
8 篇
对齐与后训练
11 篇
AI 硬件
3 篇
AI 办公与生产力
7 篇
自动驾驶与智能出行
4 篇
提示工程与上下文工程
14 篇
AI 芯片与算力
9 篇
模型评测与基准
7 篇
AI 搜索与答案引擎
5 篇
MCP 与 Agent 协议生态
21 篇
AI 医疗健康
1 篇
AI 与教育
2 篇
全部专题 →
主题色 · THEME
靛蓝(默认)
极光
落日
薰衣草
海洋
森林
暮橙
石墨
自定义
恢复默认
提交线索
agent
anthropic
openai
huggingface daily papers
gpu
ai安全
it之家
jake wharton
solidot
港股
搜索:
GPTQ
共命中 5 条(服务端检索)
GGUF vs
GPTQ
vs AWQ vs EXL2: LLM Model Formats Explained (2026)
GGUF,
GPTQ
, AWQ, EXL2, and EXL3 solve the same problem in different ways. This guide separates file containers from quan…
大模型
MarkTechPost · 9-19
阅读 41
·
访客 38
一篇读懂模型量化:70B 是怎么塞进一张消费级显卡的
70B 模型 FP16 要 140 GB 显存,量化到 4-bit 只剩 35 GB——一张 RTX 4090 就装得下,代价是平均每个权重从 2 字节压到 0.5 字节后的精度损失。本文拆解
GPTQ
的二阶误差补偿、AWQ 的激活感知保护、GGUF k-quants 的命名规则,以及「量化伤推理」争议的实测边界。
原创
一叶一世界
精选
· 原创 · 昨天
阅读 1
·
访客 1
模型量化的精度账:从 FP16 到 INT4 该怎么选
从 FP16 压到 INT4,体积与显存降到约四分之一,量化是大模型部署的标配。本文讲清量化原理、PTQ 与 QAT 两条路线、RTN/
GPTQ
/AWQ 的思想差异,以及按显存逐级下降的选型决策表。
原创
大模型
精选
· 原创 · 3天前
阅读 5
·
访客 5
G^2PTQ: Improving LLM Post-Training Quantization with Generalized Gradient Compensation
Post-training quantization (PTQ) is a practical approach to reducing the memory and computational footprint of large lan…
大模型
HuggingFace Daily Papers · 9-25
阅读 9
·
访客 9
Softmax Reparameterization for Output-Head Quantization
Large vocabularies make output heads a substantial inference cost in small language models. We propose softmax reparamet…
行业动态
HuggingFace Daily Papers · 9-25
阅读 4
·
访客 4