论文精读:CLIP——四亿图文对如何把图像接入语言空间

2021 年 1 月,OpenAI 发表《Learning Transferable Visual Models From Natural Language Supervision》(Radford et al.),标题朴素,影响深远:它证明了一件此前没人做到的事——不用一张人工标注的图片,只靠互联网上自然存在的图文对,就能训出可用的视觉模型。这篇被引用超过七万次的论文就是 CLIP(Contrastive Language-Image Pre-training),今天所有图文检索、文生图、多模态大模型的地下基座。视觉与语言怎么对齐的铺垫见《一篇读懂视觉语言模型》与《一篇读懂 Embedding》,本文专注 CLIP 本身。

动机:标注是死路,互联网是活水

传统视觉模型的配方是「ImageNet 式标注」:人工给图打标签,一个模型学一套固定类别。这条路的问题在 2020 年前后已经暴露——类别体系是死的(ImageNet 一万类),新任务就要重新标注;且标注贵到无法扩展。

CLIP 的洞察是:互联网上的图片天然带着标注——alt 文本、配文、标题就是「免费标注」,只是噪声大。要吃下噪声,靠量取胜:作者团队构建了 WIT-400M 数据集,4 亿图文对,比此前最大的图文数据集大了两个数量级。论文里有个著名推算:按当时标注成本,这批数据的人类标注费用约需数百万美元小时级工作量——而爬取只花了极小的成本。

机制:对比学习,一份「连连看」试卷

CLIP 的训练目标是对比式的,机制可以用一场考试理解:

  1. 取一个 batch 的 N 对图文(如 N=32768);
  2. 图像编码器(ViT 或 ResNet)把每张图变成向量,文本编码器(Transformer)把每段文字变成向量;
  3. 算出 N×N 的相似度矩阵——N 张图对 N 段文字,谁跟谁原本是一对?
  4. 让配对的相似度高、错配的相似度低(对角线是正确答案的「连连看」)。

训练后得到两个编码器:任意图像和任意文本被映射进同一个向量空间,语义相近则向量相近。这个「共享空间」是 CLIP 全部魔力的来源——它不是一个分类器,而是一把连接两种模态的尺子。

零样本分类:提示词就是分类器

CLIP 亮相时最惊人的演示是零样本图像分类,玩法聪明到值得细品:

  1. 想分什么类别,就把类别名写进提示词模板,如「一张{类别}的照片」,生成 N 段文字;
  2. 文本编码器把 N 段提示词变成 N 个向量;
  3. 待分类图像编码后与 N 个向量比相似度,最高的当选。

分类器是现场用文字造的,不是训练出来的。在 ImageNet 一千类上,这个流程零样本拿到 76.2%——追平了全监督训练的原始 ResNet-50。而且 CLIP 的泛化不限于 ImageNet:论文展示它在 27 个数据集的零样本表现普遍可观,对「没见过的任务体系」尤其占优(ResNet 需要为每个体系重新训练线性层)。

论文还贡献了一个工程洞察:提示词工程对 CLIP 效果影响巨大。「一张{类别}的照片」比裸类别名稳定得多,加「标牌上写着{文字}」的包装能救回 OCR 类任务——歧义词汇(ImageNet 类别名常有多个含义)靠上下文模板消歧。这是「提示词工程」概念在多模态领域的先声。

失效模式:CLIP 不是全能眼睛

论文作者罕见地诚实地列了短板,至今仍是选型时的检查单:

  • 计数与细粒度:数清图里有几个物体、区分相近的车型/鸟种,零样本 CLIP 仍然吃力;
  • 抽象任务失灵:数圆圈数量这类「系统性」任务,CLIP 的表现接近瞎猜;
  • 数据集偏差内化:从互联网学来,也就把互联网的偏见学了进去(性别-职业关联等);
  • 真实分布外仍脆:「MNIST 手写数字」这种太干净的数据集反而把它考倒——互联网分布之外,CLIP 不是天然通用。

遗产:为什么说今天的多模态都站在 CLIP 上

CLIP 的真正影响不在零样本分类本身,而在它给出的基础件:

  1. 图文对齐的向量空间成了通用资产——CLIP 向量至今仍是图文检索、以文搜图、内容审核的主力 embedding;
  2. 文生图的引导信号:从 DALL·E 2 到 Stable Diffusion,文本条件编码器长期由 CLIP 文本塔担任(扩散基础见《扩散模型入门》);
  3. 多模态大模型的连接范式:视觉编码器 + 对齐层 + LLM 的三件套,正是 CLIP 证明「对齐可行」之后的工程化延伸;
  4. 数据配方:「互联网规模的噪声标注 + 对比学习」成为标准配方,后续的 EVA、SigLIP、各类 CLIP 变体都是在这条路上的迭代。

结语

CLIP 的一句话总结:把「学习看图」改写成「学习对齐图与话」,标注的天花板就被互联网的规模顶穿了。76.2% 这个数字早已被超越,但它揭示的方法论——自然语言是最便宜最无限的监督信号——塑造了此后五年多模态的全部技术路线。读原始论文的额外收益是作者的工程坦率:数据清洗的细节、失败的消融、偏差的自省,每一条在今天仍是做大规模训练的教科书。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?