微信内可能无法直接打开本站。请点右上角 ··· → 在浏览器打开,或复制链接。
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
RSS 官方收录 · 可信分层展示
关键摘要
A3B2自适应非对称适配器,诠释大模型微调的“克制”艺术。作者丨张 璐 编辑丨幸丽娟 在视觉语言大模型(VLM)落地少样本迁移任务时,高效参数微调(PEFT)是大家普遍采用的低成本方案。…
- 然而,业界长期存在一个惯性思维:既然是做图像分类,给图像编码器多挂几个 Adapter、多做微调,模型理应能看懂更多视觉细节。
- 但现实却演化出一个尴尬的矛盾:在面对未知的现实场景(域外数据/OOD)时,在图像编码器上微调得越激进,模型的泛化能力反而破坏得越惨烈。
- 预训练大模型原本拥有一双看懂万物的“好眼睛”,强行局部微调反而把它“改近视了”。
摘要引擎:抽取
正文提要

作者丨张 璐
编辑丨幸丽娟
在视觉语言大模型(VLM)落地少样本迁移任务时,高效参数微调(PEFT)是大家普遍采用的低成本方案。
然而,业界长期存在一个惯性思维:既然是做图像分类,给图像编码器多挂几个 Adapter、多做微调,模型理应能看懂更多视觉细节。
但现实却演化出一个尴尬的矛盾:在面对未知的现实场景(域外数据/OOD)时,在图像编码器上微调得越激进,模型的泛化能力反而破坏得越惨烈。 预训练大模型原本拥有一双看懂万物的“好眼睛”,强行局部微调反而把它“改近视了”。
这一矛盾引发了研究者的反思:在 VLM 微调中微调中,我们是否一定要死板地对称更新双塔?浙江大学陈静远教授课题组与斯旺西大学的联合团队提出了一个全新的方案——(自适应非对称适配器)。
它放弃了对图像分支的硬性微调,而是引入预测置信度,自动在合适的时候给视觉塔“踩刹车”,在保留预训练强泛化力的同时实现高效适配。

论文链接:https://arxiv.org/html/2605.13161v2

01
颠覆直觉的发现:
文本放开改,图像看情况
为了彻底搞清楚双塔到底该怎么调,研究团队在 11 个主流视觉数据集上展开了严谨的实验。他们给 CLIP 的图像塔和文本塔分别挂载基础 Adapter,在不同任务场景下进行了交叉对比,最终总结出推翻传统范式的三大核心洞察:
▎实验试出来的三条“微调铁律”
洞察一:文本分支的改动收益更高 。
在大多数任务中,微调文本编码器带来的性能提升,显著高于微调图像编码器。这是因为文本本身包含高度抽象的高层语义,通过微调文本端,模型能以极小的参数代价快速对齐新类别的概念。
洞察二:已知场景,双管齐下。
在分布内任务(例如基类到新类的泛化)中,由于测试集和训练集的数据分布一致,同时微调图像塔和文本塔能达到最佳表现。此时图像塔的微调有助于捕捉特定领域内的细粒度视觉特征。
洞察三:未知场景,图像微调是“毒药”。
一旦到了分布外任务(OOD)(例如跨数据集迁移或域泛化),激进地微调图像塔不仅带不来收益,反而会严重破坏 CLIP 原本强大的通用视觉表达。

在(b)跨数据集评估和(c)域泛化等 OOD 任务中,仅微调图像分支(Image 柱)的准确率大幅下滑;而仅仅微调文本分支(Text 柱)反而能维持较高水准。
这三条洞察扎中了工程师的痛点。如果你在实际业务(如电商商品识别、工业质检、医疗遥感等)中做过VLM落地,一定对这种“上线崩溃”不陌生。
过去为了让 CLIP 适应自家的私有数据,大家第一反应就是抓着图像编码器猛调。结果模型在测试集上准确率飞升,一上线遇到用户上传的长尾图片、异常光照或未见过的品类(典型的 OOD 域外场景),性能立马断崖式下跌。很多团队只能硬着头皮不断人工补数据、重训模型。
论文总结的这三条洞察,直接戳破了大家在工程落地时屡屡踩坑的根源:问题往往不是出在样本不够多,而是出在对图像塔的“过度侵入”上。盲目微调破坏了预训练底座最珍贵的通用视觉表达。
▎陷入“开也不是,关也不是”的死局
实验数据彻底颠覆了大家的固有认知。过去被当成“加分项”的图像塔微调,在未知数据面前竟然变成了毁掉模型的“毒药”!
既然如此,那遇到未知场景时,把图像塔的 Adapter 手动关掉不就行了?
想法很美好,现实泼了一盆冷水。线上实时流入的数据,从来不会自己贴着“我是已知样本”还是“我是未知样本”的标签。你不可能在服务器旁边蹲守,每来一张奇怪的图片,就手动去帮模型按一下微调开关。
不关开关,模型会被“改近视”;想关开关,又根本无法预判数据。这种“开也不是,关也不是”的进退两难,正是过往VLM微调范式一直难以越过的天堑。
也正是被逼到了这种死胡同里,浙大团队才彻底抛弃了死板的人工规则,提出了一个极具颠覆性的思路:既然人类无法预判,为什么不把决定权交给数据自己?
这才有了 (Adaptive Asymmetric Adapter)的诞生。

02
拆解黑科技:两张架构图把机制讲透
理解这套机制其实很简单。抛开复杂的公式,我们直接盯紧两张结构图:先放大看单个模块的内部分工,再拉远看全局的智能刹车。
▎组件内部:1个精炼官带 N个专项专家
我们先拆开 Transformer 每一层里挂载的 Adapter 内部。如下图,输入特征进入这个小网络后,实际上走的是两条并行通道:

第一步:信息压缩(Down Matrix)
输入特征先经过【Down Matrix】进行降维。这就好比一个“信息精炼官”,把原本高维冗余的数据压缩成精炼的小包裹,顺便过滤掉特定任务里的噪声。
第二步:专家分工(Up Expert Matrices)
精炼后的包裹被同时送给上方的多个 【Up Expert Matrix】(专家 1、专家 2……)。每个专家擅长恢复不同视角的特征,共同把低维数据重新还原回高维空间。
第三步:动态调度(Dynamic Router)
右侧的【Dynamic Router】(动态路由器),它就像一个“调度员”。它看一眼输入的特征,立刻给各个专家打分,最后把各个专家的结果按权重加权汇总,输出最终的特征修改量 。
到这里你可能会问:为什么用“1个 Down + 多个 Up”,而不是“多个 Down + 1个 Up”?
这是因为,让所有专家共享同一个“信息精炼官(Down 矩阵)”,能形成统一的信息瓶颈,所有专家都在同一个认知基准上协同工作,避免了多套降维矩阵互相扯皮、梯度抵消的问题。
▎全局调控:遇事不决,立刻退回原始底座
搞懂了单个 Adapter 的构造,我们把视野拉远,看全景图。

注意看上图的右上方,两条红色的线最终汇聚到了一个叫 【】 的地方。这就是 自动化“踩刹车”的全过程:
第一步:看置信度(右下角)
图像和文本对齐后,模型会算出分类概率分布。系统直接挑出最高的那一个概率值,作为当前的置信度得分。如果置信度很低,说明模型对这张图片非常困惑,极有可能是没见过的“域外数据(OOD)”。
第二步:看修正量(右上角)
图像塔每一层 Adapter 算出来的修改意见汇总在一起,形成一个总修正向量 。
第三步:触发刹车( L_bias)
L_bias这个机制就像一个“动态减震器”:
遇到熟客(高置信度):不干预,图像 Adapter 算出来的正常叠加到图像塔上,让模型精细拟合。
遇到生客(低置信度):惩罚机制立刻被激活,强行把总修正量 压向 0。相当于一脚刹车,直接关掉了图像 Adapter 的影响,让模型退回到 CLIP 预训练好的原始图像特征。

03
雨露均沾:
如何防止 MoE 出现“专家塌陷”?
在多专家系统中,经常出现路由器只偏爱“1号专家”,导致“1号累死,2号3号闲死”的现象(专家塌陷)。
为了防止这种情况,论文在训练时加入了一个很直观的约束:要求路由器在处理一批数据时,给各个专家的平均派活概率不能偏离“均分线()”太远。这确保了所有专家都能分到任务,维持了整个小团队的认知多样性。

04
真实战力如何?11 个数据集硬碰硬
为了防止这种情况,论文在训练时加入了一个很直观的约束:要求路由器在处理一批数据时,给各个专家的平均派活概率不能偏离“均分线()”太远。这确保了所有专家都能分到任务,维持了整个小团队的认知多样性。
为了证明方法的通用性,测试的数据集涵盖了极其丰富的场景:从通用的 ImageNet,到细粒度的汽车、飞机、宠物,再到遥感卫星图、纹理识别以及动作识别。
▎跨界打击:从没见过的场景也能跑
论文在三大微调评估任务中,将 与当前行业最顶尖的 11 种 Benchmark 方法(包括 CoOp, CoCoOp, MaPLe, MMA, MMRL, MMRL++ 等)进行了正面交锋:
基类到新类泛化(Base-to-Novel):在 11 个数据集上, 不管是在已知基类(Base)、未知新类(Novel),还是综合评价指标(HM)上,均取得了全面领先的表现。 跨数据集评估(Cross-Dataset):在 ImageNet 上训练后,直接去跑其他 10 个未见过的全新数据集。《洞察三》预测的规律在这里得到了完美印证:那些给图像塔做了激进微调的方法(如 MMA)表现惨淡,而专注于文本端或带有自适应约束的 则大幅领跑。 域泛化(Domain Generalization):在 ImageNet-V2、Sketch(草图)、-A(对抗样本)、-R(渲染图)等存在严重分布偏移的数据集上测试, 表现出了极强的鲁棒性,平均准确率高居第一。

的性能曲线(顶端棕色虚线/带x标记)全程稳定压制其他所有主流 Baseline。
▎拆解验证:任何一个零件都不能少
为了验证每一个设计都不是“花架子”,论文对各个组件进行了剥离测试。

消融实验柱状图
如果去掉刹车机制(w.o. L_bias):模型在未知新类(Novel)上的表现立刻出现了显著下滑。这证明了在遇到不确定样本时,强制把图像适配器“踩刹车压向 0”对于保住泛化力至关重要。
如果给文本塔也装上刹车(w. bi-encoder L_bias):如果在文本端也搞不确定性抑制,性能反而大幅下降。这再次验证了《洞察一》:文本分支应该放心改,不需要像图像分支那样拘束。
如果去掉路由器或更换 MoE 结构:无论是去掉动态路由器(w.o. Router),还是把结构换成普通的 LoRA(w. LoRA),性能都有不同程度的衰减,证明了“单下采样+多上采样专家”非对称结构的优越性。
▎跑得快又不挑设备:老牌 ResNet 和新贵 ViT 通吃
虽然引入了 MoE 和动态刹车,但由于 的 Adapter 极其轻量,在单张 A800 GPU 上,它的训练和推理开销远低于复杂的 Prompt 寻优方法(如 MMRL),在性能与速度之间取得了极佳平衡。
除了在 Vision Transformer(ViT)上表现出色,论文还在传统的 ResNet-50 架构上进行了测试,同样实现了大幅领先,证明该方法具备广泛的模态骨干兼容性。
▎工程落地的“安全网”与适用边界
除了学术数据集上的指标,从工程落地和实际业务的角度来看, 的设计思路还带来了非常关键的启发:
工业部署的防过拟合安全网。
在电商VLM检索、遥感分类或边缘端部署等真实业务中,模型在上线后会不断撞见千奇百怪的未知测试样本(OOD 数据)。
传统模型遇到这种数据容易“硬猜”导致盲目自信的报错,而 这种“置信度低就自动退回预训练底座”的软约束,本质上为工业级模型的稳健运行搭了一道天然的安全网。
理性看待技术的适用边界。
这种“图像踩刹车”的自适应机制,最核心的优势场景是算力受限、标注样本匮乏的少样本(Few-Shot)快速迁移场景。
但如果我们面对的是拥有海量目标域标注数据的任务(比如几十上百万张精标注图像),强行压制视觉塔的修改量可能会限制模型的上限——此时全量微调或更激进的视觉塔重构可能依然能够取得更好的绝对性能。

05
结语:大模型微调的“克制艺术”
这篇论文的精妙之处,不仅在于它拿下了 11 个数据集的霸榜成绩,更在于它用极具优雅的数学解法,为整个VLM的微调范式泼了一盆冷水,也指出了一条新路。
它用实打实的实验告诉我们两个残酷却深刻的真相:
尊重VLM的“非对称性”:预训练视觉塔在海量数据中积淀出的通用表达极其珍贵。在少样本场景下,对视觉塔的激进修改往往是“破坏大于建设”。
用不确定性实现“软调控”:真正的智能调控不需要繁琐的人工规则,把控制权交给数据自身的“置信度”。遇到熟悉的知识放开拟合,遇到未知的世界及时退回底座。
在大家疯狂卷参数、卷复杂架构的今天,这篇文章或许给我们带来了一个最核心的启发:
VLM微调的最高境界,从来不是盲目堆叠参数去改造大模型,而是在保留预训练底座原有灵性的同时,学会适时放手——在熟悉的领地里精准发力,在未知的迷雾中优雅退避。
这种“文本常开、图像看情况踩刹车”的自适应思路,不仅优雅地破解了 CLIP 的分支偏置难题,更为未来海量VLM模型在边缘端、少样本工业场景下的高效落地,提供了一套极其靠谱的工程解法。
雷峰网
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。
来,一起快人一步!


上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

扫描上方二维码
或点击「阅读原文」关注专区。