
HAWAII 论文核心总结与翻译
一、主要内容总结
1. 研究背景与问题
视觉语言模型(VLMs)的性能高度依赖视觉编码器的语义特征提取能力,现有研究表明融合多个预训练视觉专家模型能显著提升性能,但会导致训练和推理阶段的计算成本激增,难以部署于资源受限场景。传统知识蒸馏方法(如MoVE-KD)采用固定LoRA适配器蒸馏多专家知识,易因专家间异质性(训练数据、架构、目标不同)产生知识冲突和噪声传递,影响模型效果。
2. 核心框架:HAWAII
提出一种分层视觉知识迁移框架HAWAII,将多个视觉专家(SAM、ConvNeXt、EVA、Pix2Struct等)的知识蒸馏到单个CLIP视觉编码器中,在保持低计算开销的同时继承多专家的互补优势。核心组件包括:
- 混合LoRA适配器(MOLA):含专家专用LoRA适配器和通用知识LoRA适配器,分别对应细粒度和粗粒度蒸馏,通过稀疏路由器动态选择激活的适配器。
- 分层知识蒸馏(HKD):
- 细粒度蒸馏:为每个专家分配专用LoRA适配器,基于视觉特征与文本指令的相似度计算令牌重要性得分,自适应聚焦高信息价值令牌,减少噪声。
订阅专栏 解锁全文

170

被折叠的 条评论
为什么被折叠?



