论文精读F-VLM: Open-Vocabulary Object Detection Upon Frozen Vision and Language Models


前言

 本文介绍篇来自Google的ICLR2023的论文:F-VLM开源地址。

1、出发点

 本篇论文想将clip这种VLM强大的zero-shot分类能力迁移给开放词汇检测任务。那么就得要求特征层包含“局部感知”和“判别特征”的能力。本文通过K-means聚类clip的Image Encoder的特征层,并将其用于分类,发现效果还不错:
在这里插入图片描述
 于是作者想到直接冻结clip的特征提取层,然后微调一个检测器不就能得到一个不错的开放词汇检测器了吗。

2、方法

 这里简单补充下解决的任务:模型在 C B C_B CB的检测数据上训练;在 C N + C B C_N+C_B CN+CB上进行评测。其中 C N C_N CN不包含在 C B C_B CB中。

2.1.训练阶段

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值