论文解读——DISK:Learning local features with policy gradient

本文提出一种基于强化学习的端到端局部特征提取框架,该框架通过优化特征匹配度来提升图像匹配精度。该方法克服了传统局部特征提取方法中存在的离散化问题,能够实现特征提取与匹配的一体化,提高了匹配的准确性和密集性。

摘要

1.由于特征点的提取和匹配的离散化,提取局部特征的框架很难进行端到端的学习。
2.作者提出了一种基于强化学习的策略梯度的提取局部特征的框架,其通过端到端优化实现了很高的特征匹配度
3.该简单却强有力的概率模型使得训练和推理更加接近,特征提取更加密集,挑战了“什么是好的关键点”的传统假设。
4.本文提供了在三个公共基准场景下进行图像匹配的先进实验结果

上图为SIFT和DISK在SFM下的特征提取图(右)和三维重建图(左)。其中,SIFT模型为图像匹配中基础的模型,而SFM算法是一种三维重建算法。可以看到本文提出的模型在三维重建上,纹理的复现更具优越性,在图像特征提取也是更加的密集和完整。

介绍(问题和模型的背景)

1.局部特征是计算机视觉领域很重要的一项技术,自从SIFT模型的诞生,很多应用应运而生,如三维重建,图像实景重定位等。随着深度学习的变革,其他应用多多少少有所提升。但是三维建模由于具有特征稀疏和需手工草稿的性质,成为了该领域应用最后的堡垒。三维建模背后的技术问题是,很难使用可区分的训练目标实现端到端地重建现在主流的一些任务实景。
2.由于计算的复杂性(两张图片每个像素都有可能是可以匹配的关键点),当特征描述

数据集可视化效果可参见下方展示。 【数据集概况】 · 检测类别(中文):[保龄球(bowling)] · 训练集:594 张 · 验证集:75 张 · 测试集:74 张 · 总计:743 张 该数据集聚焦于室内保龄球馆场景,系统性采集了多角度、多姿态下保龄球在不同运动阶段的视觉特征,为保龄球运动过程中的球体识别与轨迹分析提供了高质量标注样本,具有明确的体育训练与智能辅助系统开发价值。... 【训练曲线与评估图】 【模型训练配置】 参数 | 值 模型 | yolo26n 训练轮数 | 100 epochs 输入尺寸 | 640x640 批次大小 | 24 优化器 | auto 初始学习率 | 0.01 训练设备 【关键指标汇总】 训练了 100 个 epoch,最终轮指标: 指标 | 数值 mAP50 | **0.9938** mAP50-95 | 0.6966 Precision | 0.9740 Recall | 0.9974 train/box_loss | 0.9113 train/cls_loss | 0.2862 val/box_loss | 1.1516 val/cls_loss | 0.3116 【训练过程分析】 100 轮训练后 mAP50 达到 0.9938,模型收敛良好。Loss 曲线前段快速下降,后段趋于平稳,val_loss 无反弹,没有明显过拟合。但 mAP50-95 为 0.6966,和 mAP50 差距 0.30,定位精度仍有优化空间。 【模型性能评估】 Precision 0.9740、Recall 0.9974,精召双高,模型对保龄球的检测能力强。 【预测效果展示】 验证集预测效果较好,检测框基本准确覆盖保龄球,置信度整体偏高。 【改进建议】 1. 丰富场景多样性:补充不同光照、背景和遮挡条件下的样本。 2. 提升输入分辨率:640 ...
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值