CVPR 2023开源! ORB和SuperPoint还可以再强化一下!
bigegpt 2024-10-12 05:37 9 浏览
无论是ORB、SIFT这样的手工特征点,还是SuperPoint这类基于深度学习的特征点,都在SLAM和SfM中应用广泛。但这些方法都已经很早了,有没有什么算法可以对它们进行二次强化,并且还能在嵌入式设备上使用呢?
作者:泡椒味的口香糖 | 来源:3D视觉工坊
在公众号「3D视觉工坊」后台,回复「原论文」即可获取论文pdf。
添加微信:dddvisiona,备注:深度学习,拉你入群。文末附行业细分群。
今天要给大家介绍的就是这样一项工作,名为FeatureBooster,是CVPR 2023开源的工作。其在传统的特征匹配中引入轻量级描述符增强网络,主要思想是编码特征点的描述子及其几何信息,并使用轻量级Transformer来增强感受野,可以很好得优化ORB、SIFT、SuperPoint、ALIKE等特征点,并且在3090上运行速度达到了3.2ms,在Jetson Xavier NX上运行速度达到了27ms。这里也推荐「3D视觉工坊」新课程《ORB-SLAM3理论讲解与代码精析》。
下图左列是原始ORB的匹配结果(最近邻匹配+RANSAC),右列是ORB引入FeatureBooster后的匹配结果,显然在运动模糊和低纹理场景下引入FeatureBooster可以实现很好的匹配结果。
下面是一些真实场景下的匹配结果,引入FeatureBooster后匹配性能大幅提升,对于SLAM和SfM等任务的应该也会有提升效果。
代码已经开源了,感兴趣的小伙伴赶快试试吧,下面来看具体的论文信息。
我们引入一个轻量级网络来改进同一幅图像中关键点的描述符。该网络以原始描述符和关键点的几何属性作为输入,使用基于MLP的自增强阶段和基于Transformer的交叉提升阶段对描述符进行增强。增强后的描述符可以是实值描述符,也可以是二进制描述符。我们使用所提出的网络来提升手工设计的(ORB, SIFT)和最先进的基于学习的描述符(SuperPoint, ALIKE),并在图像匹配、视觉定位和运动产生的结构任务上对它们进行评估。结果表明,我们的方法显著提高了每个任务的性能,特别是在具有挑战性的情况下,如较大的光照变化或重复模式。我们的方法在桌面GPU上处理2000个特征只需要3.2 ms,在嵌入式GPU上处理2000个特征只需要27ms,速度足够快,可以应用到实际系统中。
FeatureBooster的输入是原始描述符和关键点的几何特性(位置、方向、置信度、尺度),并使用基于MLP的自提升阶段和基于Transformer的交叉提升阶段来增强描述符。其中,自提升阶段分为两步,首先将几何特性编码到新的高维向量,然后将描述子使用MLP投影到新空间。交叉提升阶段更侧重其他特征的描述符和所有特征的空间布局的全局上下文,主要是使用一个轻量级Transformer实现。注意,FeatureBooster的输入并不包括原始图像,所以这个网络很轻量。
那么,为啥要这样做呢?
首先,我们知道手工特征匹配有欧氏距离、汉明距离、Hellinger距离等等,那么使用这些距离进行相似性度量就一定好吗?或者举例来说,ORB的二进制描述子,一定是最适合汉明匹配吗?实际上,改变相似性度量方式,就相当于将原始的描述符投影到了另一个空间。所以,理论上这个空间也是可以学习的!所以就可以使用MLP将原始描述符编码,来逼近这个最优空间!
其次,描述子的几何信息,例如位置、方向、置信度、尺度,也对学习非常有用,所以也可以进行编码。
再说这个交叉增强。前面自增强是独立得增强每个关键点的描述子,但是没有考虑不同关键点之间的相关性。交叉增强就是巧妙利用了同一图像中不同特征点的上下文线索,而全局上下文正好就是Transformer的强项!借助Transformer中的Attention,可以聚合所有局部特征信息,形成全局上下文。通过整合这种全局上下文信息,局部特征描述子会具有更大的感受野,并根据其邻域特征点进行自适应调整。
但使用Transformer最大的问题是计算量和GPU显存占用,作者使用了一些trick。本身多头注意力机制使用注意力矩阵来进行Q和V的交互,进行Q和K点积计算的话复杂度是O(N2D)(N是特征点数目,D是描述子维度),显然是无法接受的。因此,作者设计了一个Attention-Free Transformer模块(AFT),AFT重新排列了Q、K、V的计算顺序,它将K和V逐元素相乘,而没有使用矩阵乘法,因此**计算复杂度降低到了O(ND)**。
最重要的是,FeatureBooster可以适用于任何实值描述子和二进制描述子。但实际上,实值描述子也就相当于给网络的最后一层输出进行L2归一化,二进制描述子也就相当于使用tanh给最后一层进行阈值化。
训练是在MegaDepth和DISK上进行,使用AdamW优化器,初始学习率为1e-3并使用余弦退火策略。测试时,使用HPatches测试集来评估图像匹配任务,使用Aachen Day-Night数据集和InLoc数据集来评估定位任务,使用ETH SfM benchmark来评估SfM性能,使用EuRoC来评估ORB-SLAM2优化效果,注意FeatureBooster并没有在这些数据集上进行微调。
光照和视角变化下的MMA显示,FeatureBooster无论对于实值描述子还是二进制描述子,都可以提升性能,表中Boost-F和Boost-B分别表示实值描述子和二进制描述子。笔者觉得这里也有一个很重要的点,就是FeatureBooster可以将实值描述子转换为二进制描述子,反之亦然。注意看表中带有二进制描述子的SuperPoint,其性能几乎和原始的浮点数描述子相同,但要知道二进制描述子的区分度本来就是不如浮点数的!
下面再看视觉定位结果,主要对比严重光照变化、重复纹理和无纹理条件下的定位性能,结果显示FeatureBooster在室内和室外环境下都提升了性能,优化后的ORB特征甚至可以和SuperPoint竞争,甚至在室内实验超越了ALIKE。有意思的是,还对比了SuperPoint和SuperGlue这个组合。
再来看看SfM测试结果,实验方法是,首先对数据集进行穷举图像匹配,然后进行最近邻匹配,最后执行ColMap,对比匹配图像的数量、稀疏点、图像中的总观测值、平均轨迹长度和平均重投影误差。这个结果说明优化后的特征点,可以找到更多的匹配关系来重建3D点。这里也推荐「3D视觉工坊」新课程《ORB-SLAM3理论讲解与代码精析》。
消融实验是针对SuperPoint(为啥不做ORB和其他特征点了呢?),主要是证明几何信息编码对于自提升阶段的作用,还有交叉提升阶段的影响。
作者还将改进后的ORB特征嵌入到了ORB-SLAM2中,并在EuRoC数据集中进行测试。结果显示,大多数序列上的平移误差都减小了。感兴趣的读者可以尝试嵌入到ORB-SLAM3中进行测试。
作者也对比了不同的Transformer模块对算法性能的影响,结果显示,使用Attention-Free的模块虽然MMA稍差一点,但是速度得到了极大提升,这也从另一方面证明了作者设计的这个注意力模块的计算效率。
FeatureBooster这项工作主要是针对ORB、SIFT、SuperPoint、ALIKE这四个常见的特征点的描述子进行优化,分别进行描述子编码、描述子几何信息编码,以及同其他特征点的全局上下文感知。分别做了图像匹配、定位、SfM、SLAM等实验,工作量很充实。关键是算法可以在嵌入式设备上实时运行,这一点还是挺有应用价值的。
目前工坊已经建立了3D视觉方向多个社群,包括SLAM、工业3D视觉、自动驾驶方向,细分群包括:[工业方向]三维点云、结构光、机械臂、缺陷检测、三维测量、TOF、相机标定、综合群;[SLAM方向]多传感器融合、ORB-SLAM、激光SLAM、机器人导航、RTK|GPS|UWB等传感器交流群、SLAM综合讨论群;[自动驾驶方向]深度估计、Transformer、毫米波|激光雷达|视觉摄像头传感器讨论群、多传感器标定、自动驾驶综合群等。[三维重建方向]NeRF、colmap、OpenMVS等。除了这些,还有求职、硬件选型、视觉产品落地等交流群。大家可以添加小助理微信: dddvisiona,备注:加群+方向+学校|公司, 小助理会拉你入群。
相关推荐
- 当Frida来“敲”门(frida是什么)
-
0x1渗透测试瓶颈目前,碰到越来越多的大客户都会将核心资产业务集中在统一的APP上,或者对自己比较重要的APP,如自己的主业务,办公APP进行加壳,流量加密,投入了很多精力在移动端的防护上。而现在挖...
- 服务端性能测试实战3-性能测试脚本开发
-
前言在前面的两篇文章中,我们分别介绍了性能测试的理论知识以及性能测试计划制定,本篇文章将重点介绍性能测试脚本开发。脚本开发将分为两个阶段:阶段一:了解各个接口的入参、出参,使用Python代码模拟前端...
- Springboot整合Apache Ftpserver拓展功能及业务讲解(三)
-
今日分享每天分享技术实战干货,技术在于积累和收藏,希望可以帮助到您,同时也希望获得您的支持和关注。架构开源地址:https://gitee.com/msxyspringboot整合Ftpserver参...
- Linux和Windows下:Python Crypto模块安装方式区别
-
一、Linux环境下:fromCrypto.SignatureimportPKCS1_v1_5如果导包报错:ImportError:Nomodulenamed'Crypt...
- Python 3 加密简介(python des加密解密)
-
Python3的标准库中是没多少用来解决加密的,不过却有用于处理哈希的库。在这里我们会对其进行一个简单的介绍,但重点会放在两个第三方的软件包:PyCrypto和cryptography上,我...
- 怎样从零开始编译一个魔兽世界开源服务端Windows
-
第二章:编译和安装我是艾西,上期我们讲述到编译一个魔兽世界开源服务端环境准备,那么今天跟大家聊聊怎么编译和安装我们直接进入正题(上一章没有看到的小伙伴可以点我主页查看)编译服务端:在D盘新建一个文件夹...
- 附1-Conda部署安装及基本使用(conda安装教程)
-
Windows环境安装安装介质下载下载地址:https://www.anaconda.com/products/individual安装Anaconda安装时,选择自定义安装,选择自定义安装路径:配置...
- 如何配置全世界最小的 MySQL 服务器
-
配置全世界最小的MySQL服务器——如何在一块IntelEdison为控制板上安装一个MySQL服务器。介绍在我最近的一篇博文中,物联网,消息以及MySQL,我展示了如果Partic...
- 如何使用Github Action来自动化编译PolarDB-PG数据库
-
随着PolarDB在国产数据库领域荣膺桂冠并持续获得广泛认可,越来越多的学生和技术爱好者开始关注并涉足这款由阿里巴巴集团倾力打造且性能卓越的关系型云原生数据库。有很多同学想要上手尝试,却卡在了编译数据...
- 面向NDK开发者的Android 7.0变更(ndk android.mk)
-
订阅Google官方微信公众号:谷歌开发者。与谷歌一起创造未来!受Android平台其他改进的影响,为了方便加载本机代码,AndroidM和N中的动态链接器对编写整洁且跨平台兼容的本机...
- 信创改造--人大金仓(Kingbase)数据库安装、备份恢复的问题纪要
-
问题一:在安装KingbaseES时,安装用户对于安装路径需有“读”、“写”、“执行”的权限。在Linux系统中,需要以非root用户执行安装程序,且该用户要有标准的home目录,您可...
- OpenSSH 安全漏洞,修补操作一手掌握
-
1.漏洞概述近日,国家信息安全漏洞库(CNNVD)收到关于OpenSSH安全漏洞(CNNVD-202407-017、CVE-2024-6387)情况的报送。攻击者可以利用该漏洞在无需认证的情况下,通...
- Linux:lsof命令详解(linux lsof命令详解)
-
介绍欢迎来到这篇博客。在这篇博客中,我们将学习Unix/Linux系统上的lsof命令行工具。命令行工具是您使用CLI(命令行界面)而不是GUI(图形用户界面)运行的程序或工具。lsoflsof代表&...
- 幻隐说固态第一期:固态硬盘接口类别
-
前排声明所有信息来源于网络收集,如有错误请评论区指出更正。废话不多说,目前固态硬盘接口按速度由慢到快分有这几类:SATA、mSATA、SATAExpress、PCI-E、m.2、u.2。下面我们来...
- 新品轰炸 影驰SSD多款产品登Computex
-
分享泡泡网SSD固态硬盘频道6月6日台北电脑展作为全球第二、亚洲最大的3C/IT产业链专业展,吸引了众多IT厂商和全球各地媒体的热烈关注,全球存储新势力—影驰,也积极参与其中,为广大玩家朋友带来了...
- 一周热门
- 最近发表
-
- 当Frida来“敲”门(frida是什么)
- 服务端性能测试实战3-性能测试脚本开发
- Springboot整合Apache Ftpserver拓展功能及业务讲解(三)
- Linux和Windows下:Python Crypto模块安装方式区别
- Python 3 加密简介(python des加密解密)
- 怎样从零开始编译一个魔兽世界开源服务端Windows
- 附1-Conda部署安装及基本使用(conda安装教程)
- 如何配置全世界最小的 MySQL 服务器
- 如何使用Github Action来自动化编译PolarDB-PG数据库
- 面向NDK开发者的Android 7.0变更(ndk android.mk)
- 标签列表
-
- mybatiscollection (79)
- mqtt服务器 (88)
- keyerror (78)
- c#map (65)
- resize函数 (64)
- xftp6 (83)
- bt搜索 (75)
- c#var (76)
- mybatis大于等于 (64)
- xcode-select (66)
- mysql授权 (74)
- 下载测试 (70)
- linuxlink (65)
- pythonwget (67)
- androidinclude (65)
- libcrypto.so (74)
- logstashinput (65)
- hadoop端口 (65)
- vue阻止冒泡 (67)
- jquery跨域 (68)
- php写入文件 (73)
- kafkatools (66)
- mysql导出数据库 (66)
- jquery鼠标移入移出 (71)
- 取小数点后两位的函数 (73)