SIFT 的变体与发展
在前两篇的内容里我们已经知道:从 DoG 尺度空间开始,到关键点检测、亚像素定位、方向分配,再到 128 维描述子的构建和最终匹配,SIFT 建立了一套完整且高度系统化的局部特征提取管道。解决了局部特征中的多个核心问题,如尺度不变性、旋转不变性和一定程度上的光照变化鲁棒性等。
直今,SIFT 依然是评价局部特征算法的重要基准之一。
但没有完美的算法,随着应用场景越来越复杂,人们发现 SIFT 仍然存在一些明显的不足:
问题 影响
计算速度较慢 难以满足实时视觉任务
描述子维度较高(128维) 存储和匹配开销较大
对大视角变化支持有限 大倾角拍摄时匹配性能下降
没有充分利用颜色、多光谱等信息 在特殊数据上表现受限
自然,在 SIFT 提出后的二十多年里,大量研究工作开始围绕这些问题不断改进,并提出变体和新算法。
基于这些,本篇内容围绕以下问题展开:
SIFT 的变体是否像其他领域一样将 SIFT 这样的起点算法完全取代?特征检测算法是否有了新的突破?DL 盛行的当下,SIFT 现代价值是怎么样的?
为了较清晰地回答这些问题,可以大致将后续发展分为以下四类:
让 SIFT 更快。
让 SIFT 的描述能力更强、匹配更加准确。
让 SIFT 能适应更多特殊应用场景。
深度学习方法。
前三类工作虽然采用的方法各不相同,但都没有脱离 SIFT 的整体框架。
真正改变这一领域发展方向的还是最后的深度学习时代:以数据驱动的逻辑重新设计特征检测与匹配算法。
6de0a39a-18cf-446c-9491-6ec5449054e0.png
- 第一条路线:让 SIFT 更快#
那一大串复杂的算法管道让 SIFT 精度有了保障,在很长一段时间里,它一直都是局部特征匹配精度的标杆。
但相应地,SIFT 的计算速度也限制了它的广泛应用:它几乎每一步都需要大量计算,这些操作共同带来了较大的计算开销。
对于图像拼接而言,这样的速度通常还能接受,因为拼接更关注最终精度。
但对于另外一些视觉任务,例如视频实时处理、机器人定位、自动驾驶等领域,算法往往需要达到几十帧甚至上百帧每秒(FPS)的处理速度。
此时,SIFT 的计算量就成为最大的瓶颈。改进想法自然出现:
能否保留 SIFT 的整体思想,尝试把那些计算最耗时的部分换成更简单、更快速的实现?
SURF,就是围绕这个问题诞生的。
2.1 SURF:用近似计算换取速度#
2006 年,论文 SURF: Speeded Up Robust Features 提出了 SURF,它的目标十分直接:
在尽量保持 SIFT 匹配性能的前提下,大幅提高计算速度。
SURF 几乎保留了 SIFT 的整个处理流程,但在每一个计算量最大的地方,都寻找了一种更加高效的替代方案。
先摆个表格整体来看,二者的对应关系如下:
SIFT SURF
DoG 检测器 Hessian 行列式
高斯卷积 Box Filter(箱式滤波)
梯度计算 Haar 小波响应
128维描述子 64维描述子
下面来简要展开一下:
2.2 Box Filter 和积分图#
SIFT 为了计算 LoG,需要不断进行高斯卷积,高斯卷积虽然精确,但卷积核越大,计算量也越大。
于是 SURF 采用了一种更简单的近似方法:Box Filter(箱式滤波器)。
8341caac-b7c3-4beb-b272-f8f27fe482f8.png
如图所示,Box Filter 其实就是用了更简单的权重取代高斯核。
这样,SURF 不再需要像 SIFT 那样不断建立高斯金字塔,而是直接通过改变滤波器尺寸来模拟不同尺度。
而与其搭配使用的是一种数据结构:积分图(Integral Image),它本质上是一张累加表:
8b71ab02-ccac-41bd-aea6-7d3e0e50683e.png
同样如图,积分图和 Box Filter 的配合起到了如下作用:
任意矩形区域内的像素和,都可以通过四次加减运算直接得到。配合 Box Filter 的简化权重,可以让卷积不再逐个加权求和,而是通过常数级的计算构建金字塔。
这是整个算法能够加速的基础。
2.2 进一步简化描述子#
除去对检测器的加速外,SURF 对描述子的计算也进行了简化。
SIFT 在每个子区域统计多个方向的梯度直方图,最终得到 128 维描述子。
而 SURF 则采用 Haar 小波响应(其实就是差分),只统计四个统计量:
cda1ecd8-b4c1-416d-bf4e-014100c4d4fd.png
这样,最终描述子维度变为了 64 维,后续匹配速度进一步提高。
经过这一系列近似替换,SURF 在保持较高匹配性能的同时,大幅降低了计算复杂度,在典型情况下,比 SIFT 约快 2~5 倍 。
但实际加速比例会受到图像规模、特征点数量以及具体实现方式等因素影响,因此不同实验中的速度提升并不存在统一数值。
- 第二条路线:让描述子更精确#
SURF 解决了 SIFT 的速度问题。
但研究者们很快便发现了新的优化空间:SIFT 使用 128 维梯度直方图获取的描述子信息丰富,区分能力强,但带来了两个问题:
维度较高: 需要更大的存储开销和更慢的匹配速度。
各维度的重要性并不完全相同: 有些方向上的梯度特别强,而另一些方向虽然较弱,却同样包含着有价值的信息。
于是便有了另一种优化思路:
能不能保持 SIFT 检测器不变,只改描述子本身的获取逻辑来提升精度?
随后几年,大量工作开始围绕描述子展开。
3.1 RootSIFT:改动最小,收益最大#
2012 年,论文 Three things everyone should know to improve object retrieval 提出的 RootSIFT 是一个改动极小的变体,它唯一修改的,仅仅是最后一步:描述子的归一化方式。
SIFT 在得到描述子以后,会进行 L2 归一化:
这样可以减弱整体亮度变化带来的影响。
但研究者发现,仅使用 L2 归一化仍然存在一个问题:
假设某个方向上的梯度特别强,欧氏距离会更多关注最大的那个数值,80 与 79 的差异往往比 3 与 1 的差异更加影响最终距离。
但对于局部特征来说,那些较小的梯度方向,同样可能包含着重要的信息。
于是,RootSIFT 把最后一步改成了少见的 L1 归一化后再开平方:
整个改动,就只有这一行公式,但它在多个公开数据集上,都获得了约 10%~20% 的匹配精度提升。
其逻辑可以这么理解:
RootSIFT 会削弱那些特别大的梯度响应,让原本较弱的方向拥有更多的话语权,这样,描述子的各个维度能够更加均衡地参与匹配。
最终,RootSIFT 几乎不增加任何额外计算,却能够显著提升匹配效果,因此被认为是"性价比最高"的 SIFT 改进之一,在许多工程实践中已经成为默认配置。
3.2 PCA-SIFT:更精简的描述子#
除了提高精度,还有另一部分研究者提出了一个问题:
128 维描述子中是否存在冗余?
还是图像数据的偏置:相邻方向之间、相邻网格之间,本身就存在较强相关性。
因此,128 维之间并不是完全独立的,能不能把这些重复的信息压缩掉?
04 年,论文 PCA-SIFT: A More Distinctive Representation for Local Image Descriptors 提出了 PCA-SIFT,显然,其关键技术是我们之前展开过的 PCA。
但其改进了 PCA 的使用思路,做法是这样的:
对大量训练图像提取 SIFT 描述子组成矩阵进行 PCA,取最终结果中固定维度的主成分组成投影矩阵,对之后新的描述子直接使用该投影矩阵降维。
0ecd47a5-833a-412a-a7ce-834e311355c3.png
这么做是因为如果两张图各自 PCA,那么同一个点投影以后就在不同坐标系,描述子无法比较,所以必须都用同一个 PCA。
直观来看这样不仅减少了存储空间,也提高了匹配速度。
但由于 PCA 投影矩阵需要提前训练,让其泛用性较低:自然图像训练得到的投影矩阵,未必适用于遥感图像;可见光训练得到的模型,也未必适用于高光谱图像。
因此,PCA-SIFT 虽然理论出色,但实际应用远没有 RootSIFT 广泛。
3.3 GLOH:重新设计描述子#
此外,还有一部分工作,则没有选择修改归一化方式,也没有选择降维,而是重新设计描述子的空间结构。
其中比较具有代表性的是 05 年的论文 **A Performance Evaluation of Local Descriptors 提出的 GLOH(Gradient Location and Orientation Histogram),其采用 极坐标划分同心圆后统计方向 的方式生成描述子:
109342a5-a8a0-406b-b77b-805153d27013.png
这种结构更加符合图像中局部区域的几何分布,因此理论上能够表达更多空间信息。
但这也意味着更复杂的计算,而且最终 GLOH 仍然需要利用 PCA 再次降到 128 维。
虽然实验结果表明,它的描述能力略优于 SIFT,但是提升并不算明显,而实现复杂度却增加了不少。
因此,这类方法更多还是停留在学术研究中。
- 第三条路线:让 SIFT 适应更多场景#
经过前面的改进,SIFT 的速度越来越快,描述子也越来越成熟。
但在不断实验中,研究者们发现 SIFT 还存在一点局限:它的不变性其实是有限的,当两张图像之间存在较大的拍摄角度变化,比如无人机俯视拍摄或者手持相机斜拍建筑时,SIFT 的匹配性能会明显下降。
因为这些情况下,同一个物体在图像中的形状已经发生了明显拉伸。
这种变化已经不再是简单的旋转或缩放,而属于仿射变换(Affine Transformation) 的范畴了:
一种介于刚体变换(只允许平移和旋转,保持长度与角度)和更一般的投影变换之间的几何模型,能够很好地描述许多实际拍摄场景中的局部形变,是计算机视觉中应用最广泛的变换模型之一。
7ee88804-eda0-4771-8a9a-17e56c02f33d.png