ECCV 2026|相机 × 激光雷达 × 4D 雷达:RAF 如何实现恶劣天气下的鲁棒 3D 检测?
ECCV 2026 · KAIST · 3D OBJECT DETECTION在下雨或者下雪的情况下再加一台相机会更好一些吗相机应该在点云变稀的时候进行补充但是也有可能把雨水、雪花遮挡看作新的噪音。RAF 的解决办法是不要对整个图片同等对待而是要为每一个像素估计出可信度。01导读在下雨下雪的时候LiDAR 和 4D RADAR 的回波就会变得很稀少相机本来应该来填补这些空缺的地方。但是镜头也会因为雨水、雪花或者雾气而变得模糊不清在有的地方还出现了噪音。这时如果直接把相机的信息加到融合网络中去的话并不会使情况变得更稳定还会把错误的信息放大的问题出现。KAIST 队伍所提出的方法叫做可靠性-aware融合(RAF)它给人们提供了一条简单明了的道路首先对每个像素点进行可靠性的评估然后根据这个结果来确定相机特征在三维检测中要起多大的作用。在接入RAF之后在3D-LRF上总体的AP_BEV由原来的64.5提升到了现在的71.0而AP_3D也从之前的35.8提高到了现在的43.2分别增加了6.5和7.4个百分点。02核心信息标题RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather | 面向恶劣天气下鲁棒三维目标检测的相机、激光雷达与 4D 雷达可靠性感知融合发表ECCV 2026作者Heejun Park、Jaeseok Jeong、Kuk-Jin Yoon单位韩国科学技术院KAIST视觉智能实验室论文https://arxiv.org/abs/2607.04587代码https://github.com/parkie0517/RAF简而言之就是RAF 通过弱监督逐像素可靠性图来消除由于相机噪声明显降低而产生的雨雪遮挡问题在此基础上再用CALM 来缓解跨模态投影时出现的标定误差。03研究背景“加相机”的地方为什么会变坏呢LiDAR擅长处理几何和距离的问题但是距离越大点云就越稀4D雷达在恶劣天气下更加稳定并且可以给出速度信息但是也会由于反光不充分而导致没有目标回波。相机可以弥补稠密语义上的不足但是一个不同的问题是雾霾并不是均匀分布的。一块雪花可以挡住画面的一半一滴雨水可以把前面的车全部遮住但是其他地方还是可以看到的。如果网络只学习一个完整的模态权重或者让置信图仅仅依靠检测损失去自我探索的话那么它就很难得到明确的监督信号来判断哪些部分已经不再可信了。论文把这样的问题归结为相机可靠性的空间变化问题。图1 RAF要解决的两个入口问题就是点云稀少和相机可靠性的不足。04 RAF 做了以下三点事情给可信赖度图直接的学习信号由于论文中没有给出每一像素的真实可靠性值所以先根据可视性把图像分成Clean、Mixed和Noisy三类然后用Clean和Noisy进行跨模态对齐并且得到的相似度作为稀疏伪标签来指导可靠性估测器的学习过程。2、给标定误差留下一定的余地可以用CALM来表示当体素被投射到图像平面上的时候如果外参存在微小偏差的话就会落在错误的位置上。CALM 会在附近的窗口中找到最接近的匹配并且不会引入新的可学习参数但是可以使得跨模态对应对于稍微投影偏移更加宽容。3、保留预训练的LiDAR-Radar骨干RAF 已经有了用 LiDAR-RADAR 作为基础的部分并且只对新加入的相机部分进行训练还包括了可靠性评估器、BEV 融合编码器和检测头等组件。虽然可以看作是一个可替换的模块但是仍然存在一定的计算开销。05方法深入研究由相似度控制变为可靠性的门控图2 RAF总体结构可靠性估算、CALM以及门控整合。第一部分就是求出跨模态相似度RAF 将 LiDAR-RADAR 体素特征和相机特征投影到一个公共隐空间中并利用归一化的余弦相似度计算出一个介于 0 和 1 之间的分数值。对于干净图像而言期望该分数越接近于 1而对于噪声图像则期望该分数越接近于 0。该步骤使可靠性的判断不再仅仅依靠对损失进行反向传播来推测而会从不同模态的一致性中获得训练信息。图3 可靠性估计算法弱监督学习过程。第二步在局部窗口中找到最好的匹配对于第i个投影体素在窗口集里取最大的相似度值当窗口尺寸为1的时候就变成了普通的单像素匹配本文默认采用的是5。窗口不能太大也不能太小如果增大到7的话就会把远处的像素当作对应的点了。最好的窗口大小是5表示局部容错有效但是过大范围地搜寻会导致错误的相关性产生。第三步就是用可靠性图来控制相机特征保留的比例可靠性估计器用的是一个轻量级的CNN来产生每个像素点上的可靠度图R在α0的情况下所有的不可信像素都可以被抑制掉在α1的时候就相当于没有做门控了。论文中默认值为α0.2。默认情况下会保存一部分底层相机的信息来防止突然切换导致的数据丢失过多在可靠的区域全部保留下来就是所谓的**“有选择性地信任相机”**。第四步就是进行联合训练检测以及可靠性的分析在训练的时候要进行跨模态投影、CALM以及稀疏监督在推理的时候只需要相机分支来产生一个置信图并不需要再执行CALM或者类似的相似性计算了。06源码解析仓库都已经对外公布了那么我们先来看看哪些地方呢目前公开仓库中包含了models、pipelines、configs、datasets和tools等文件夹同时也提供了main_train.py和main_eval.py这样的入口文件。对于安装的部分则是按照K-Radar官方环境来进行的。按照三条线路来读取首先通过configs去验证L4DR或者3D-LRF的基础数据和数据通道然后沿着main_train.py以及pipelines寻找出检测、相似度以及可靠性的损失三者结合的地方最后到models中找到相机部分、可靠性估测器以及BEV融合的位置。在复现的时候要重点检查训练和推理这两个分支论文中提到在推理阶段不需要CALM了它的作用只是在训练期间产生更加准确的跨模态对应。07实验验证提高的原因是什么K-Radar 包括58 个序列、17458 个训练样本以及 17536 个测试样本在论文中根据相机可视性被分成 21 个清晰、9 个噪声和 28 个混合序列在 Sedan 类别下并且 IoU0.5 的情况下给出 BEV 和 3D 的 AP 值。论文也对VoD进行了评价但是具体的数值被放到附加资料里去了并没有提及。证据二LiDAR-RADAR 的主要负责人也从中获益表1 K-Radar 测试集的主要结果。3D-LRF接入RAF之后AP_BEV由原来的64.5/35.8提升到了现在的71.0/43.2增加了6.5分AP_3D也从之前的77.5/53.5提高到了现在的82.0/57.4并且获得了整个表格中最好的总分。结果表明RAF可以适用于两种不同的主要技术路线但是得分最高的还是L4DRRAF。第二条证据就是混合才是可靠性的主要阵地表2 清晰、混合和噪声可见度条件下所得到的结果。混合场景中既有可视又有不可视的部分简单的关节或者冻结融合都会失分但是 RAF 在两条主干上都比各自的 LiDAR-RADAR 基线要好很多。在全部都被遮住的嘈杂场景下RAF 并不是凭空恢复了视觉效果而是尽可能地回到没有用到摄像头的时候的状态。第三种情况就是门控不进行监管的话就会对性能造成损害表3 门控、弱监督和CALM各部分的作用。只用门控而让其仅仅依靠于对损失的判断来学习的时候3D-LRF 的 AP_3D 由原来的 39.1 下降到现在的 33.1降低了 6.0加上了弱监督之后又回升到了 41.9再加上 CALM 后达到了 43.2。监督信号和可靠的跨模态对应是缺一不可的。08定性分析红区是否处于被遮蔽的位置上图4 不同可见度条件下定量检测的结果。Clean 类型的照片里可靠性的图像几乎为纯白Mixed 类型的照片里雨雪污染的地方用红色表示出来可以看到的部分仍然保持着较高的可靠性Noisy 类型的照片全部变成红色。这可以形象地表明RAF学到的是一个局部开关而非全局开关在不同位置上的可靠程度也各不相同。CALM 的弱监督版本给 L4DR 带来了 1.8 AP_BEV、2.0 AP_3D 的提升效果给 3D-LRF 带来了 0.5 和 1.3 的提升效果这些改进来自于训练期间更加稳定的跨模态匹配并且CALM 不会带来任何可学习的参数。边界要说明的是在噪声条件下RAF 只是更加靠近了 LiDAR-RADAR 基线并没有在完全看不见的情况下把信息给找回来。09总结与展望RAF 最可取之处在于它并没有把所有的信息都一股脑地塞进去而是在确定了要相信的信息之后再进行分析。逐像素可靠性的地图可以用来判断某个地方是否有用的信息而CALM 则防止小角度调整造成的偏差。它也有明确的边界在目前可靠性估算只考虑了相机、LiDAR 和 4D RADAR 本身的老化的情况下加入相机分支会带来更多的参数和计算量。比如L4DR的基础是55.83M个参数、140.07GFLOPS、5.36FPS而引入相机分支之后则变成了126.42M个参数、286.81GFLOPS、4.19FPS。虽然可靠性更好并不代表没有工程成本。接下来可以将相同的可靠性建模应用到LiDAR和RADAR上并且使这三种传感器都能够根据天气、距离以及遮挡等因素来自动地判断出各自的可信程度那么多模态才会由目前固定的拼接方式转变为针对场景的协同工作模式。往期推荐