PAANI:端侧可解释视觉导航架构
「针对资源受限的河道监测机器人,研究者提出PAANI端侧感知与引导架构,将YOLO11n检测器与轻量语义分割模型在Arduino UNO Q上做时间戳对齐的证据融合,并通过走廊策略输出可追溯的决策依据。系统在检测与分割任务上分别取得0.7388的mAP与0.9750的mIoU,中位延迟467.8毫秒。」
移动式河道监测机器人在实际作业中遇到的障碍物与水域边界,往往无法仅靠地理航点来描述。对于算力紧张的边缘平台而言,更大的挑战在于:如何把并不完美的视觉预测结果,转化为及时且可被检查的引导信息。一个目标标签或者一条转向指令,本身并不能说明它依据了哪些证据,也无法告诉操作者这些证据在什么时候是不可靠的。围绕这一痛点,研究团队提出了PAANI,一套运行在端侧的感知到引导架构。
在模型层面,PAANI组合了两个经过项目专门训练的视觉模型:一个是YOLO11n目标检测器,另一个是定制的MobileNetV3 Small语义分割器。两者在Arduino UNO Q上完成时间戳对齐的证据融合,让检测结果与分割掩码在时间维度上彼此印证。为了让目标在帧间保持连续性,系统引入了有界跟踪机制,为目标赋予一定的持久性,避免因单帧抖动而频繁丢失关注对象。在此之上,一条显式的走廊策略将水面标签、被接受的检测结果、紧迫程度以及掩码不确定性综合起来进行判断。值得注意的是,每一条最终给出的建议都会同时暴露其贡献证据与策略层面的理由,使决策过程具备可检查性。
系统通过ROS 2接口把本地AI流水线与独立的Gazebo船舶、定位与控制测试平台连接起来,形成从感知到仿真的闭环验证链路。在数据与训练方面,检测任务使用了10000张WaterScenes图像完成四类别训练,分割任务则使用1127张MaSTr1325图像,其中包含198张分割验证图像。最终选定的FP32 ONNX模型总体积为14.817 MB,体现出明显的轻量化取向。
性能指标方面,检测器检查点在0.5 IoU下的测试mAP为0.7388,而单独评估的矩形ONNX导出模型在相同阈值下的验证mAP为0.7367,两者数值接近,说明导出过程对精度的影响有限。分割ONNX模型的验证mIoU达到0.9750,表现出较高的分割一致性。在执行效率上,一段五分钟的UNO Q录制在配置为0.5赫兹的节拍下,产生了467.8毫秒的中位流水线延迟与580.3毫秒的95分位延迟,说明该架构能够在资源受限的硬件上保持可接受的处理节奏。
研究同时坦诚地指出了当前系统的若干不足。评估过程中发现了黑色输入被误分类的问题,以及一处采样率不匹配的情况,后者导致用于诊断的表观运动估计器无法收集到足够的证据。这些发现提示,端侧视觉系统在极端输入与传感器时序协同上仍有改进空间。
总体来看,这项工作提供的价值不在于宣称已经实现了经过验证的水上避障能力,而是给出了一套可检查、可复用的边缘机器人基础框架,并清晰地把模型精度、板上执行表现与真实水面碰撞规避这三件事区分开来。对于希望在低成本硬件上部署多模态视觉融合与可解释决策的开发者而言,这种把证据链与策略理由一并输出的设计思路,具有较强的参考意义。
来源:Heooo AI工具导航