面对一团三维点云,如果已经决定把特征投影到二维平面,一个很自然的想法是:XY、XZ、YZ 三个方向都要,看到的视角越多,信息就越完整。
我们在 PlaneSegNet 中做的消融实验却给出了一个不那么直观的结果。只加入水平的 XY 投影,不仅没有改善植物与非植物交界处的分割,效果还略有下降;XZ 和 YZ 两个垂直投影都有帮助;把三个平面全部融合,又不如只保留两个垂直平面。
比起模型最终高了多少分,我更愿意记住这个现象。它揭示的不是某个模块的搭法,而是一条更一般的判断:表示不是对信息的被动搬运,而是对什么关系值得保留的主动选择。
体素化只解决了“在哪里计算”
原始点云是一组散落在三维空间里的坐标,没有图像那样整齐的像素网格。把点云体素化,相当于用规则的三维格子给这些点分配地址;只在被占用的体素上做稀疏卷积,又避免了为空白空间支付大部分计算成本。PlaneSegNet 的主体正是一个稀疏三维 U-Net,体素化时还保留了索引映射,以便最后把体素预测送回原始点。
但“能够高效计算”不等于“已经找到该看的关系”。
植物与地面的边界尤其麻烦。茎叶可能贴近地面,杂草和机械结构也可能混在附近;局部体素里的形状并不总能给出清楚答案。稀疏卷积可以逐层扩大感受范围,却仍然需要一种方式,把更大尺度的几何结构带回这些模糊位置。
这时,平面投影的作用并不是把三维数据变成三张更容易处理的图片。它真正提出的问题是:为了汇集远处的信息,我们愿意暂时丢掉哪条坐标轴?
一次投影,就是一次有方向的信息压缩
把三维体素特征按相同的二维坐标聚合到一个平面,必然会压掉一个方向:投影到 XY 平面时,高度 z 被折叠;投影到 XZ 平面时,纵深 y 被折叠;投影到 YZ 平面时,宽度 x 被折叠。
三个平面并不只是同一个物体的三个等价视角,因为被丢掉的信息不同。
对于植物与地面的分离,高度恰好是很有解释力的坐标。俯视时,叶片、茎秆和地面杂波会落在相近的水平位置,原本位于不同高度的点被叠在一起。换到垂直平面,地面更接近一条狭窄的低处带状区域,植物的垂直延伸仍然可见。XZ 和 YZ 又从两个正交方向保留了这种高度变化,减少了单一侧视方向造成的遮蔽。
高处的植物点被压回杂乱的地面足迹。
植物仍然高于狭窄的地面带。
另一侧的垂直视图也保留了高度过渡。
图里没有模拟真实注意力权重,只保留了投影最基本的几何后果。同一批点没有增加或减少,区别只是每次压平时丢掉了什么。对这个任务而言,保留高度比凑齐视角更重要。
更多输入,不一定形成更多可用信息
从数据量上说,把 XY 特征也拼进来,模型当然得到了更多数值。但“数值更多”和“判别线索更多”不是一回事。
PlaneSegNet 的平面模块先对投影位置上的三维特征做均值聚合,再把二维结果对齐回体素空间,与原始三维特征融合。这个过程让远处但共享平面坐标的体素发生联系,也意味着被投影轴上的差异会被压缩。水平投影恰好压掉高度,地面杂波与植物又容易在水平位置上重叠,于是得到的是一份更混杂的摘要。
后面的特征拼接和多层感知机并没有无限的能力自动忽略一切无关输入。无关视角可能与真正有用的垂直线索竞争,让融合结果更难围绕任务所需的结构组织。消融实验中,三平面融合不如 XZ+YZ,正是这条判断的一次可检验支持。
这并不证明 XY 投影天然有害。换成道路边界、屋顶轮廓或别的坐标约定,水平结构可能恰恰是关键。实验支持的是一个更窄也更可靠的结论:注意力不会替我们决定什么值得注意;它只会放大表示方式已经允许它看见的关系。
如果差异发生在边界,就不要只看全局分数
这条直觉还有一半来自评价方式。
植物内部和大片地面通常容易分类,真正受平面方向影响的是两类交界处。然而边界点只占整片点云很小的一部分。把所有点汇总成一个交并比或 F1 分数时,大量容易样本会淹没局部改进,于是几个模型的全局结果看起来差不多。
论文因此从植物最低高度开始,沿 Z 轴按 0.05 米划分六个层级,单独观察靠近地面的区域。只有把度量对准方法声称改善的位置,XZ、YZ、XY 之间的差异才真正显现出来。
这件事和选择投影平面其实是同一个问题。表示方式决定模型保留什么,评价方式决定实验看见什么。若一个方法声称改善边界,却只报告由内部点主导的全局指标,即使数字更高,也没有真正检验它自己的核心判断。
科研留下来的,应该是一条经得住追问的直觉
作为这篇论文的作者之一,我并不觉得最值得写进博客的是参数量、推理速度,或在哪些数据集上超过了哪些模型。那些数字当然是论文成立所必需的证据,却会随硬件、实现和工业界的优化迅速改变。
更能留下来的,是一条被方法和实验共同约束过的直觉:面对稀疏三维数据,先把计算组织到体素上,再把任务依赖的几何关系投影出来;不要默认所有方向等价,也不要默认把所有特征交给网络,它就会替我们完成选择。最后,评价必须放大这条选择真正影响的区域,否则验证到的只是一个平均数。
科研工作的价值不一定是给出一个可直接部署的最终答案。它也可以是把一个模糊经验变成明确假设,再设计结构与实验,让这条假设有机会被证伪。PlaneSegNet 对我而言最有价值的部分,不是“平面注意力有效”,而是把问题推进成了更具体的一句:当任务依赖某种方向性结构时,少看一个无关方向,可能比多收集一个视角更接近理解。
论文与代码:Xin Yang、Chenyi Xu 等,“PlaneSegNet: A deep learning network with plane attention for plant point cloud segmentation in agricultural environments”,Artificial Intelligence in Agriculture;项目源代码。