(论文速读)LitePT:卷积做低层几何,注意力做高层语义的轻量点云 Transformer

📅 发布时间:2026/8/25 14:09:57
(论文速读)LitePT:卷积做低层几何,注意力做高层语义的轻量点云 Transformer
论文题目LitePT: Lighter Yet Stronger Point Transformer更轻量却更强的点云 Transformer会议CVPR 2026源码GitHub - prs-eth/LitePT: [CVPR 2026 Highlight] LitePT: Lighter Yet Stronger Point Transformer · GitHub摘要现代 3D 点云处理神经网络通常同时包含卷积层和注意力模块但如何以最佳方式组合二者仍不清楚。本文分析了不同计算模块在 3D 点云网络中的作用并发现了一种直观的规律在网络早期的高分辨率层中卷积已经足以提取低层几何信息而此时注意力计算代价高昂却不会带来额外收益相反在低分辨率的深层网络中注意力能够更加高效地捕获高层语义与上下文信息。基于这一设计原则作者提出了一种改进的 3D 点云骨干网络在早期阶段使用卷积并在更深层切换至注意力。为了避免移除冗余卷积层后造成空间布局信息损失作者进一步提出了一种新的、无参数的 3D 位置编码 PointROPE。最终得到的 LitePT 相比当前先进的 Point Transformer V3参数量减少 3.6 倍运行速度提升 2 倍内存占用降低 2 倍同时在多种任务与数据集上仍能够达到或超过 Point Transformer V3 的性能。一、研究背景与核心问题Point Transformer 真的需要每一层都做 Attention 吗近几年Transformer 已经逐渐成为 3D 点云理解中的主流架构。以 Point Transformer V3PTv3为例它在多个点云任务上表现很好但一个容易被忽略的问题是PTv3 并不是一个“纯 Transformer”。PTv3 的一个基本 block 实际上由两部分组成用稀疏卷积实现的 Conditional Positional EncodingAttention MLP 组成的 Transformer 模块。论文 Figure 2PTv3 Block 结构Figure 2 重点看一点卷积和注意力在 PTv3 的几乎每个层级中都是绑定出现的。卷积先参与位置编码后面再接 Attention。问题在于这种“每一级都既卷积又 Attention”的设计真的合理吗作者首先发现了一个非常关键的现象PTv3 有 67% 的参数实际上花在稀疏卷积位置编码上而真正的 Attention MLP 只占大约 30%。这就引出了 LitePT 最核心的研究问题卷积与 Attention 在点云层次网络中到底各自负责什么真的有必要让二者从浅层一路同时工作到深层吗1.1 Table 1先把 PTv3 拆开看看作者做了一个很直接的实验也就是说去掉 Attention MLP 后ScanNet 从 77.5 降到 73.4但去掉 SparseConv 后直接下降到 70.7nuScenes 上也是相同趋势。这个结果很有意思。本来 PTv3 中的 SparseConv 名义上主要承担“位置编码”的任务但实验说明它实际上并不只是记录位置它还承担了大量局部几何特征提取工作。1.2 Figure 3参数贵在哪里计算又贵在哪里论文 Figure 3PTv3 与 LitePT 的参数量、延迟分布Figure 3 是理解整篇论文最关键的图之一。它给出了两个结论第一卷积主要贵在参数。随着网络进入深层特征维度越来越高因此卷积层参数量迅速增加。PTv3 中大量参数都堆积在靠近 U-Net bottleneck 的深层卷积中。第二Attention 主要贵在浅层计算。浅层点云分辨率最高token 数量最多。此时执行 Attention 的代价最大经过逐层下采样之后token 数量下降深层 Attention 的成本也随之明显下降。于是一个很自然的想法出现了既然浅层 Attention 贵而收益有限为什么不删掉既然深层卷积参数很多而此时更需要语义关系建模为什么不也删掉1.3 Figure 4网络自己已经形成了“几何 → 语义”的层次论文 Figure 4不同 Encoder Stage 学到的 PCA 特征作者进一步把 PTv3、去 Transformer 的 PTv3、去 SparseConv 的 PTv3 在各个编码阶段学到的特征进行 PCA 可视化。结果非常一致Stage 0、Stage 1 等浅层主要编码局部几何结构越往深层特征逐渐表现出更清晰的语义这种层次规律并不强依赖于究竟使用卷积还是 Attention。于是 LitePT 的核心设计原则基本确定Convolution for low-level geometryAttention for high-level relations。即浅层用卷积解决局部几何深层用 Attention 解决高层语义与长距离关系。二、LitePT 整体框架不要把卷积和 Attention 平均撒在每一层LitePT 并没有发明一种特别复杂的新 Transformer Block。恰恰相反它做的是一件非常“克制”的事情不同深度的网络只保留当前阶段真正需要的算子。2.1 从统一 Hybrid Block变成 Stage-specific Block设整个层次编码器共有 (L) 个 stage第 (i) 个 stage 将上一层特征 () 转换为这里的 () 不再像传统 Hybrid Transformer 一样固定使用“卷积 Attention”而是根据网络深度选择其中(Lc)卷积与 Attention 的切换位置()使用卷积()使用 Attention。直观理解就是网络前面点很多、分辨率高而且关注的是邻域形状——用卷积。网络后面点已经少了语义抽象越来越强——再把 Attention 用在真正值得用的地方。这和很多已有 Hybrid Point Transformer 的差异在于过去的方法往往设计一个统一的“卷积 Attention”单元然后从浅层复制到深层LitePT 则直接把两类算子拆开并按照层次进行分工。2.2 Figure 5LitePT-S 到底长什么样论文 Figure 5LitePT-S 整体架构Figure 5 中的 LitePT-S 使用标准 U-Net 式五阶段结构。默认设置下前 3 个 stage 使用 ConvBlock后 2 个 stage 使用 AttnBlockAttention 前加入 PointROPE语义分割版本的 Decoder 被进一步简化只留下用于融合 skip connection 的 Linear Projection 与 LayerNorm。论文构造了三个规模LitePT-S(C(36,72,144,252,504))(B(2,2,2,6,2))LitePT-B(C(54,108,216,432,576))(B(3,3,3,12,3))LitePT-L(C(72,144,288,576,864))(B(3,3,3,12,3))其中 (C) 表示各 stage 的通道数(B) 表示 block 数量论文要求包含 PointROPE 的 stage 中通道数 (C) 可以被 6 整除。真正值得注意的是作者后续大部分实验使用的并不是最大的 LitePT-L而是最小的 LitePT-S。三、核心设计为什么“前三层卷积、后两层 Attention”是甜点区有了“浅层卷积、深层 Attention”的原则之后下一个问题自然是到底从哪一层开始切换3.1 Figure 6先连续删 Attention再连续删卷积论文 Figure 6Performance-Efficiency Trade-off作者在 nuScenes 上做了两组实验。第一组从最浅层开始逐步删除 Attention。结果是删除浅层 Attention延迟显著降低mIoU 基本不受影响直到开始删除较深层 Attention性能才明显下降。第二组则从最深层开始删除卷积。结果恰好相反删除深层卷积参数量大幅下降mIoU 几乎不变但继续删除浅层卷积之后性能开始明显恶化。这实际上把前面的猜想变成了实验结论浅层 Attention 是“计算冗余”深层卷积则是“参数冗余”。3.2 Table 3(Lc3) 是最佳折中点Table 3 系统比较了不同切换位置全 Attention11.8M35.1 ms82.1 mIoUC-A-A-A-A11.9M30.4 ms81.7C-C-A-A-A12.0M25.8 ms82.0C-C-C-A-A12.7M21.5 ms82.2C-C-C-C-A18.8M16.2 ms80.9全卷积26.9M13.5 ms75.4因此论文最终选择Lc3也就是前三个 stage 使用卷积后两个 stage 使用 Attention。这里还有一个细节。作者也尝试了所谓的hand-over stage即某个过渡 stage 同时使用卷积和 Attention。例如 C-C-C-X-A 可以达到 82.4 mIoU比默认的 82.2 略高但参数量从 12.7M 上升至 23.4M延迟也从 21.5 ms 上升到 24.9 ms。所以作者追求的并不是单纯把 mIoU 做到最高而是性能、参数与速度的综合折中。3.3 Table 4Decoder 是否也要这么设计LitePT 提供了两个 DecoderLitePT-S极简 Decoder只保留线性投影LitePT-S*Decoder 也按照 Encoder 的方式使用卷积与 Attention。结果很有任务差异。在语义分割上ScanNet76.5 vs 76.8Structured3D83.7 vs 83.0nuScenes82.2 vs 81.8Waymo73.1 vs 72.7总体而言简单 Decoder 已经足够。但在 ScanNet 实例分割上LitePT-S62.2 mAP50LitePT-S*64.9 mAP50因此对于实例级任务更重的 Decoder 明显更有价值。这组实验说明了一件很重要的事LitePT 并不是机械地追求“越简单越好”而是让算力出现在真正有用的位置。四、PointROPE删掉深层卷积之后位置从哪里来只删除深层 SparseConv 会遇到一个直接问题原来的卷积不仅提取特征还承担了位置编码。如果直接变成纯 Attention空间布局信息怎么办这就是 PointROPE 出现的原因。4.1 从 1D RoPE 到 3D PointROPERoPE 最初针对一维序列。但一个 3D 点的位置是因此作者首先把点特征沿通道维均分成三个子空间分别对应 (x,y,z) 三个空间轴。接下来分别使用对应的坐标执行 1D RoPE最后再把三个方向编码后的特征重新拼接起来。这里可以把 PointROPE 理解得非常简单原本 RoPE 用一个序列位置控制特征旋转PointROPE 则让 x、y、z 三个坐标分别控制对应的一部分特征旋转。这样就可以在不重新引入深层卷积的情况下把空间位置信息注入 Attention。更关键的是PointROPE 没有可学习参数。这正好解决了 LitePT 的核心矛盾——作者想删除深层卷积来降低参数量却又不能因此丢掉位置编码。4.2 Table 6PointROPE 不是“可有可无”作者在 nuScenes 上直接去掉 PointROPE无 PointROPE79.6 mIoU(b10)81.7(b100)82.2(b1000)81.8(b10000)81.3也就是说完全去掉 PointROPE 会造成2.6 个百分点 mIoU 的下降。而不同 base frequency 下结果变化不算大因此 PointROPE 对频率参数具有一定鲁棒性论文最终统一使用 (b100)。所以 PointROPE 的作用非常明确它不是为了给模型额外增加容量而是用几乎零参数成本补回“删掉卷积后失去的空间位置编码”。五、实验结果与消融分析LitePT 到底轻了多少又强在哪里论文的实验覆盖三类典型 3D 任务语义分割实例分割3D 目标检测。同时还专门测试了效率、模型缩放、少数据训练和多个设计消融。5.1 Table 2最直接的效率对比效率实验在完整 ScanNet 数据集上使用单张 RTX 4090 测试训练启用 AMP推理关闭 AMP。最值得比较的是 PTv3 与 LitePT-S模型参数量训练延迟训练显存推理延迟推理显存PTv346.1M110 ms5.8 G51 ms4.1 GLitePT-S12.7M72 ms2.3 G21 ms2.0 G这意味着 LitePT-S参数从 46.1M 降到 12.7M约为3.6× 更少训练显存降低约60.3%推理显存降低约51.2%训练延迟降低约34.5%推理延迟降低约58.8%。论文 Figure 1LitePT 效率与性能总览Figure 1 左侧把参数、延迟和显存放在一起比较右侧则展示多个任务上的性能。最重要的不是 LitePT 只在某一个指标上更优而是它把效率提升和任务性能放在了一起。5.2 Table 5省下来的参数还能重新用于 ScalingLitePT 因为移除了大量深层卷积参数因此作者进一步问如果把省下来的容量重新拿来扩大网络会怎样Structured3D 上模型参数量延迟显存mIoUPTv346.1M57 ms5.83 G82.4LitePT-S12.7M23 ms2.56 G83.6LitePT-B45.1M36 ms2.60 G85.1LitePT-L85.9M44 ms3.58 G85.4最有意思的是 LitePT-L。它已经有85.9M 参数接近 PTv3 的两倍但延迟仍然只有 44 ms而 PTv3 是 57 ms显存 3.58 G而 PTv3 是 5.83 GmIoU 从 82.4 提升到 85.4。这说明 LitePT 的优势不仅仅来自“做小模型”而是来自更合理的计算结构。5.3 Table 7室外语义分割——nuScenes 与 Waymo 都提升 1.8 mIoUnuScenesPTv380.4 mIoULitePT-S82.2 mIoUWaymoPTv371.3LitePT-S73.1两个数据集恰好都是1.8 mIoU。这点很重要因为室外车载 LiDAR 点云存在明显的距离密度变化、扫描线结构、反射以及掉点问题不是只在规则的室内 RGB-D 点云上有效。论文也特别强调了这类室外点云的挑战。5.4 Table 8ScanNet 上不是“全面第一”但少数据场景很有意思完整 ScanNet 上PTv377.5LitePT-S76.5LitePT-S*76.8因此这里需要明确LitePT 在完整监督 ScanNet 上并没有超过 PTv3。但在训练数据受限的情况下结果发生变化。例如只使用 5% 场景PTv348.9LitePT-S50.6LitePT-S*51.6仅使用每个场景 20 个标注点PTv360.1LitePT-S62.5LitePT-S*63.2到了每场景 200 个标注点PTv372.7LitePT-S*74.2。因此更加准确的结论应该是LitePT 在 ScanNet 全量监督条件下与 PTv3 接近在数据受限场景下则往往更占优势。5.5 Table 9Structured3DStructured3D 验证集PTv382.4 mIoULitePT-S83.6测试集PTv382.1LitePT-S82.4。Structured3D 拥有 18,348 个训练场景比 ScanNet 大得多因此这个实验也说明 LitePT 在更大规模的室内语义分割数据上能够稳定发挥。5.6 Table 10实例分割——ScanNet 上提升明显ScanNet200 上接近 PTv3实例分割使用 PointGroup 作为统一的 segmentation head。ScanNetPTv361.7 mAP50LitePT-S*64.9 mAP50提升3.2 个百分点。同时总 mAPPTv340.9LitePT-S*41.7。但是在更长尾的 ScanNet200 上PTv333.2 mAP50 / 23.1 mAPLitePT33.1 mAP50 / 22.2 mAP因此论文的结果更适合表述为ScanNet 上取得明显优势ScanNet200 上与 PTv3 基本相当而不是所有指标全面领先。5.7 Table 11Waymo 3D 检测Waymo 单帧检测中PTv3 Mean L2 mAPH70.5LitePT70.7分类型看VehicleLitePT 更高PedestrianPTv3 略高CyclistLitePT 更高。因此 LitePT 在三类目标中有两类领先并取得最高总体 Mean L2 mAPH。这再次说明 LitePT 的优势并不限于 Semantic Segmentation它作为 backbone 可以迁移到 Instance Segmentation 和 Detection。5.8 把所有消融结果串起来看到这里Table 1–6 实际上形成了一条非常完整的设计证据链Table 1卷积并不只是位置编码它对局部几何提取很重要。Figure 3 Figure 4浅层主要处理几何深层逐渐形成语义Attention 在浅层计算昂贵而卷积在深层参数昂贵。Figure 6 Table 3因此浅层删 Attention、深层删卷积是合理的(L_c3) 是性能与效率的最佳折中。Table 4Decoder 是否进一步简化与任务有关语义分割适合极简 Decoder实例分割则更受益于较强 Decoder。Table 5结构优化带来的容量节省还能用于模型 Scaling。Table 6去掉深层卷积之后确实需要新的位置编码而 PointROPE 可以以无可学习参数的方式完成这件事。这也是这篇论文比较完整的地方不是先设计一个网络再用消融证明它有效而是先拆 PTv3 找到问题再由分析推出结构最后逐步验证每一个设计选择。六、总结与思考LitePT 真正值得记住的不是“又一个轻量模型”如果把整篇论文压缩成一句话点云层次网络不同深度面对的问题不同因此没有必要在所有层重复使用相同的卷积 Attention 组合。LitePT 最值得记住的三个点是6.1 第一算子应该按照网络层次分工浅层点多分辨率高以局部几何为主卷积的局部归纳偏置已经足够。深层token 数量明显减少特征语义程度越来越高长距离关系更加重要此时 Attention 更值得使用。作者最终把这个原则总结成Convolutions for low-level geometry, attention for high-level relations.论文结论再次强调LitePT 的关键就是只在每个层次保留真正需要的操作从而避免不必要的计算。6.2 第二“轻量化”不一定意味着做一个更弱的小模型LitePT-S 的参数只有 12.7M但性能已经可以与 46.1M 的 PTv3 竞争。更有意思的是 LitePT-L即使把参数扩大到 85.9M它仍然比 PTv3 更快、显存占用更低。所以这篇论文实际上说明真正影响效率的不只是参数量而是这些参数和计算被放在了网络的什么位置。6.3 第三PointROPE 是结构简化能够成立的重要补丁如果只是简单地说“深层卷积没必要删掉就行”整个方案并不完整。因为 PTv3 的卷积还承担了位置编码。LitePT 用无参数的 PointROPE 把这一职责独立出来之后才真正能够让深层 Attention 脱离卷积单独存在。这实际上是一种很典型的网络重构思路先区分一个模块到底承担了哪些功能再删除其中昂贵但不必要的部分并用更轻的机制补回真正不能丢失的功能。6.4 一个很值得继续研究的方向作者在 Discussion 中还提出了一个有意思的后续方向。LitePT 已经只在网络后期使用 Attention而到了这些层token 数量已经很少。因此未来甚至可能不再使用局部 Attention而是直接在所有剩余 token 上计算 Global Self-Attention。这样一方面可能进一步增强长距离上下文建模另一方面还可以去掉局部分组操作从而进一步降低推理开销。从架构设计角度看LitePT 给出的启发可能比具体的网络结构本身更重要不要默认一个效果不错的 block 就应该从头复制到尾。对于层次网络更值得问的是网络在这一层到底正在解决什么问题当前这个算子真的有必要吗如果有必要它真正不可替代的功能又是什么LitePT 的答案非常简单浅层让卷积做它擅长的局部几何深层再让 Attention 做它擅长的语义关系。而往往就是这种看似简单的重新分工才真正带来了“Lighter Yet Stronger”。