科研动态
首页 >> 科学研究 >> 科研动态 >> 正文
计算机学院(软件学院)论文被计算机视觉国际顶级会议ECCV录用
来源:     点击量:


近日,计算机学院(软件学院)论文《Point Diffusion Mamba: Unified Diffusion-State-Space Modeling for Single-View 3D Reconstruction under Data Scarcity》被计算机视觉领域国际顶级学术会议ECCV 2026正式录用。

会议介绍

ECCVEuropean Conference on Computer Vision,欧洲计算机视觉国际会议)由欧洲计算机视觉协会主办,创办于1990年,每两年举办一届,与CVPRICCV共同构成计算机视觉领域公认的三大顶级学术会议。会议议题涵盖三维视觉、图像与视频理解、生成模型、多模态学习等众多前沿方向,每届吸引全球数千篇投稿,评审严格、录用竞争激烈,其录用成果在很大程度上反映了计算机视觉与人工智能领域的最新研究动态和未来发展方向,在学术界与工业界均具有广泛而深远的影响力。

论文信息

“Point Diffusion Mamba: Unified Diffusion-State-Space Modeling for Single-View 3D Reconstruction under Data Scarcity”Point Diffusion Mamba:面向数据稀缺场景单视图三维重建统一扩散-状态空间建模方法)。

作者:Wei Zhou+, Xinzhe Shi+, Xingxing Hao, Xing Hao*, Kang Li*, Jinye Peng, Ying He计算机学院周伟为第一作者,郝星和李康为论文通讯作者。

代码已开源:https://github.com/NWUzhouwei/PDM

论文介绍

单视图三维重建旨在从一张二维图像中恢复物体完整的三维结构。由于单张图像所能提供的深度与几何线索极为有限,该任务本质上是一个高度病态的问题。近年来,扩散模型凭借强大的生成能力被引入这一任务并取得了显著进展,然而现有基于扩散的三维重建方法仍面临明显瓶颈:基于MLP的架构难以刻画复杂几何结构;基于3D卷积的架构计算复杂度高达O(n³),显存开销巨大且难以捕获全局上下文;基于Transformer的架构虽然生成能力出色,但注意力机制O(n²)的复杂度使其在处理长点云序列时内存代价难以承受。与此同时,真实场景中高质量2D-3D配对数据的获取成本极高,数据稀缺条件下的单视图重建长期缺乏有效的解决方案。状态空间模型(Mamba)虽以线性复杂度在长序列建模中展现出巨大潜力,但点云固有的无序性使其难以建立稳定的空间关联,且其提取的高层特征偏向抽象语义,与扩散去噪所要求的逐点精确预测之间存在天然鸿沟。

针对上述问题,本文提出了一种将扩散模型与状态空间模型深度融合的单视图三维重建框架PDMPoint Diffusion Mamba)。该方法首先利用预训练视觉编码器提取输入图像特征,并通过光栅化投影将其映射到噪声点云上作为条件信息,随后经最远点采样与K近邻聚合,将无序点云组织为结构化的点云块。在网络设计上,PDM通过局部几何聚合模块(LGA)中K-NormK-Pool的协同运算,显式增强模型对局部几何细节的提取能力;进而借助融合时间步条件的双向状态空间模块(DDSM),以线性复杂度建模点云的全局结构,有效克服点云无序性带来的伪序列依赖。针对Mamba高层特征难以直接支撑逐点预测的问题,本文进一步设计了层次化特征融合网络(HFINet),通过点特征传播机制将高层全局语义特征传播至每一个点,并与局部几何特征逐点融合,从而实现精确的噪声预测。此外,本文还提出动态加权采样策略(DWS),在去噪采样过程中依据生成模型与重建模型输出的逐点一致性自适应地融合二者,借助生成先验有效缓解了标注数据不足导致的重建质量退化。

 

1 PDM整体框架图

实验结果表明,PDM在合成数据集ShapeNet与真实数据集Pix3D上均取得了领先性能。在仅使用10%训练数据的严苛设定下,PDM的优势尤为突出:在Chair类别上,其Chamfer距离(CD)达到82.41,较次优方法CCD-3DR89.79)降低约9%,较MESC-3D101.51)降低约23%,同时取得最高的F1分数;在AirplaneCD 60.64 vs. 74.31)与Car类别上同样全面领先。随着数据量增加至50%100%PDM依然保持稳定的竞争力,在Airplane全部指标与Car 100%设定下均取得最佳结果。在真实场景Pix3D数据集上,PDMChair类别的CD误差降至79.28,较次优方法MESC-3D91.36)降低约15%。在效率方面,PDM单次推理仅需20.73秒、显存占用低至0.39GB,相较MESC-3D34.05/0.86GB)显存减半,推理速度较BDM提升近3倍。消融实验进一步验证了LGAHFINet、双向状态空间建模以及DWS策略各自不可或缺的作用。该工作为数据稀缺条件下的单视图三维重建提供了一种高效、鲁棒且显存友好的新范式。

 

2 ShapeNet数据集上不同训练数据比例下与SOTA方法的性能对比