2D去噪范式在真实3D遮挡前失效,破局关键在于将物理机制转化为结构先验。 作者丨张璐 编辑丨岑峰 大模型在文本与 2D 图像上的狂飙,归功于互联网上近乎无穷的干净数据。但当 AI 试图跨越屏幕、理解真实的 3D 物理世界时,这套经验法则瞬间失效。 真实扫描数据充斥着噪点与死角,物理遮挡造成的几何缺失既非随机发生,更无法用简单的去噪算法抹平。面对这一死结,多数团队选择用人工合成数据去“硬碰硬”,却始终难以跨越虚实结合的鸿沟。 在 ECCV 现场,慕尼黑工业大学(TUM)Angela Dai 教授展示了一套逆转行业思路的解法:不必强行克服数据的“不完整”,把真实的物理遮挡机制,直接变成算法的结构先验。 这项研究不仅打破了 3D 场景重建中困扰已久的“均值模糊”魔咒,更清晰地标定了空间智能(Spatial AI)从“静态 3D 拼图”走向“原生具身大脑”的技术演进路线。整套破局逻辑由三个层层递进的技术支柱构成: 第一,将物理遮挡转化为逆向自监督(SG-NN)。团队先是将传感器的视野拆解为已知空域、已观测表面与未知盲区的三状态编码。团队摒弃对盲区的盲目强行预测,通过故意扣除观测帧构建训练对,用掩码损失(Mask Loss)让物理遮挡本身成为最天然的自监督标靶。 第二,用“几何骨架 + 2D 渲染”破解均值模糊(Seen2Scene)。面对大面积盲区带来的严重歧义,引入可见性引导的流匹配(Seen2Scene)与 3D 高斯溅射(WorldMesh)。由稳定几何提供不漂移、不坍塌的“骨架”,再借由 2D 图像先验反哺高保真“皮肉”,首次将连贯生成的尺度拉伸到了七八个房间的环境级空间。 第三,从生成反哺重构,走向机器人的“主动感知”(GenRecon):将合成场景学到的结构先验反向注入真实重构(GenRecon),更顺理成章地将物理可见性推演至具身智能领域。让 AI 不再是被动接收残缺图像的画师,而是能够预判未观测空间、自主规划最佳探路路径的空间智能体。 以下为演讲全文,雷峰网AI科技评论在不改变原意的基础上,对内容进行了整理与编辑: 01 数据天然“残缺”:为什么 2D 扩散范式 在 3D 空间彻底失效? 文本和图像生成的爆发,本质上建立在互联网海量公开数据的红利之上。无论是能侃侃而谈的大语言模型,还是瞬间绘图的生成算法,背后都有庞大的文本文献、艺术作品和照片库作为支撑。 然而,当人工智能尝试踏入物理空间去生成 3D 场景时,这种基于海量数据的经验法则迅速失效了。 现实环境不仅杂乱且充斥着传感器噪声,更难以克服的是物体相互遮挡带来的视角盲区。 这种遮挡造成的几何缺失既非随机产生,也不符合常规的统计分布,导致在 2D 领域大获成功的“加噪-去噪”扩散范式无法直接套用。 如果退而求其次使用人工构建的合成场景,模型虽然能获得完整的几何结构,却又会因为缺失现实生活的随机布局与复杂杂乱感,陷入“合成与现实”之间难以跨越的鸿沟。 在最新的研讨会分享中,她给出了一个兼具工程美感与物理直觉的解法:不再强行克服数据的“不完整”,而是直接引入空间本身的物理原则,让 AI 学会利用已知的空无与遮挡关系,主动在残缺的观测中推演完整的现实。 02 把遮挡变先验: 用“已知空无”推演未知的物理结构 要打破 3D 数据采集的天然缺陷,首要突破在于将物理相机的观测机制转化为算法能理解的几何先验。 当深度传感器观测一个场景时,它不仅捕捉到了物体的表面,还隐性地界定出了三类空间状态:在传感器与表面之间,是确定的已知空域;表面本身是已观测几何;而被表面遮挡的后方,则是状态未知的未观测区域。 这种天然的空间划分构成了自监督训练的核心依据。传统模型试图对全局每一个点进行强行预测,往往会导致盲目填补未观测盲区。 Angela 教授团队提出了一套逆向自监督公式,从多帧融合的场景扫描中故意移除部分观测帧,构建出“更残缺的输入”与“相对完整的标靶”组成的训练对。 在训练过程中,损失函数会通过掩码显式地忽略所有未观测的未知空间,仅仅针对已被人工制造出的缺陷区域施加监督。 网络在第一层将场景编码为稀疏 TSDF 体素,并借助稀疏卷积仅在有表面的区域进行高效计算。在空间压缩的瓶颈层,模型开始预测需要衍生出新几何的具体位置,随着分辨率层级的逐步倍增,实时识别并丢弃为空的区域,最终输出紧凑且完整的几何结构。 这种针对多类不完整模式训练出的模型,不仅能恢复被遮挡的角落,甚至能生成比原始采集目标更加完整的 3D 场景。 不过,单纯依靠回归损失的解法依然存在瓶颈。在缺失区域较小、周围语义明确时,回归模型表现优异;但面对大面积的物理盲区,传统损失往往会陷入均值收敛的魔咒,导致预测出的几何变成模棱两可的模糊块状或干脆留空。 要解决这种深度歧义,就必须从确定性回归走向具备概率建模能力的生成式范式。 03 别长距离漂移: 基于几何骨架与 3DGS 的全景长图渲染 为了解决大面积几何缺失带来的歧义,生成式扩散模型被引入到了 3D 场景重建中。 团队在基于激光传感器的 ScanNet++ 数据集上进行训练,将可见性原则彻底融进 token 的序列化表达里。 模型将已知表面、已知空域和未知体素分别映射为潜在编码,并允许引入场景布局、文本提示乃至由大语言模型生成的边界框作为先验条件。 这种以局部小区域(例如 1.5×2 米)为单位的切片计算方式,使得模型不仅能在像浴室马桶缺失这样的复杂盲区合理推演并补全结构,更能无缝平移扩展到任意尺寸的空间。 在获得了高质量的几何“骨架”之后,场景的外观“皮肉”合成展现出了更高的自由度。 虽然单纯依赖大语言模型安排布局容易显得僵硬人工,但成熟的 2D 图像生成模型却天然具备生成逼真且富含生活杂乱感画面的能力。 算法先生成基础几何,随后借助图像模型跨视角采样并合成具有丰富纹理的图像,再将这些像素反向提取回网格。最终,整个场景由 3D 高斯(3DGS)技术进行全局优化,并利用基础网格进行几何正则化,从而在稀疏视角的输入下依然能保持极高的画面质量与视角一致性。 这种由几何底层提供稳定支撑的生成路线,一举解决了传统全景生成方法在离开中心视角后容易出现画面漂移和坍塌的难题。 借助这一框架,模型甚至可以跨越七到八个房间的连贯空间,无论是充满现实细节的大型室内环境,还是富有奇幻色彩的抽象场景,都能实现长距离、高一致性的稳定渲染。 04 终局形态:从原生 3D 统一大模型 到机器人的“主动感知” 除了在真实数据上利用掩码进行自监督学习,另一种互补的思路是逆向利用合成数据的结构优势。 通过在 SAGE 这种干净且完整的合成场景数据集上训练生成模型,算法能够先一步学会在局部输入下生成完整结构的通用几何先验,随后再将这种先验反向迁移应用至现实世界。 算法将多视角图像、相机参数以及稀疏点云统一投影到全局空间进行聚合,即使现实中的书架或杂物超出了合成数据的分布范围,模型依然能凭借强大的通用先验填补扫描盲区,还原出清晰完整的物理结构。 站在更长远的视角来看,空间 AI 的终局在于几何、外观与语义的深度融合。 当前行业普遍将这三者割裂处理,甚至只是把 2D 视觉模型的语义特征简单叠加到 3D 表达之上。 真正高效的范式应当是建立原生的 3D 统一大模型,因为在明确知道要生成一张椅子时,几何结构的构建本身就会变得更加容易。 不仅如此,物理可见性原则还将推演至机器人的主动探索领域。 当 AI 不再是被动接收人类拍到的残缺图像,而是能够主动预测未观测区域的面貌时,它就能自主决定下一个最佳观测位置,从而以最优路径完成复杂空间内的感知与任务交接。 05 现场 Q&A:技术边界与落地现实 在 Q&A 环节中,Angela 教授明确指出了当前 3D 生成落地的两大现实边界:一是扩散生成模型繁复采样带来的高延迟问题,二是复杂场景下精度与速度的平衡。这预示着轻量化稀疏体素与局部包围盒(Bounding Box)优化将是工业级部署的关键。 ▎Q:三平面(Triplane)表达机制是否存在无法生成高保真 3D 的天然缺陷? A: 模型难以生成极细粒度结构的核心瓶颈在于分辨率上限,而非三平面生成先验本身的逻辑缺陷。在室内合成数据集上训练的三平面生成器拥有足够大的数据吞吐量,能够处理绝大多数场景物件。只要训练数据与目标环境分布保持相似,且相机位姿处于合理精度范围内,从合成空间迁移到真实环境完全可行。 ▎Q:这套生成与重建框架在实际运行时的速度表现如何?能否做到实时生成? A: 目前展示的模型未经专门的速度优化,需要根据具体应用场景在精度与速度之间做出权衡。基于稀疏体素的回归模型在前向传播时计算极快,足以满足绝大多数实时性需求;但具备高拟真度的扩散生成模型由于采样过程繁复,目前尚难以做到实时运行。尽管通过将庞大场景切分为局部小盒(Local Bounding Box)能够有效控制计算负载,但要想在数秒内即时重构出超大范围的复杂真实空间,仍有待在扩散采样与渲染架构上实现进一步的工程加速。 为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」? 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。 现场后援团:(会议期间专属开启):到了会场也不用慌—— 路线导航:场馆分布、报告厅怎么走,群里随时问; 议题共读:热门 session、Keynote 现场探讨,错过也能追; Poster 汇编:现场海报精华整理,一键收藏不遗漏; 约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。 ? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。 搞科研/搞技术,信息差很重要。 来,一起快人一步! 上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈 扫描上方二维码 或点击「阅读原文」关注专区。