3DGS:近30天全景(7.6–8.5)
2026-08-05 04:02 UTC
亮点
- 3D 高斯泼溅正巩固其作为机器人与实时 SLAM 领域统一空间表示的地位,通过联合编码度量几何精度与语义基础,逐步取代点云与体素网格。
- 前馈式 3D 高斯方法收敛于视图条件自适应表示,在消除逐场景优化延迟的同时逼近其重建质量。
- 面向不确定性与损坏鲁棒的重建成为一条独立研究脉络,专门应对 3DGS 无法检测无支撑几何、烘焙伪影与不可靠融合等静默失败的问题。
- 动态场景重建仍在形变网络、专家混合与整体前馈方法之间分歧明显,在保真度、灵活性与效率的权衡上尚无共识。
- 临床 3DGS 获得关注并非凭借照片级真实感,而是通过嵌入通用方法所忽略的领域特定物理约束——如 MRI 采集物理与组织形变模型。
近期研究将 3D 高斯泼溅(3DGS)确立为横跨机器人与实时 SLAM 的统一空间表示。 这一趋势伴随两条界定基准性能与真实部署前沿的路径:前馈泛化与不确定性感知重建。 本综述各章节追踪这些进展,首先从前馈方法切入——它们自适应分配表示以媲美逐场景优化; 随后展示 3DGS 在具身智能中取代传统基元、动态场景中的策略分歧,以及 SLAM 中反直觉地转向剥离外观的几何表示。 对近期趋势的一种解读是:自动驾驶的重心从制图转向安全仿真; 临床应用则因嵌入领域物理而成功,而非追求真实感。 专门章节讨论不确定性量化与损坏鲁棒这一新兴脉络,识别出常规 3DGS 无法发现的静默失败模式。 综述以简短评述收尾——涵盖渐进式工程收益、不断扩展的应用管道与理论辐射——共同印证该表示正走向生产可用。
前馈 3DGS 向视图条件自适应表征收敛
前馈 3D 空间高斯泼溅范式最初继承了像素对齐预测,这种做法将高斯原语的数量与图像分辨率绑定,而非场景复杂度。 预印本 ATSplat 1 直接针对这一根本性低效问题,用稀疏的 3D 锚点标记取代原有范式,并根据重建难度自适应扩展,将容量从简单、冗余区域转移到分配不足区域。 这种自适应分配构成了摆脱固定、分辨率绑定表征的一个方向。 另一个互补方向出现在同为预印本的 UniqueSplat 2 中,其高斯预测结合目标视图查询动态定制,而非为场景的所有新视图生成一组固定原语; 该工作被称为对像素对齐范式 23, 64 偏离最远的研究。 这两篇预印本共同表明,表征正在向同时适配局部内容与观看条件的方向收敛,果断超越了刚性、分辨率锁定的分配方式。
与此同时,前馈泛化方面的进展正在弥合与逐场景优化方法之间的质量差距,同时完全消除了后者的延迟。 HyperGS 3(预印本)提出一种前馈超网络,在单次前向传播中即可预测视频的显式 2D 高斯图元,彻底免除了逐视频优化,并将 PSNR 提升 +2.9–3。 WildSplat 4 将前馈 3DGS 扩展到无位姿的野外图像,通过显式解耦几何与外观,动摇了限制早期前馈方法的光度一致性假设; 这种解耦使其能够在变化的照明、天气和曝光条件下运行,无需逐场景调优。 对于长序列而言,累积的位姿漂移仍是一大瓶颈; NoDrift3R 5(预印本)识别出这一故障,并提出光线图引导耦合模块,建立起双向“渲染到几何增益”闭环,密集地绑定几何与外观,从而实现抗漂移的无位姿前馈重建。 综合来看,这些进展——自适应分配、视角条件预测、单次视频合成、外观无关的几何重建以及漂移抑制——表明前馈 3DGS 正在系统性地摆脱对固定、逐场景优化范式的依赖,逐步逼近优化方法的保真度,却毫无其延迟。
三维高斯原语正在取代具身智能中的传统表示
对能够稳健操控物体并在复杂环境中导航的具身智能系统的需求不断增长,正推动人们重新审视支撑这些能力的空间表示方法。 在本阶段的研究中,可以明显观察到向三维高斯原语的转向,因其恰好提供了一条路径,能将度量几何精度与语义及外观信息统一起来,而点云和体素网格则难以在单一结构中同时封装这些信息。
GeoMoLa 6 这项预印本方法凸显了显式几何推理的基础重要性,它通过学习预测三维点云如何演变来获取操控的运动隐变量。 GeoMoLa 6 通过直接编码物理时空几何表明,将运动基元建立在四维变换之上可以带来稳健的泛化能力,这正凸显了纯二维或静态三维方法所忽略的需求。 然而,GeoMoLa 6 的点云表示主要编码几何变换,来自 RGB-D 观测的视觉和语义信息由一个独立的视觉-语言编码器处理,并未内在地融合到空间原语中。
采用基于三维高斯泼溅表示的工作明确填补了这一缺口。 MANGO-Grasp 7 引入了一种各向异性交互框架,用于跨具身灵巧抓取,其中物体被建模为面向几何的三维高斯原语,从而降低了在不同硬件上部署时对手部进行单独工程改造的成本。 这将高斯原语定位为不仅是渲染构件,更是操控策略的实用几何基底。 在纯几何的基础上更进一步,VistaVLA 8 直接从三维高斯原语构建几何与语义感知的三维认知表示,为视觉-语言-动作策略提供场景根基。 从该预印本的摘要 8,这种显式的场景接地解决了困扰视觉-语言-动作模型的视角敏感性问题,将空间布局与语义上下文统一于单一表示中——这恰恰是点云或体素网格单独无法提供的协同作用。
在导航训练环境领域,SONG 9 基于 3D 高斯泼溅搭建了一个社交导航模拟器,同时支持静态场景和动态人体化身,并将 3DGS 作为渲染基底,提供传统模拟器所欠缺的照片级真实感。 这进一步巩固了高斯表征在具身 AI 训练中的空间主干地位,因为在这类训练中,度量精度和视觉真实感缺一不可。 然而,场景生成端仍然借助其他紧凑的基元。 ABot-3DWorld 0 10 通过“空间生成基元”——一个由全景图和空间点云构成的元组——将文本、图像和视频输入统一为可探索的 3D 世界。 虽然这种基于点云的方法降低了环境生成的门槛,但它与高斯框架所实现的语义落地存在分隔,这揭示了一种实际分歧:点云在世界生成方面依然可用,但在操控和社交导航核心的交互推理任务上,3D 高斯将几何与外观集成为一体的建模方式正变得至关重要。
将 3D 结构嵌入学习策略并非必须通过高斯表征,但 SAM3D-VLA 11 这一预印本也呼应了其重要性:它在训练时利用冻结的 SAM3D 教师模型对齐以对象为中心的 3D 表征,推理时则丢弃 3D 模型,以维持纯 RGB-语言到动作的管道。 这种在训练阶段注入 3D 监督的做法表明,人们越来越普遍地认识到,纯粹基于 2D 或抽象 token 的视觉语言行动模型能从显式的空间落地中获益——VistaVLA 8 正是通过高斯落脚的场景 token 直接满足了这一需求。 这些工作共同勾勒出一条轨迹:点云证明了几何信息对操控的价值 6,而 3D 高斯基元正越来越多地被用作一种表征,能够将精确的空间信息与稳健、可部署的具身 AI 所需的语义忠实度和视觉保真度融为一体 10,26,46。
动态3DGS在变形网络与整体前馈重建之间的分化
对于动态场景的高斯泼溅方法之所以难以形成共识,根本原因在于目标场景本身极具挑战性。 Deform360数据集涵盖198个日常物体、1980段交互序列以及超过215小时的多视角视触觉记录,充分说明了任何时序建模方法都必须面对的可变形物体动态的庞大规模 12(arXiv预印本; 同行评审状态未知)。 面对这一挑战,研究群体已分化为三种截然不同的建模思路,其中尚无一派建立起明确优势。
逐高斯核的变形网络仍是一种主流策略,但其内部优化障碍不容忽视。 GrainGS发现了一个基础的梯度纠缠问题:变形梯度会经由共享通路扰动规范几何,为此它提出一种层级化锚点骨架来解耦这些更新,进而稳定重建过程 13(arXiv预印本)。 AdaAnchor4D将基于变形的建模扩展至单目无人机城市场景,在此类场景中,固定的特征聚合规则在异质局部动态下失效,导致鬼影与模糊; 该方法通过自适应、以锚点为条件的时空聚合来应对这种异质性 14(arXiv预印本)。 两项工作都对变形网络范式做了改进,却同样暴露了其固有的脆弱性:该流程必须小心地平衡规范目标与变形目标,且聚合规则需要针对特定场景的动态进行调整。
另一种思路不是统一表示,而是分解变形问题。 MoDE与MoE‑GS框架引入了一种混合专家方法,在共享的规范表示上联合优化多个变形专家,从而让不同空间区域内的运动由专门的子网络分别处理,而非依赖单一的整块模型 15(arXiv预印本; 仅摘要)。 这种分解方式为复杂的多物体动态提供了更大灵活性,但也带来了专家间协调的额外开销,而这是更简单的变形网络所不存在的。
与此形成鲜明对比的是,前馈方法完全绕开了变形网络。 GUSH3R 表明,通过单目前向传递即可从单目视频中实现逼真、可渲染的动态人体‑场景重建,将动态人体与静态场景统一为高斯基元,无需任何逐场景优化 16(arXiv 预印本)。 这种整体重建以优化类方法逐场景的保真度为代价,换取了即时推理效率,一举避开了梯度纠缠与异构性难题。
实际观测限制让局面更加复杂。 FillGS 通过主动选择虚拟时空视角并施加生成式精化,来应对 4D 高斯泼溅中的稀疏视角覆盖问题,这种观测驱动的修复机制与底层模型是否使用变形网络、混合专家或前馈重建无关 17(arXiv 预印本; 仅有摘要)。 它的出现表明,数据稀疏性仍是所有策略共有的瓶颈。
这些工作共同呈现出一个尚无定论的分裂领域:变形网络以架构脆弱为代价追求高保真度; 混合专家在增加灵活性的同时引入了分解复杂性; 前馈重建则优先考虑速度与泛化性,可能牺牲优化所能恢复的细节。 Deform360 基准 12 是共同的评价场地,但至今仍无单一时序建模范式能够在它所涵盖的多样可变形物体交互中持续占优。
实时 3DGS SLAM 剥离外观以提升鲁棒性
该时期基于 3DGS 的 SLAM 研究明确地偏离了照片级真实感保真度,转向精简的、以几何为中心的表示,优先考虑收敛速度、效率和鲁棒性。 GeoGS-SLAM 将这一趋势具体化:它完全舍弃球谐函数,仅保留空间参数——位置、旋转、尺度和不透明度——从而将每个基元的参数削减了 80% 以上 18。 在直接对比中,这种纯几何变体收敛更快,仅使用约 2.8 万个基元,而基线方法需要 10.7 万至 19.8 万个,同时对依赖外观的模型会造成困扰的光照变化表现出显著增强的鲁棒性 18。 这种对视线方向依赖的色彩信息的有意牺牲,挑战了“更丰富的场景表示能带来更好 SLAM 结果”的假设,转而强调导航、避障等下游任务首先依赖于准确的空间结构 18。
一种类似的务实理念驱动着 Stipple,它将 Basalt 视觉惯性跟踪器与一个不绑定特定硬件厂商、基于 Rust 实现的 3DGS 模块相结合,能够在没有 CUDA 锁定的情况下,通过立体图像和 IMU 数据进行实时增量重建 19。 虽然 Stipple 并未显式剥离颜色外观,但它抛弃了标准 3DGS 通常依赖的繁重运动恢复结构预处理和批量训练,换成一个流式管线,直接消费视觉惯性里程计的输出——位姿、关键帧、回环闭合 19。 通过让照片级真实感的稠密重建能在低功耗、非 CUDA 设备上变得可行,该系统降低了对计算密集型外观优化的依赖,更强调几何一致性和增量更新速度 19。
GLAM-SLAM 将这一理念扩展至大型室外环境,引入了一个流引导的稠密化模块,用以弥合稀疏 ORB-SLAM2 特征点与 3DGS 所需稠密初始化之间的密度鸿沟,目标是为大规模室外场景和长时序场景实现实时单目高斯溅射 SLAM 20。 在这里,系统的解耦设计保证了稳健的跟踪和准确几何,以实现可靠建图,同时并行的 3DGS 模块仍然能在不损害实时性能的情况下生成照片级真实的稠密地图 20。
简约化的逻辑不止于高斯表示,也延伸到更广泛的 SLAM 估计堆栈。 一种最小化学习的双目视觉-惯性里程计框架仅通过 SEA-RAFT 将学习局限在视觉对应生成环节,而时序跟踪、几何验证与状态估计完全保持显式 21。 通过尽可能减少学习组件并将几何验证作为硬约束保留,系统获得了与 GeoGS-SLAM 洞察相呼应的鲁棒性——当环境偏离训练分布时,降低参数丰富度能提升可靠性 21。
这些工作合在一起,阐明了一种共同的策略逻辑:在挑战性条件下实现实时 SLAM 时,剥离或最小化照片级真实外观建模的表示能获得更好的收敛、效率和鲁棒性。 其中几项工作以 arXiv 预印本形式出现,同行评审状态未知 52, 60, 56,而 GLAM-SLAM 已被 IROS 2026 接收 20,因此该领域的共识仍在凝聚。 尽管如此,这些不同方法的趋向汇聚表明,人们日益认识到,为以几何为中心的极简主义牺牲外观保真度,是通向可部署实时 3DGS SLAM 的一条有前景、或许也是必经之路。
自动驾驶 3DGS 从场景捕获转向可控安全仿真
自动驾驶 3DGS 研究正从被动场景重建转向主动的极端情况生成与物理标定的天气合成,将 3DGS 重新定位为一种安全验证工具。 早期以建图为导向的路线力图在特定领域效率与几何方面挖掘 3DGS 的极限。 RoGS 用面元替代网格基元来处理大规模路面,在一轮和两轮训练中相较基于网格的方法分别提速 53 倍与 27 倍 22。 FocusGS 瞄准环视相机在重叠度不足 15% 时的稀疏视角几何问题,用限制在几何模糊区域的基于查询的补全取代均匀的体素致密化 23。 VGOcc 将冻结的基础模型特征(VGGT)融入稀疏高斯占据预测,以解决仅靠图像域特征无法为体素推理提供足够显式几何信息的局限 24。 即便在应对恶劣天气时,其目标仍是重建性质的:DerainSplat 是首个前馈框架,能在单次前向传播中从稀疏的雨天视图重建干净的三维高斯场景,消除了此前驾驶场景 3DGS 方法对干净输入假设的依赖 25。 这些工作在自动驾驶约束下精进了场景捕获,但其产出仍是观测条件下忠实但静态的复现。
另一条研究路线则将3DGS重新定位为安全关键仿真中的生成基底。 GSRAIN不是去除雨,而是合成雨。 该框架提供物理标定的高/低频降雨合成,并具备跨视角一致性,能够生成可重复、多视角一致的雨景测试场景26。 GSRAIN报告的闭环驾驶实验在这些合成场景中,于8.5和12.0 mm/h的雨强下发生了碰撞26,直接将生成的天气条件与安全结果关联起来。 CARLA-GS更进一步:它把逼真的GS场景表示与基于大语言模型的语义推理以及CARLA的物理仿真解耦,从而合成自动驾驶的极端工况27。 这条流水线明确针对安全验证瓶颈:现有仿真器要么缺乏真实感,要么无法保证物理可行性,要么语义可控性有限27。 在这一架构中,3DGS不再只是建图的终点,而是一个受控生成系统中的组件,用以产出物理上合理、语义上多样的危险场景。
综合来看,重建方向——RoGS、FocusGS、VGOcc、DerainSplat——在领域约束下提升了保真度和效率,而生成方向——GSRAIN、CARLA-GS——则复用同样的高斯表示,目的不是记录已经发生的事,而是设计可能出现的事。 其结果是驾驶三维高斯泼溅在功能上被重新定义,从被动感知技术走向主动安全验证工具。 每项被引研究均为arXiv预印本(同行评审状态未知)。
临床 3DGS 成功靠编码领域物理,而非追求照片级真实感
临床和手术领域对 3D 高斯溅射的采纳,驱动力并非来自照片级渲染的进步,而是明确转向编码那些通用 3DGS 管线所忽略的领域特定物理约束。 arXiv 预印本 PhyMRI-SR 将 MRI 超分辨率重构为一个物理感知的重建问题,对空间分辨率与信噪比的内在权衡进行建模,打破了通用辐射场中常见的确定性上采样范式 28。 同样,arXiv 预印本 UniSpine‑GS 则引入一个物理感知的高斯框架,跨 X 光和超声实现脊柱评估 29。 这两项工作都直接将成像物理约束嵌入其中,表明临床效用源于对采集过程的忠实,而非视觉上无损的新视角合成。
手术场景理解也通过结合可变形组织的物理现实来推进。 arXiv 预印本 DeGenseGS 在 4D 高斯表示中显式地解耦了语义演化与几何变形,避免了在发生烧灼等拓扑改变事件时耦合方法产生的虚假扭曲 30。 与此同时,arXiv 预印本 Track2Map 从立体腹腔镜视频中执行在线可变形 SLAM,无需依赖机器人运动学或预计算位姿,直接应对了限制手术增强现实的不靠谱相机先验瓶颈 31。 两者都着力于一个刚性场景 3DGS 公式从根本上就无法建模的约束——剧烈的非刚性组织变形。
其他工作则通过编码领域特定的物理与测量约束进一步强化了这一模式。 arXiv 预印本 ExtraGS 利用扩散引导来外推超出已观察训练轨迹的内窥镜视图,从而解决内窥镜物理几何固有的有限视野安全瓶颈 32。 arXiv 预印本 DermDepth 针对皮肤科图像实现了度量级单目三维重建,优先考虑可直接指导临床的病变测量,而非渲染的美观度,并且无需额外硬件或多视角采集 33。 同时,一篇 MICCAI 研讨会论文报告了基于 LoRA 的 SAM3 基础模型适配方案,用于手术概念分割,仅更新 0.98% 的参数,表明特定领域的部署策略倾向于选择资源消耗极低、轻量化的适配方式,而非完整重训练 34。 这同样反映了一种对手术场景结构的编码——此处是语义分割先验——而不是对逼真输出的追求。
总的来说,这些预印本贡献汇聚出一条趋同的原则:临床三维高斯泼溅应用的价值并不来自提升着色保真度,而是来自将采集物理、组织形变、视野限制、度量尺度等物理约束紧密嵌入到表征之中。 由于所有工作均为 arXiv 预印本,其结论仍有待同行评审。
不确定性量化与抗损鲁棒性浮现为部署中关键的 3DGS 盲区
3DGS 从精心构造的基准测试转向实际部署的过程中,一个关键的盲区暴露了出来:点估计表示无法检测或报告重建结果何时并不可靠。 标准 3DGS 没有机制去区分充分几何支撑的结构与幻觉产生的漂浮物,也无法标定那些因观测噪声、遮挡或传感器损坏而保真度受损的区域。 近期一系列 arXiv 预印本(同行评审状态未知)显示,一个围绕不确定性感知和抗损鲁棒型 3DGS 的独立研究方向正在形成,以应对这些静默失效。
一条工作线将原生不确定性量化直接注入 3DGS 表示。 一个贝叶斯框架对 3DGS 进行重构,为每个高斯的均值和协方差赋予正态-逆威沙特后验,由此得到逐基元的不确定性——这正是点估计 3DGS 所根本欠缺的 35。 这使得模型能够识别几何支撑薄弱的区域,并主动挑选富含信息量的视图; 在一项 16 至 32 个主动视图选择的任务中,该方法将 PSNR 提升了 +0.453 dB 35。 这种逐基元不确定性与融合层面上的不确定性建模形成互补。 在线三维场景图方法 PUF 引入一个免训练、即插即用的框架,显式地建模三种不确定性来源——部分观测、软性二维模型输出以及嘈杂的三维升维——而确定性流水线则会将其丢弃 36。 如果说 35 关注的是各个几何基元的置信度,那么 36 解决的则是如何将不确定的二维证据整合到结构化的三维抽象中; 二者合在一起表明,3DGS 中的空间不确定性必须在基元阶段和融合阶段都得到处理。
除了统计不确定性,真实采集还会引入结构化的损坏,而标准3DGS会无声无息地将这些损坏固化到几何体中。 SSA‑3DGS 聚焦于屏幕空间的伪影,如水印、镜头污垢和UI叠加层,标准3DGS会错误地将它们嵌入为靠近相机的漂浮物,从而降低新视角合成的质量37。 其伪影去除是无监督的,避免了对干净参考数据的依赖。 这种对特定损坏模式的揭示——伪装成几何体的固化伪影——自然延伸到取证场景。 GFrame 表明,通过单目重建的深度和表面法线捕捉到的3D几何不一致性,能够揭示那些在2D外观上视觉无缝的图像篡改38。 在这里,无声故障并非传感器噪声,而是对抗性的篡改,而基于3DGS的几何线索则充当了2D取证方法所缺失的鲁棒性检查机制。
最后,当重建管线在受限的通信条件下运行时,可靠性差距进一步加剧。 一个面向实时移动3D重建的语义通信框架直接解决了这一问题:收发器联合输出重建图像与逐像素置信度图,以量化在噪声无线信道下各区域的重建可靠性39。 不同于35和36在3D表示内部对不确定性进行建模的做法,39将置信度估计推至网络边缘,表明面向部署的不确定性还必须考虑传输引入的损坏。
这些工作共同涵盖了原生几何不确定性35、融合级不确定性36、屏幕空间伪影去除37、取证几何审计38以及信道感知置信度映射39。 它们尚未构成一个统一的形式化框架,但共同的推力——使不可检测的故障变得可检测——标志着不确定性量化与损坏鲁棒性正是3DGS社区正在着手弥补的部署关键差距。
渲染、压缩与图元进展
多项工作推动了高斯泼溅渲染的效率和可扩展性。 CaT-GS 指出基于瓦片光栅化在处理大场景时,帧间预处理冗余、基于视点的遮挡以及瓦片级负载不均是关键瓶颈 40,而 TemporalGS 利用时间一致性,通过缓存参考帧的几何和外观缓冲区,以免训练、即插即用的方式加速渲染 41。 在向低图元体制推进的过程中,“Bake It Till You Make It”将低频几何与外观从高频纹理的视角无关空间哈希网格中解耦,实现了对精细细节的更高效渲染 42; LocoADC 是一种用于二维高斯图像表征的即插即用密度控制框架,它利用重建误差的空间连续性,避免割裂连贯的误差区域 43。 一项面向硬件的演示在 Graphcore Mk2 智能处理单元上运行 3DGS 前向传递,且无需外部 DRAM,表明显式的最近邻数据交换可以取代全局内存访问——这一特性对 SLAM 和机器人领域的增量相机运动尤为有利 44。
压缩与流式传输方法同样受到关注。 QIRF 受量子化学自然轨道分析的启发,将邻近高斯图元建模为局部非正交基,为减少表征浪费提供了一种有别于基于标量重要性修剪的原则性替代方案 45。 GenSplatCodec 将低比特率前馈 3DGS 压缩重新表述为通过一步扩散进行的几何引导生成解码,回应了沉浸式媒体的带宽约束 46; Struct-GStream 则把动态场景表征分解为来自动态锚点的结构化高斯和用于缺陷区域的自由高斯,在 N3DV 上将模型体积从 3DGStream 的 7.8 MB 缩减至 4.9 MB 47。
替代原始几何形状挑战了标准高斯表示。 可变形三角形抛雪球(DETRIS)为每条边附加可学习的控制点,在不改动基础顶点的情况下表征新月等非凸形状 48,3DGBGS 则将自适应颗粒球组织引入基于锚点的 3DGS,解决了均匀体素化与现实世界非均匀点分布之间的失配问题 49。 在表示层面,PixWorld 在像素空间扩散框架中统一了三维场景生成与重建,通过直接监督渲染的多视图图像,消除了潜空间方法固有的信息损失 50; MSVS-VAE 是一种层次化集合式三维 VAE,弥合了紧凑集合表示与基于体素方法之间的保真度差距 51。 GaussianSeed 将三维高斯基元组织为跨解码器层的由粗到精层次结构,使面向视觉的三维占用预测能扩展到 0.1 m 分辨率而无须承受过高的内存开销 52; 卷积神经着色则用关联邻近空间信息的卷积神经着色器取代基于 MLP 的单点渲染,改善了无纹理区域及图像边界不连续处的重建质量 53。
多项工作针对特定领域的挑战与理解展开。 在投影仪-相机系统中,FF-ProCams 首次提出了前馈式 3DGS 逆向渲染框架,消除了逐场景优化的延迟 54; InfiniSplat 则将像素对齐的高斯转换为表面对齐的高斯,用于前馈式单图像视图合成,在大基线视角变化下仍能保持连贯的结构 55。 G²SR 将少视图表面重建解耦为轻量级神经前端进行二维 splat 检测,以及利用多视图几何三角化三维 splat 的分析后端,内存占用最高比基线低 107 倍 56。 PanoLOG 提出了首个面向大规模室外全景重建的分块式 3DGS 框架,针对 360° ERP 图像,用基于几何和梯度的分块策略替代了针孔截锥分区 57。 JADE-GS 通过双向框架将二维事件引导的去模糊教师与 3DGS 学生耦合,实现二维–三维循环相互优化,服务于高速机器人感知与 AR/VR 58; ASTRA 则以显式二维运动轨迹替代仅依赖外观的光度对齐作为监督,用于无约束多相机设置下的异步动态三维重建 59。
质量评估与空间推理趋于成熟。 SpatialQ 通过空间感知表示显式建模 3DGS 场景质量,而非评估二维图像质量,这对部署系统中的模型选择和故障诊断至关重要 60。 ViewMind3D 提出了免训练的模块化三维问答框架,将任务分解为问题驱动的多视图选择、语言条件视觉定位、基于 BEV 的视点编码以及结构化答案生成,降低了机器人与具身智能中三维问答的门槛 61。 在一项关注鲁棒性的研究中,一种点选择微调框架通过在被破坏的输入中选取影响最小的点来保留稳健的预训练先验,用于点云分类 62; 而对多孔介质去噪三维图像的拓扑分析则评估了持久同调度量对噪声的鲁棒性,这些噪声原本会引入数百万个短寿命拓扑生成元 63。
基准、重建与场景理解
基准构建与仿真工作明显增多。 RealX3D 推出了一个包含 55 个高分辨率场景的真实采集基准,覆盖四种退化类型和九个受控设置,用于弥补合成退化数据集与实际部署条件之间的差距 64。 CLDefocus 贡献了一个大规模合成散焦去模糊数据集,该数据集通过高效的波动光学点扩散函数计算和相机 ISP 模拟生成 65。 HIOcc 将 ScanNet、ScanNet++ 和 Matterport3D 统一为一个分层式室内语义占用基准,支持房间级、楼层级和建筑级评估 66。 JPEG Pleno Part 7 中开发的标准光场质量评估工作流发现,现有客观指标在面对视图合成失真时性能显著下降 67。 在仿真方面,Image2Sim 提出了一种实时神经仿真器,能够将带位姿的 RGB-D 序列转换为交互式具身导航环境 68。 一篇 arXiv 预印本描述了 Genie Sim PanoWorld,它可以从单张 360° 全景图重建可自由导航的 3D 场景,且无需针对每个场景进行优化(仅为摘要描述)69。 SynCity 3000 通过调整一个以物体为中心的图像到 3D 模型,使其在场景窗口上以卷积方式运行,从而将场景级 3D 扩散推向更大规模,能够对照文本提示生成任意大小的室外环境 70。
一系列重建进展使流程更精简,作业域更宽广。 一篇被 SIGGRAPH 2026 接收的论文首次展示了从未排序的 RGB 图像中以即时反馈方式完成具备全局一致性的三维高斯溅射重建 71。 SalientGS 将快速 SfM 与联合位姿-外观优化融合成单一流水线,用约 15 分钟即可完成端到端 3DGS 训练,且仅使用 150 万个高斯体 72。 ReCal3R 通过校准状态更新来防止历史几何标记被噪声观测污染,从而补上了流式三维重建中的一个可靠性缺口 73。 针对水下场景,APVI-SLAM 引入了一个可靠性感知融合框架,动态重加权视觉–惯性与声压–惯性里程计,能够在视觉完全失效时恢复运行而无需重新初始化 74。 NSL-SLAM 将冻结的 Depth Anything v2 单目深度先验直接集成到迭代结构光立体解码循环中,使 Replica-SL 上的深度 RMSE 降低了 35% 75。 HoloTetSphere 直接从多视图图像生成拓扑自适应的四面体网格,输出与标准有限元仿真器兼容,且无需容易出错的后期处理 76。 TRACE 将基于高斯溅射地图的主动三维重建重新建模为轨迹级的遍历覆盖问题,用对动态可行轨迹的连续优化取代了贪婪式下一最佳视角选择 77。
多项工作拓展了三维场景理解与协作感知。 ZeroSplat 定义了广义指代三维高斯泼溅分割任务,可处理任意数量的目标(包括零目标),并构建了 GR-LERF 与 GR-ScanNet 基准; 一篇 arXiv 预印本注明其已被 ECCV 2026 录用 78。 一种被 ICRA 2026 录用的鲁棒多模态动态物体分割方法,将像素位置、深度、偏移、语义特征和 MonST3R 注意力图生成的逐点轨迹融合成一个仅含 2.8M 参数的紧凑模型 79。 被 IROS 2026 录用的 RayOcc 将相机射线占用估计从单深度分类分布重新表述为多标签高斯混合强度预测,解决了公式层面的失配问题 80。 在车联网协作方面,CoGoal3D 解决了二维鸟瞰图变换所忽略的三维空间错位问题,一篇被 ECCV 2026 录用的 arXiv 预印本显示,在三个真实数据集上 3D AP 提升了 10.18% 至 10.86% 81。 MonoVoc 在免训练的单目开放词汇三维高斯泼溅流程中,将几何重建与语义集成解耦 82。 Ground3D-LMM 被提出作为首个统一的大型多模态模型,用于三维点级定位,并具备度量感知的对话推理能力,其包含的三维定位测量任务要求同时预测所指区域和物理尺寸 83。 另一个被 ECCV 2026 录用的框架通过并行的二维视觉、隐式几何和显式几何流处理 RGB 视频,将来自高斯泼溅的三维属性嵌入到三维感知的视觉语言模型中 84。
超越核心重建范式的工作拓宽了该领域的应用范围。 潜在黎曼流匹配(Latent Riemannian Flow Matching)直接在前馈几何基础模型VGGT的潜在空间中进行生成流匹配,为在遮挡区域生成合理几何形状建立了一种方法 85。 一种针对三角网格的内蕴且与三角剖分无关的注意力机制,弥补了此前限制注意力架构在网格学习任务上表现的性能差距 86。 动态逆渲染表明,单个日常视频中刚性物体的运动提供了足够的表面-光照交互,无需多光源采集或学习先验即可消除材质与光照的歧义 87。 最后,一篇发表于《ACM Computing Surveys》(2026年)的全面49页神经辐射场综述,将NeRF的方法论进展与实际部署挑战联系起来,填补了先前综述所留的空白 88。
化身、风格化与应用前沿
在三维高斯泼溅统一化主流趋势之外,本期还出现了若干化身建模与肖像动画方面的重要进展。 新的整体参数化头部模型 GNM Head 将外部皮肤、眼睛、牙齿和舌头统一在同一个统计空间中,弥补了此前模型仅能表示空壳的缺陷 89。 在单次重建方面,FlexiAvatar 能在单一管线中处理单目视频中任意身体可见范围——全身、上半身或仅头部 90。 与之配套的 S‑Avatar 则引入一个三阶段管线:通过基于扩散的生成模块从单张 RGB 图像合成高分辨率三维高斯泼溅,再拟合 FLAME 模型并绑定模板 91。 OASIS 将单图像重建扩展到手部,用三维高斯泼溅框架替代 NeRF 风格的体积表示以实现高效的手部化身恢复,不过目前仅有摘要可供查阅 92。 在实时情感控制方面,一个级联框架利用基于三维高斯的情感代理化身,从音频和情感标签生成富有表现力的说话头视频,目标在于跨身份泛化 93。
DreamStyle3D 使用解耦双交叉注意力机制直接在原生三维隐空间中生成风格化资产,将几何与风格分离开来 94。 场景编辑迎来了多款专用工具:LB‑Edit 为文本驱动的局部编辑放置紧凑的注意力最优相机集,以便在复杂的多物体场景中对特定对象进行编辑,解决了直接复用 COLMAP 训练相机的局限性 95; TRACE 通过网格引导的 3DGS 将几何锚定与外观协调解耦,使其能进行超越纯外观修改的几何感知编辑,该特性在其摘要中已有描述 96; FocusGS 则将已训练好的 3DGS 资产的局部修复与确定性编辑建模为复合空间增量,随着 3DGS 资产进入可维护阶段,这一需求变得切实起来 97。 量子位的一篇媒体报道介绍了 ABot‑World Studio,这是一款将交互式视频生成与 3DGS 场景创建统一起来的产品,支持在消费级硬件上进行文本或图像驱动的探索 98。
在机器人领域,ProxyPose 通过调优的视频扩散模型将 6‑DoF 姿态追踪重新定义为视频到视频的转换问题,实现了最先进的性能,整个过程不使用 3D 模型、深度传感器或物体掩码 99。 AeroAct 则构建了首个面向真实空中飞行的世界‑行动模型,把一个 13 亿参数的视频扩散 Transformer 适配为能够从第一人称视觉历史与语言指令中预测分块轨迹参数 100。 StructureGS 已被 ECCV 2026 接收,它把结构感知引导集成到 3D 高斯泼溅中,用于铰接物体重建,对具身 AI 中的物理交互至关重要 101。
若干工作将重建拓展到了具有挑战性的领域。 CORF‑GS 提出首个基于 3DGS 的实时光无线辐射场重建方法,逐步处理连续的光学‑射频关键帧 102。 Swimm3R 将介质感知的运动恢复结构与水下 Beta 泼溅相结合,以对抗散射和衰减对水下 3D 重建的破坏 103。 FUTURESURF 基准在留出的未来时刻评估动态曲面网格,暴露出即使在分析可恢复的未来上,Chamfer 距离仍存在 2.7–4.1 倍的差距,这是一个此前未被量化的局限 104。
基础工具与理论成果也相继出现。 抖动高斯机制将差分隐私的私有输出离散化,降低了随机性开销,并消除了在大规模 DP‑SGD 部署中可能泄露信息的浮点“漏洞” 105。 窗式稀疏化提供了首个精确模拟方法,并为对数凹设定下的弹跳粒子采样器和 Zigzag 采样器给出了显式的冷启动查询复杂度保证 106。 AKSSAM 为广义加性模型引入了一套显式的节点选择框架,填补了 P‑样条实践中的空白 107。 参考预印本,一种在三个保真度层级上调优遗传算法超参数的贝叶斯优化框架,能将晶格材料设计的计算成本降低 24% 108; 而一项恢复结果将近乎最优的潜在内积保证扩展到了从各向异性高斯分布中抽取的随机几何图上 109。
在科学数据与工具方面,BubbleSH 提供了一个可复用的瞬态三维气泡群动力学数据集,并配有紧凑的球谐形状描述子,在昂贵的直接数值模拟与数据驱动模型之间架起桥梁 110。 隐式机器学习力场用自洽不动点方程替代显式神经网络堆叠,在分子动力学中将计算和内存占用降低了 2 到 5 倍,不过原文主体未能阅读,仅可供参考摘要 111。 pTVreg 的 Python 重实现引入基于 ADMM 的优化方法进行基于 B 样条控制点位移的可变形图像配准,补齐了原始版本未实现的功能 112。 最后,GaussFusion 在自动生成的三维高斯数据上进行预训练,并利用从视觉‑语言模型蒸馏得到的图像与文本监督信号,从而降低点云理解对手工三维标注的依赖 113。
综合与展望
本阶段研究综合表明,该领域正从通用照片级真实感转向任务与领域特定的实用性,这一转变在多个前沿获得强化。 面向视图条件、自适应分配的前馈表示直接支撑了实时 SLAM 对最小几何的拥抱——两者均以牺牲丰富外观换取速度与鲁棒性,共同挑战了“更完整重建总是更好”的假设。 然而,这种极简主义却与临床和自动驾驶应用的要求形成张力:在这些领域,编码领域物理特性——如 MRI 采集约束、组织形变、气象标定——比渲染保真度更为关键,这指向对 3DGS 质量定义的拓宽,使其脱离传统基准指标。 动态场景建模中缺乏共识——在形变网络、混合专家模型与前馈整体重建之间分裂——既反映了该领域同时向可部署、具不确定性感知的方法推进,又可能最终由这一趋势所解决:编辑部解读认为,随着不确定性量化走向成熟,它将迫使各方收敛到能够报告自身失败的方法上,尤其是在自动驾驶的安全关键仿真中。 这条新兴的关于不确定性与抗毁坏鲁棒性的线索,充当了具身人工智能、医学成像和仿真等原本各自孤立进展之间不可或缺的纽带,但在那些已为 3DGS 投产做好准备的大量渐进式工程工作中却仍然缺失。 证据构成——覆盖 112 个一手研究来源,仅 1 个二手来源——使我们对所识别的趋势具有高确信度,但在真实世界部署验证方面的覆盖最薄。 一个开放问题依然存在:前馈泛化能否融入使临床与安全关键应用可行的领域特定物理先验,同时又不重新引入这些领域当前所承受的计算负担。
本次综述基于113项进展:112项来自A级研究来源,1项来自C/D级二手或社区来源。 最可靠的结论出自A级研究,而一手及社区来源应视为方向性参考; 若要提高置信度,还需对自我报告的结果进行独立复现和一手来源验证。
原文链接与引用索引
- [1] ATSplat:基于自适应Token扩展的紧凑前馈3D高斯泼溅 — arXiv · Tier A/research_paper
- [2] UniqueSplat:面向可泛化三维重建的视角条件化三维高斯泼溅 — arXiv · Tier A/research_paper
- [3] HyperGS:快速且可泛化的高斯视频表示 — arXiv · Tier A/research_paper
- [4] WildSplat:基于无姿态野外图像的前馈高斯溅射三维重建 — arXiv · Tier A/research_paper
- [5] NoDrift3R:基于射线图引导耦合的漂移鲁棒无位姿前馈三维重建 — arXiv · Tier A/research_paper
- [6] 面向鲁棒操作策略学习的几何感知运动隐变量 — arXiv · Tier A/research_paper
- [7] MANGO-Grasp:基于几何导向3D高斯的马氏距离场用于跨本体灵巧抓取 — arXiv · Tier A/research_paper
- [8] VistaVLA:面向机器人操作的几何与语义感知3D高斯接地VLA — arXiv · Tier A/research_paper
- [9] SONG:用于社交导航基准测试的光照真实感3D高斯仿真平台 — arXiv · Tier A/research_paper
- [10] ABot-3DWorld 0:一个可探索任意三维空间的通用世界模型 — arXiv · Tier A/research_paper
- [11] 基于SAM3D引导的以对象为中心的表征对齐方法用于视觉-语言-动作模型 — arXiv · Tier A/research_paper
- [12] Deform360:面向可变形世界模型的海量多视角视觉-触觉数据集 — arXiv · Tier A/research_paper
- [13] GrainGS:用于高效动态新视角合成的梯度解耦高斯泼溅 — arXiv · Tier A/research_paper
- [14] AdaAnchor4D:面向单目无人机4D重建的锚点条件时空特征聚合方法 — arXiv · Tier A/research_paper
- [15] 面向动态高斯泼溅的混合专家设计研究 — arXiv · Tier A/research_paper
- [16] GUSH3R:将所有人与场景即时统一为高斯表示 — arXiv · Tier A/research_paper
- [17] FillGS:通过视角-时间选择与生成式细化填补4D高斯泼溅中的观测间隙 — arXiv · Tier A/research_paper
- [18] GeoGS-SLAM:面向稠密单目SLAM的纯几何高斯泼溅 — arXiv · Tier A/research_paper
- [19] Stipple:基于视觉惯性跟踪的实时增量高斯泼溅 — arXiv · Tier A/research_paper
- [20] GLAM-SLAM:基于流致密化与空间分解的实时大规模高斯建图 — arXiv · Tier A/research_paper
- [21] 鲁棒VIO是否需要更多学习?分布偏移下几何验证的视觉测量 — arXiv · Tier A/research_paper
- [22] RoGS:用于大规模道路表面映射的自适应网格高斯表示 — arXiv · Tier A/research_paper
- [23] 面向自动驾驶稀疏视角三维重建的目标化结构补全 — arXiv · Tier A/research_paper
- [24] VGOcc:面向视觉中心3D驾驶占用预测的视觉-几何高斯学习 — arXiv · Tier A/research_paper
- [25] DerainSplat:从稀疏雨天视角前馈生成清晰3D高斯泼溅 — arXiv · Tier A/research_paper
- [26] GSRAIN:面向3D高斯驾驶场景的物理校准高低频降雨合成方法 — arXiv · Tier A/research_paper
- [27] CARLA-GS:解耦表示、推理与物理仿真用于自动驾驶 corner-case 合成 — arXiv · Tier A/research_paper
- [28] PhyMRI-SR:面向物理感知的MRI图像超分辨率重建 — arXiv · Tier A/research_paper
- [29] UniSpine-GS:一种面向跨模态多视角脊柱图像合成的高效物理感知高斯框架 — arXiv · Tier A/research_paper
- [30] DeGenseGS:基于4D高斯溅射的几何与语义解耦手术场景理解 — arXiv · Tier A/research_paper
- [31] Track2Map:面向机器人手术的在线可变形SLAM与运动感知位姿优化 — arXiv · Tier A/research_paper
- [32] ExtraGS:通过扩散引导的三维高斯泼溅增强内窥镜视角外推 — arXiv · Tier A/research_paper
- [33] DermDepth:面向皮肤科的单目度量尺度三维重建模型 — arXiv · Tier A/research_paper
- [34] 面向提示驱动手术概念分割的SAM3参数高效适配 — arXiv · Tier A/research_paper
- [35] 具有原生不确定性与自适应复杂度控制的渲染感知贝叶斯三维高斯溅射 — arXiv · Tier A/research_paper
- [36] PUF:用于在线三维场景图生成的即插即用不确定性感知融合框架 — arXiv · Tier A/research_paper
- [37] SSA-3DGS:面向3D高斯溅射的屏幕空间伪影无监督去除 — arXiv · Tier A/research_paper
- [38] 当2D线索失效时:利用可靠的3D几何改进图像篡改定位 — arXiv · Tier A/research_paper
- [39] 面向实时移动三维重建的语义通信研究 — arXiv · Tier A/research_paper
- [40] CaT-GS:通过帧间缓存与瓦片调度实现大规模场景的高效3DGS渲染 — arXiv · Tier A/research_paper
- [41] TemporalGS:基于时间先验的3D高斯溅射渲染免训练即插即用加速方法 — arXiv · Tier A/research_paper
- [42] Bake It Till You Make It:超快空间纹理图集泼溅 — arXiv · Tier A/research_paper
- [43] 面向高效高斯图像表示的局部感知密度控制 — arXiv · Tier A/research_paper
- [44] 在图处理器上渲染3D高斯 — arXiv · Tier A/research_paper
- [45] QIRF:面向3D高斯泼溅的量子启发非正交函数空间压缩 — arXiv · Tier A/research_paper
- [46] GenSplatCodec:基于单步扩散的前馈高斯泼溅压缩 — arXiv · Tier A/research_paper
- [47] Struct-GStream:基于结构化3D高斯的高效低码率自由视点视频流媒体 — arXiv · Tier A/research_paper
- [48] 可变形三角形泼溅:用于实时辐射场渲染的灵活图元 — arXiv · Tier A/research_paper
- [49] 3DGBGS:用于紧凑新视角合成的三维粒球高斯泼溅 — arXiv · Tier A/research_paper
- [50] PixWorld:在像素空间中统一3D场景生成与重建 — arXiv · Tier A/research_paper
- [51] MSVS-VAE:用于高保真3D重建的多尺度锚定向量集 — arXiv · Tier A/research_paper
- [52] GaussianSeed:用于高分辨率3D占用预测的分层高斯播种方法 — arXiv · Tier A/research_paper
- [53] 基于卷积神经着色的多视图图像高质量三维重建 — arXiv · Tier A/research_paper
- [54] FF-ProCams:用于投影仪-相机系统的前馈高斯泼溅 — arXiv · Tier A/research_paper
- [55] InfiniSplat:面向大基线单目视图合成的隐式高斯解码 — arXiv · Tier A/research_paper
- [56] G2SR:面向快速且内存高效的高斯表面重建的几何方法 — arXiv · Tier A/research_paper
- [57] 基于几何与梯度分块策略的全景户外重建 — arXiv · Tier A/research_paper
- [58] JADE-GS:基于事件引导的3D高斯泼溅联合交替去模糊 — arXiv · Tier A/research_paper
- [59] ASTRA:基于轨迹对齐的异步时空重建 — arXiv · Tier A/research_paper
- [60] SpatialQ:基于视觉多模态大语言模型理解3D高斯泼溅场景质量 — arXiv · Tier A/research_paper
- [61] ViewMind3D:面向无训练3D问答的模块化视角感知推理框架 — arXiv · Tier A/research_paper
- [62] 面向鲁棒点云分类的点选择微调框架 — arXiv · Tier A/research_paper
- [63] 三维图像去噪:持续同调度量的鲁棒性 — arXiv · Tier A/research_paper
- [64] RealX3D:面向多视角视觉恢复与重建的物理退化3D基准 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [65] 真实复合镜头离焦模糊合成 — arXiv · Tier A/research_paper
- [66] GEM-Occ:从视觉几何证据到具身语义占用记忆 — arXiv · Tier A/research_paper
- [67] 面向标准化的光场质量评估:混合主观基准测试与客观指标评价 — arXiv · Tier A/research_paper
- [68] Image2Sim:通过生成式神经模拟器扩展具身导航 — arXiv · Tier A/research_paper
- [69] Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成管线 — arXiv · Tier A/research_paper
- [70] SynCity 3000:自举式场景级三维扩散生成 — arXiv · Tier A/research_paper
- [71] 无序输入下具备全局一致性的即时3D高斯泼溅重建 — arXiv · Tier A/research_paper
- [72] SalientGS:基于重要性引导MCMC高斯分配的统一SfM到3DGS重建框架 — arXiv · Tier A/research_paper
- [73] ReCal3R:面向流式三维重建的可靠性校准学习率 — arXiv · Tier A/research_paper
- [74] APVI-SLAM:复杂水下环境中的实时声压视觉惯性定位与真实感建图系统 — arXiv · Tier A/research_paper
- [75] NSL-SLAM:面向实用SLAM与重建的高保真神经结构光深度 — arXiv · Tier A/research_paper
- [76] HoloTetSphere:面向物理仿真的统一 TetSphere 网格重建 — arXiv · Tier A/research_paper
- [77] TRACE:用于主动场景重建的遍历轨迹优化 — arXiv · Tier A/research_paper
- [78] ZeroSplat:3D高斯泼溅中的广义指代分割 — arXiv · Tier A/research_paper
- [79] 鲁棒多模态动态物体分割 — arXiv · Tier A/research_paper
- [80] RayOcc:基于高斯混合强度的遮挡感知射线占用估计 — arXiv · Tier A/research_paper
- [81] CoGoal3D:基于3D感知融合与精修的协作式3D目标检测 — arXiv · Tier A/research_paper
- [82] MonoVoc:解耦几何与语义的轻量级单目开放词汇3D高斯表示 — arXiv · Tier A/research_paper
- [83] Ground3D-LMM:基于大模型的细粒度三维点云定位与空间推理 — arXiv · Tier A/research_paper
- [84] 具备隐式与显式几何感知的3D视觉语言模型 — arXiv · Tier A/research_paper
- [85] 面向几何基础模型的潜在黎曼流匹配 — arXiv · Tier A/research_paper
- [86] 内蕴且与三角化无关的注意力:一种用于网格学习的简单而强大的方法 — arXiv · Tier A/research_paper
- [87] 动态逆渲染增强材质-光照分解 — arXiv · Tier A/research_paper
- [88] 面向真实世界的神经辐射场:综述 — OpenAlex: peer-reviewed AI venues · Tier A/research_paper
- [89] GNM Head:人类头部的生成式人体测量模型 — arXiv · Tier A/research_paper
- [90] FlexiAvatar:任意身体可见性下的统一3D高斯人体虚拟化身 — arXiv · Tier A/research_paper
- [91] S-Avatar:基于扩散引导的单图像高斯头部虚拟人 — arXiv · Tier A/research_paper
- [92] OASIS:基于3D高斯泼溅的遮挡感知单图手部虚拟人重建 — arXiv · Tier A/research_paper
- [93] 代理头像与低秩缓存:实时单样本情感可控肖像动画 — arXiv · Tier A/research_paper
- [94] DreamStyle3D:通过双重注意力解耦实现高效的3D风格化资产生成 — arXiv · Tier A/research_paper
- [95] 编辑前先观察:面向3D高斯泼溅编辑的注意力引导相机放置与多视角对齐 — arXiv · Tier A/research_paper
- [96] TRACE:通过有形重建与几何对齐的上下文视频掩码实现高保真3D场景编辑 — arXiv · Tier A/research_paper
- [97] FocusGS:面向已训练3D高斯资产的局部修复与确定性编辑的空间增量层 — arXiv · Tier A/research_paper
- [98] 高德发布通用世界模型工坊ABot-World Studio:5090单卡可生成小时级实时交互式视频与3D场景 — 量子位 QbitAI (RSS) · Tier C/media_report
- [99] ProxyPose:通过视频到视频翻译实现6自由度姿态跟踪 — arXiv · Tier A/research_paper
- [100] AeroAct:面向语言条件四旋翼飞行的以动作为中心的世界-动作模型 — arXiv · Tier A/research_paper
- [101] StructureGS:面向铰接物体重建的结构感知高斯泼溅 — arXiv · Tier A/research_paper
- [102] CORF-GS:基于光-射频耦合高斯泼溅的实时无线辐射场重建 — arXiv · Tier A/research_paper
- [103] Swimm3R:基于介质感知SfM与水下Beta Splatting的水下三维重建 — arXiv · Tier A/research_paper
- [104] 未来渲染 ≠ 未来表面:面向观测窗口外动态表面重建的基准与数据集 — arXiv · Tier A/research_paper
- [105] 用于随机性高效差分隐私的抖动高斯机制 — arXiv · Tier A/research_paper
- [106] 弹跳粒子采样器与Zigzag采样器的窗口化稀疏化与查询复杂度 — arXiv · Tier A/research_paper
- [107] 平滑加性模型中的自动节点选择 — arXiv · Tier A/research_paper
- [108] 多保真框架下基于贝叶斯优化的遗传算法超参数高效晶格材料设计 — arXiv · Tier A/research_paper
- [109] 从各向异性高斯随机几何图中恢复潜在内积 — arXiv · Tier A/research_paper
- [110] BubbleSH:具有可变形界面的上升气泡数据集 — arXiv · Tier A/research_paper
- [111] 隐式机器学习力场加速分子动力学模拟 — arXiv · Tier A/research_paper
- [112] 一种可访问的可变形图像配准解决方案及其与基于学习的方法的比较 — arXiv · Tier A/research_paper
- [113] GaussFusion:面向多模态3D高斯预训练 — arXiv · Tier A/research_paper