文章目录
一、术语
1.三维重建
| 缩写 | 英文全称 | 中文全称 | 拓展 |
|---|---|---|---|
| PSNR | Peak Signal-to-Noise Ratio | 峰值信噪比 | 本质上是根据两张图像的像素误差来算的。如果重建图和真实图每个像素都差得很小,那么 PSNR 就会更高 看像素误差,越高越好 |
| SSIM | Structural Similarity Index Measure | 结构相似性指标 | 它不只是看像素差,而是更关注图像的亮度、对比度、结构信息。它像是在问:这两张图的纹理、边缘、轮廓、整体结构是不是相似? 看结构相似,越高越好 |
| LPIPS | Learned Perceptual Image Patch Similarity | 学习感知图像块相似度 | 它不是只看像素,而是把图像送进一个预训练神经网络,比较它们在特征空间里的距离。 看感知差异,越低越好 |
| 3DGS | 3D Gaussian Splatting | 3D高斯 |
2.室内导航
| 缩写 | 英文全称 | 中文全称 | 拓展 |
|---|---|---|---|
| IIN | Instance ImageGoal Navigation | 实例图像目标导航 | 要求:智能体在未探索的环境中定位目标图像中描绘的特定物体。 挑战:需要在不同视角下识别目标物体,同时忽略潜在的干扰物。 |
| BEV | Bird’s Eye View | 鸟瞰图 | BEV地图缺乏场景的详细纹理表示。虽然BEV地图在语义级视觉导航任务中表现出色,但在实例级任务中存在局限性。 |
二、现有的研究论文
1.GaussNav:3DGS助力视觉导航【偏导航算法】
TPAMI 2025| 高斯绘制助力智能体视觉导航
🌟题目:TPAMI 2025| GaussNav:用于视觉导航的高斯绘制
📈摘要:
在具身视觉导航中,实例图像目标导航(Instance ImageGoal Navigation, IIN)要求智能体在未探索的环境中定位目标图像中描绘的特定物体。IIN的主要挑战在于需要在不同视角下识别目标物体,同时忽略潜在的干扰物。现有的基于地图的导航方法通常使用鸟瞰图(Bird’s Eye View, BEV),这种地图缺乏场景的详细纹理表示。虽然BEV地图在语义级视觉导航中表现出色,但在实例级任务中存在局限性。为此,本文提出了一种新的IIN框架——GaussNav,该框架基于三维高斯绘制(3D Gaussian Splatting, 3DGS)构建了一种新颖的地图表示方法。GaussNav框架使智能体能够记忆场景的几何和语义信息,同时保留物体的纹理特征。通过匹配与目标相似的物体的渲染图像,智能体可以准确识别、定位并导航至指定物体。GaussNav框架在HabitatMatterport 3D(HM3D)数据集上取得了显著的性能提升,路径长度加权成功率(SPL)从0.347提高到0.578。代码已公开。
📝论文贡献:
1.提出了一种新的地图表示方法:基于三维高斯绘制(3DGS)的语义高斯地图,能够同时保留场景的三维几何信息、语义标签和纹理细节。
2.设计了一种高效的导航框架:GaussNav框架通过匹配渲染图像与目标图像,直接定位目标物体,将复杂的实例级导航任务转化为更简单的点目标导航任务。
3.显著提升了导航性能:在HabitatMatterport 3D数据集上,GaussNav在成功率和路径长度加权成功率(SPL)上均取得了新的最高水平,SPL从0.347提升至0.578。
4.验证了方法的效率和实用性:通过实验分析,展示了GaussNav在效率和性能上的优势,并指出了未来改进的方向
2.VR-Robo:3DGS 重建真实场景,供机器人在虚拟环境训练【偏数字孪生训练系统】
📚VR-Robo:3DGS打造具身"数字孪生"训练场
最近读到清华和上海期智研究院等团队的一篇很有意思的工作,解决了机器人仿真训练中的一个老大难问题 - 如何让虚拟环境更真实,从而提升sim-to-real的效果。
🔧 技术核心
VR-Robo的核心思路是Real-to-Sim-to-Real,即从真实环境重建仿真环境再回到真实应用。具体实现上有几个关键技术点:
1.3D Gaussian Splatting重建:利用多视角图像,结合深度先验知识,重建出高质量的场景几何结构。相比传统NeRF,3DGS在渲染速度上有显著优势。
2.GS-mesh混合表示:这是一个很巧妙的设计。用3DGS负责视觉渲染,保证画面的真实性;用mesh负责物理交互,确保机器人能够与环境进行准确的碰撞检测和力学交互。
3.坐标对齐机制:解决了GS和mesh两套表示之间的坐标一致性问题,确保视觉所见即物理所得。
💡 实操方法
第一步:多视角图像采集,这里建议使用高分辨率相机,视角覆盖要充分
第二步:利用Structure-from-Motion获取相机位姿和稀疏点云
第三步:结合Depth Anything V2等基础模型提供的深度先验进行几何重建
第四步:生成mesh表示并与GS进行坐标对齐
第五步:在Isaac Sim中构建数字孪生环境
第六步:通过强化学习训练视觉导航策略
🌟 关键优势
1.零样本迁移:训练出的策略可以直接部署到真实环境,无需额外的fine-tuning
2.RGB-only感知:摆脱了对深度相机的依赖,仅用RGB图像就能实现有效的视觉导航
3.快速适应:在新环境中能够快速适应并展现良好的探索能力
⚠️ 潜在坑点
1.重建质量高度依赖输入图像的质量和覆盖范围,光照条件变化可能影响效果
2.计算资源需求不小,特别是3DGS的训练和渲染阶段
3.对于动态场景的处理能力有限,主要适用于静态或半静态环境
🔬 实验表现
团队在多个真实场景中验证了方法的有效性,包括室内导航和复杂地形穿越。实验结果显示,相比传统方法,VR-Robo在视觉真实性和物理交互准确性方面都有显著提升。
🚀 未来展望
这项工作为机器人仿真训练提供了新的思路,特别是在家庭服务和工业自动化场景中具有很大的应用潜力。随着3DGS技术的不断成熟,预计会有更多类似的Real-to-Sim-to-Real框架出现。
3.SAGE:生成训练场景
全名:SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
它的核心是:根据任务描述,自动生成大量可用于 embodied AI 训练的 3D 场景。
它做的事包括:
- 生成房间布局
- 摆放物体
- 检查语义合理性和物理稳定性
- 输出 simulator-ready 场景
- 形成大规模数据集 SAGE-10k
所以它更像:
“自动造训练场景的工厂”
4.SAGE-3D:把 3DGS 场景变成可导航环境 【偏环境可执行化】
对应论文:Towards Physically Executable 3D Gaussian for Embodied Navigation
代码:https://github.com/Galery23/SAGE-3D_Official
它提出的 SAGE-3D 是:
Semantically and Physically Aligned Gaussian Environments for 3D Navigation
它的核心是:把普通 3DGS 从“看起来真实”升级成“语义对齐、物理可执行、可用于导航”的环境。
它做的重点是:
- 给 3DGS 补上对象级语义
- 加上物理可执行性
- 支持具身导航,尤其是 VLN/连续导航
- 还提出了 InteriorGS、SAGE-Bench 这些数据/评测资源
所以它更像:
“把已有 3DGS 场景改造成导航环境”
论文标题:SAGE-3D: Towards Physically Executable 3D Gaussian for Embodied Navigation(2510.21307)
一段话总结:
本文提出SAGE-3D,一种将3D高斯溅射(3DGS)从单纯的渲染表示升级为可执行、语义对齐、物理对齐的具身导航环境基础的新范式。通过物体级语义标注和物理感知执行接口两大核心组件,作者构建了包含1000个室内场景、55万物体标注的InteriorGS数据集,并发布首个基于3DGS的视觉语言导航基准SAGE-Bench,包含200万条导航数据。实验表明,基于3DGS的场景数据虽然收敛较慢,但具有更强的泛化能力,在VLN-CE未见场景上提升了31%的成功率。
5.Sparse to Dense:单图就能实现的3D重建。减少输入图像,但不怎么下降渲染质量
项目链接:https://george-attano.github.io/S2D
传统3D Gaussian Splatting(3DGS) 在3D重建中表现优秀,但对输入视角数量要求很高,一旦输入图像过少,渲染质量会明显下降。上海交通大学、华东师范大学等机构提出 S2D(Sparse to Dense Lifting),通过结合点云结构先验和扩散模型修复,实现 极少输入视角的高质量3D重建,甚至在只有1张图像时也能稳定生成大范围视角。
核心亮点:
Sparse-to-Dense重建框架: 提出S2D流程,将稀疏输入先转换为点云结构,再提升为高质量3DGS表示,实现“从稀到密”的重建能力。
一步扩散模型修复伪影: 设计高效的单步扩散模型,对稀疏输入生成的视角伪影进行结构化修复,提升纹理细节与真实感。
双重结构+纹理引导: 修复模型同时利用点云渲染结果(结构信息)和邻近真实图像(纹理信息),解决传统方法结构不一致问题。
随机样本丢弃训练策略: 通过 Random Sample Drop 控制真实视角与生成视角比例,避免模型过度拟合生成数据。
像素级加权梯度优化: 对潜在错误区域降低梯度权重,减少伪影对3DGS训练的干扰,提高整体稳定性。
arXiv:2603.10893
它主要讲的是:
如何在输入视角非常稀疏的情况下,仍然做出高质量的 3DGS 重建。
核心思路是把两类表示结合起来:
(1)点云:几何结构更稳,但渲染不够真实
(2)3DGS:渲染好,但稀疏输入下容易出伪影、几何崩坏
所以 S2D 做了一个“Sparse to Dense lifting”流程,主要有两部分:
(1)用一个 一步式 diffusion 模型去修复稀疏输入下生成的新视角图像伪影
(2)用一套更稳的重建策略去把这些稀疏真实视图和稠密新视图重新喂给 3DGS,包括文中提到的 random sample drop 和 weighted gradient
6.区别
SAGE-3D 解决的是:3DGS 场景怎么变成可导航、可执行的环境
VR-Robo 解决的是:真实场景 -> 仿真环境 -> 策略训练 -> 真实部署
三、研究思路
思路可以概括成一句话:
先不硬做 VR-Robo 那种完整实机闭环,而是先把“真实场景重建出来的 3DGS 环境,变得更适合导航训练”这件事做好。
这就是:
基于 SAGE-3D 的切入口,服务于 VR-Robo 的最终目标。
怎么理解这句话
SAGE-3D 解决的是:
3DGS 场景怎么变成可导航、可执行的环境
VR-Robo 解决的是:
真实场景 -> 仿真环境 -> 策略训练 -> 真实部署
你现在最适合做的是中间这段:
真实场景重建之后,如何把 3DGS 变成“更能训练导航策略”的仿真环境。
也就是专注于:
Real -> Sim
而不是一上来就强做:
Sim -> Real
你的研究主线可以这样定
题目风格可以是:
面向具身导航训练的 3DGS 可执行数字孪生环境构建方法
或者更贴近你想要的叙事:
面向 real-to-sim 的 3DGS 可执行仿真环境构建与任务驱动优化
具体怎么做
你可以把工作拆成 4 步。
第一步:真实场景采集与 3DGS 重建
用手机采集室内场景
用现成流程得到 3DGS 场景
这一步不追求你自己发明新重建算法,先把场景拿到手
这一步对应 VR-Robo 的前半段。
第二步:做“可执行化”处理
这是你真正的核心工作,偏 SAGE-3D。
要解决的问题是:
哪里能走?
哪里不能走?
地面边界在哪里?
障碍物怎么表示?
机器人在仿真里怎么碰撞?
你可以做的内容:
从 3DGS / 深度 / mesh 中提取地面和障碍
生成可通行区域图
构建轻量碰撞代理
对关键区域做几何修正
这一部分本质上就是:
把“能看”的 3DGS 场景,变成“能训练导航”的环境。
第三步:做“任务驱动优化”
这是你比 SAGE-3D 更进一步的地方。
不是只让环境“能走”,而是让它:
更适合导航训练。
比如重点优化:
门口
走廊
障碍边界
台阶/坡道
目标物周边的可见性和遮挡关系
你可以提出一个思路:
导航关键区域比非关键区域更重要,因此重建/修正时要做任务加权。
这会比单纯环境处理更像创新。
第四步:在仿真中验证
用简单导航任务做实验,不一定要上真实机器人。
你可以做:
PointGoal Navigation
ObjectGoal / ImageGoal Navigation
简化移动机器人导航
比较对象:
原始 3DGS 场景
textured mesh 场景
你的可执行化 3DGS 场景
你的任务驱动优化版本
看这些指标:
Success Rate
SPL / 路径效率
碰撞率
到达时间
可通行区域准确率

358

被折叠的 条评论
为什么被折叠?



