ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

当前主流 3D 表示方法(3D Representation Methods)技术综述:从点云、体素到 NeRF 与 3D Gaussian Splatting

当前主流 3D 表示方法(3D Representation Methods)技术综述:从点云、体素到 NeRF 与 3D Gaussian Splatting 当前主流 3D 表示方法3D Representation Methods技术综述从点云、体素到 NeRF 与 3D Gaussian Splatting摘要3D 表示3D Representation是计算机视觉Computer Vision、计算机图形学Computer Graphics、机器人Robotics、自动驾驶Autonomous Driving以及具身智能Embodied AI的核心基础技术之一。其目标是将真实世界中的三维空间转换为计算机可以存储、理解、推理和渲染的数据结构。随着深度学习和生成式 AI 的发展3D 场景表示经历了从显式几何表示Explicit Geometric Representation到隐式神经表示Implicit Neural Representation再到可实时渲染的神经场表示Neural Rendering Representation的发展过程。当前主流方法包括RGB-D 图像RGB-D Image点云Point Cloud体素Voxel网格Mesh有符号距离函数Signed Distance Function, SDF神经辐射场Neural Radiance Field, NeRF3D 高斯泼溅3D Gaussian Splatting, 3DGS三平面表示Tri-Plane Representation混合神经表示Hybrid Neural Representation这些方法在几何精度、计算效率、语义理解能力和实时渲染能力之间存在不同权衡。相关综述工作系统总结了 Voxel、Point Cloud、Mesh、SDF、NeRF 和 3D Gaussian Splatting 等主要路线的发展。citeturn0academia91. 3D 表示概述Overview of 3D Representation1.1 什么是 3D 表示What is 3D Representation3D 表示3D Representation是指利用某种数据结构描述三维世界中的几何结构Geometry空间关系Spatial Relationship外观信息Appearance语义信息Semantic Information例如一个真实物体一个咖啡杯计算机需要知道它在哪里它是什么形状它是什么材质从不同角度观察时是什么样子是否可以被机器人抓取因此一个完整的 3D 表示通常包含Scene(Geometry,Appearance,Semantic)Scene(Geometry,Appearance,Semantic)Scene(Geometry,Appearance,Semantic)其中信息含义Geometry三维形状、空间位置Appearance颜色、纹理、光照Semantic类别、功能、用途2. 3D 表示方法分类Taxonomy of 3D Representation当前 3D 表示主要分为三大类类别英文名称代表方法核心思想显式表示Explicit RepresentationPoint Cloud、Voxel、Mesh、3DGS直接存储空间结构隐式表示Implicit RepresentationSDF、NeRF通过函数描述空间混合表示Hybrid RepresentationNeRF3DGS、Feature Field结合几何与神经网络3. RGB-D 图像表示RGB-D Image Representation3.1 基本介绍RGB-D 图像RGB-D Image是最直接的一种三维表示方式。它将RGB 彩色图像Depth 深度图组合在一起。表示形式I(x,y)(R,G,B,D)I(x,y)(R,G,B,D)I(x,y)(R,G,B,D)其中R,G,BR,G,BR,G,B颜色信息DDD深度距离。3.2 三维恢复过程通过摄像机参数K[fx0cx0fycy001]K\begin{bmatrix}f_x0c_x\\0f_yc_y\\001\end{bmatrix}K​fx​00​0fy​0​cx​cy​1​​可以将二维像素转换为三维点PdK−1[u,v,1]TPdK^{-1}[u,v,1]^TPdK−1[u,v,1]T因此 RGB-D 本质使用二维像素位置 深度信息恢复三维空间。3.3 典型模型模型年份特点KinectFusion2011实时 RGB-D 三维重建ElasticFusion2015非刚性 SLAMBundleFusion2017高精度室内重建3.4 优点获取成本低数据结构简单实时性强。3.5 缺点依赖深度传感器遮挡严重室外环境困难。3.6 应用主要用于RGB-D SLAMAR/VR室内机器人三维扫描4. 点云表示Point Cloud Representation4.1 基本介绍点云Point Cloud是机器人和自动驾驶领域最常见的 3D 表示方式。它使用大量三维点描述空间。形式P{p1,p2,...,pN}P\{p_1,p_2,...,p_N\}P{p1​,p2​,...,pN​}其中pi(xi,yi,zi,ci)p_i(x_i,y_i,z_i,c_i)pi​(xi​,yi​,zi​,ci​)4.2 数据来源主要包括1. LiDAR激光雷达直接测量距离。2. RGB-D通过深度反投影生成。3. 多视角重建Structure from MotionSfM。4.3 典型模型模型年份贡献PointNet2017首次直接处理无序点集PointNet2017层次化点云学习PointCNN2018点云卷积Point Transformer2021Transformer 建模点云4.4 优点不需要规则结构保留真实几何适合大规模环境。4.5 缺点无拓扑关系数据稀疏难以直接渲染。4.6 应用自动驾驶LiDAR 感知机器人导航三维检测5. 体素表示Voxel Representation5.1 基本思想体素Voxel是三维空间中的像素。二维Pixel(x,y)Pixel(x,y)Pixel(x,y)三维Voxel(x,y,z)Voxel(x,y,z)Voxel(x,y,z)空间被划分为规则网格------ | | | ------ | | | ------5.2 类型Occupancy Voxel表示空间是否被占据V(x,y,z)∈{0,1}V(x,y,z)\in\{0,1\}V(x,y,z)∈{0,1}TSDF截断符号距离F(x,y,z)dF(x,y,z)dF(x,y,z)d5.3 典型模型模型作用VoxNet3D CNN 分类OctNet高效八叉树体素SparseConvNet稀疏三维卷积5.4 优点结构规则可以使用 CNN适合空间推理。5.5 缺点核心问题三维空间爆炸问题Curse of Dimensionality例如100031091000^310^910003109需要巨大存储。5.6 应用自动驾驶占据网络医学三维成像机器人地图6. 网格表示Mesh Representation6.1 基本思想Mesh网格使用顶点 Vertex边 Edge面 Face描述物体表面。数学M(V,E,F)M(V,E,F)M(V,E,F)6.2 典型算法方法作用Marching Cubes从体数据提取表面Poisson Reconstruction点云生成 MeshDMTet神经生成 Mesh6.3 优点表面质量高工业标准渲染效率高。6.4 缺点拓扑维护困难动态场景困难。6.5 应用游戏CAD影视3D 打印7. 隐式函数表示Implicit Function Representation7.1 基本思想传统方法存储表面在哪里。隐式方法学习一个函数判断空间状态。形式f(x,y,z)sf(x,y,z)sf(x,y,z)s8. SDF 表示Signed Distance Function Representation8.1 基本思想SDF 使用距离表示物体表面。定义f(x,y,z)df(x,y,z)df(x,y,z)d其中值意义d0d0d0物体外部d0d0d0表面d0d0d0内部8.2 典型模型模型年份DeepSDF2019Occupancy Network2019NeuS2021VolSDF20218.3 优点几何精确连续表达可生成 Mesh。8.4 缺点优化复杂渲染速度较慢。9. NeRF 表示Neural Radiance Field9.1 基本思想NeRFNeural Radiance Field使用神经网络表示空间颜色和密度。函数Fθ(x,y,z,θ,ϕ)→(c,σ)F_\theta(x,y,z,\theta,\phi)\rightarrow(c,\sigma)Fθ​(x,y,z,θ,ϕ)→(c,σ)其中x,y,zx,y,zx,y,z位置θ,ϕ\theta,\phiθ,ϕ视角ccc颜色σ\sigmaσ密度。9.2 代表论文NeRF: Representing Scenes as Neural Radiance Fields for View SynthesisMildenhall et al., 20209.3 典型改进模型改进Mip-NeRF抗锯齿Instant-NGP高速训练Zip-NeRF高质量渲染9.4 优点新视角生成质量极高连续空间真实感强。9.5 缺点训练慢几何提取困难。10. 3D Gaussian Splatting 表示3DGS10.1 基本思想3D Gaussian Splatting3DGS使用大量三维 Gaussian 表示场景。该方法于 2023 年提出通过显式 Gaussian 基元实现高质量实时渲染被认为是 NeRF 之后的重要方向。turn0academia1210.2 数据结构每个 Gaussiangi(μi,Σi,αi,ci)g_i(\mu_i,\Sigma_i,\alpha_i,c_i)gi​(μi​,Σi​,αi​,ci​)参数含义μ\muμ中心位置Σ\SigmaΣ尺度和方向α\alphaα透明度ccc颜色10.3 代表论文3D Gaussian Splatting for Real-Time Radiance Field RenderingKerbl et al., SIGGRAPH 202310.4 优点相比 NeRF训练快实时渲染显存效率更好。10.5 应用VR数字孪生机器人建图三维内容生成11. 当前主流 3D 表示方法综合比较方法表示类型几何能力语义能力实时性主要用途RGB-D显式⭐⭐⭐⭐⭐⭐⭐⭐SLAMPoint Cloud显式⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐自动驾驶Voxel显式⭐⭐⭐⭐⭐⭐⭐⭐⭐空间理解Mesh显式⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐工业建模SDF隐式⭐⭐⭐⭐⭐⭐⭐⭐⭐高精度重建NeRF隐式⭐⭐⭐⭐⭐⭐⭐⭐⭐新视角生成3DGS显式神经表示⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐实时渲染12. 面向未来 AI 机器人的发展趋势未来机器人系统不会只依赖单一 3D 表示而更可能采用组合形式RGB / RGB-D | ↓ 3D Foundation Model | ↓ Semantic 3D Representation | ↓ Policy Model (Diffusion / VLA) | ↓ Robot Action趋势方向目标3D Foundation Model获得通用三维理解3D Gaussian高质量实时环境表示NeRF真实世界建模VLA语言驱动机器人World Model预测未来世界总结当前 3D 表示的发展路线可以概括为Point Cloud→Voxel→Mesh→SDF→NeRF→3D Gaussian Splatting \textbf{Point Cloud} \rightarrow \textbf{Voxel} \rightarrow \textbf{Mesh} \rightarrow \textbf{SDF} \rightarrow \textbf{NeRF} \rightarrow \textbf{3D Gaussian Splatting}Point Cloud→Voxel→Mesh→SDF→NeRF→3D Gaussian Splatting其中Point Cloud解决“空间在哪里”Voxel解决“三维空间结构”Mesh解决“表面几何”SDF解决“连续几何表达”NeRF解决“真实世界视觉重建”3D Gaussian Splatting解决“高质量实时三维渲染”。未来具身智能Embodied AI的核心方向将是3D 几何表示 语义理解 世界模型 策略学习Policy Learning的融合而不是单纯追求某一种 3D 表示。
返回列表