3D Gaussian Splatting新方法InfiniSplat:隐式高斯解码实现大基线视图合成
2026/8/28 10:50:28 网站建设 项目流程

这次我们来看一个 3D Gaussian Splatting 方向的新工作:InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis。从标题就能看出,这篇工作要处理的是“大基线单目视图合成”。传统 3DGS 通常依赖多视角图像或者一段密集视频帧来重建场景,一旦视角间隔拉大、相邻图像之间的重叠区域变少,就会出现位姿不稳定、高斯点云稀疏、渲染图像出现空洞和撕裂的问题。InfiniSplat 的核心变化在于:把高斯属性从“直接可优化的参数”,改成一个“由隐式解码器生成的输出”,从而在输入视图非常有限、视角跨越很大的场景里,仍然能预测出相对完整的 3D 高斯表征。

这篇文章不打算只做标题翻译。我们会先花一小节把 3D Gaussian Splatting 的原理速通过一遍,再看 InfiniSplat 在哪个环节做了改动,然后给出本地部署、环境准备、数据准备、训练渲染验证、资源占用观察和常见问题的完整流程。如果你正在调研 3DGS 方向的新方法,或者想复现这篇工作跑自己的数据,可以直接按这里的思路往下走。

先给结论:InfiniSplat 适合的场景是“输入图像数量不多、视角跨度大、但又希望用 3DGS 做高质量新视角合成”的研究和工程验证。它不是一个开箱即用的产品级工具,而是一个方法实现,需要自己准备数据集、训练模型、评估效果。所以这篇文章会围绕论文复现和本地实验展开,不会编造一键启动包和现成 API。

1. 核心能力速览

能力项说明
项目类型3D 高斯泼溅方向的学术方法实现,面向新视角合成任务
任务定位Large-Baseline Monocular View Synthesis,大基线单目视图合成
核心方法Implicit Gaussian Decoding,隐式高斯解码
输入形式单目相机采集的一组图像,或经过预处理的稀疏视角图像集
输出形式3D 高斯场景表示,可用于新视角渲染
基础框架基于 3D Gaussian Splatting(3DGS)的研究管线
训练方式需要训练隐式解码网络,不是纯几何优化
评估指标常见指标为 PSNR、SSIM、LPIPS,具体以官方仓库为准
是否支持 API研究项目通常没有现成 HTTP API,可自行封装
是否支持批量任务可按图像序列批量训练,但需要设计任务队列
硬件门槛需要 NVIDIA GPU,显存需求需按实际模型和数据规模测试
开源状态以论文发布时的官方仓库为准,本文不假设仓库地址

从表格里的信息可以看出来,InfiniSplat 的方法属性大于工具属性。它和常见的 Stable Diffusion WebUI、ComfyUI 工作流不一样,不是“下载即用”的类型。你要自己处理数据、训练模型、再做渲染验证。

2. 3D Gaussian Splatting 原理速通

要理解 InfiniSplat,得先知道 3DGS 在做什么。很多新手第一次看 3DGS 会被“高斯泼溅”这个词吓到,其实它做的事情很直接:用一堆 3D 高斯原语来表示一个场景,然后通过可微渲染把场景投影到 2D 图像上,再拿渲染结果和真实图像做损失,反向优化这些高斯原语的属性。

2.1 高斯原语表示

一个 3D 高斯原语通常包含这几个属性:中心位置μ、协方差矩阵Σ、颜色c、透明度α。协方差矩阵Σ可以分解成旋转矩阵R和缩放矩阵S的组合,方便优化。颜色通常用球谐系数表示,这样在不同视角下能看到不同的光照反射效果。

渲染时,每个 3D 高斯会被投影到图像平面,变成一个 2D 高斯分布,然后按照从近到远的顺序做 alpha 合成。这个过程的数学形式和传统 volume rendering 很像,但因为全部操作都是可微的,所以可以用梯度下降直接优化。

2.2 3DGS 的标准管线

经典的 3DGS 流程是这样:

  1. 用 COLMAP 或者类似 SfM 工具,从输入图像中估计相机位姿,同时生成一个稀疏点云。
  2. 用稀疏点云初始化高斯位置。
  3. 在训练过程中不断优化每个高斯的属性,同时根据梯度信息做 densification,也就是在不满足重建质量的地方分裂或者复制高斯。
  4. 渲染时,将所有高斯按深度排序并做 alpha 合成。

这套管线在输入图像密集、视角覆盖完整的场景里效果非常好,Real-time 渲染速度也很快。它的问题在于:一旦输入图像是稀疏的、视角跨度大,SfM 就很难产生足够密集且准确的稀疏点云。点云一旦稀疏,初始化出来的高斯数量就少,场景会有大量区域没有被覆盖,训练时也就没有梯度去填充这些空洞。

2.3 传统 3DGS 在单目大基线下的问题

“大基线单目”这个条件,对 3DGS 是双重打击。

第一重打击是位姿估计不稳定。相邻图像基线越大,特征匹配的难度越高,COLMAP 输出的相机位姿可能带有明显误差。位姿不准,后续所有高斯的投影位置都不准,渲染结果自然差。

第二重打击是覆盖不足。基线大意味着两帧之间有很多区域只出现在其中一帧里,另一帧看不到。对于 3DGS 来说,一个高斯必须被至少两个视角观察到,才能稳定估计它的位置。只能被一个视角看到的高斯,深度方向是高度不确定的,直接训练很容易产生“漂浮物”或者背景拉伸。

所以大基线单目视图合成的关键,不是继续沿用原来的点云初始化和逐高斯优化策略,而是要想办法从有限的输入中推断出“没有直接观察到的区域长什么样”。InfiniSplat 要做的,就是通过隐式高斯解码来解决这个问题。

3. InfiniSplat 的任务定义与解决思路

3.1 任务难点拆解

从任务名来看,InfiniSplat 的输入是单目图像序列,输出是 3D 高斯场景表示,最终目标是新视角合成。这里最重要的问题是:如何在稀疏视角下让模型具备“想象”能力。

常规 3DGS 的每个高斯都是独立参数,训练时只靠当前场景的梯度更新。这种方式在数据密集时没问题,在数据稀疏时就有问题:模型没有跨场景的泛化能力,每个新场景都要从零开始优化,而且优化过程中缺乏对三维结构的先验约束。

InfiniSplat 的改进点在于引入隐式解码机制。也就是说,高斯属性不是直接作为优化变量存在的,而是由一个网络从某种中间表征中解码出来的。这样网络就可以在训练过程中学到“什么样的局部特征应该对应什么样的几何结构和外观”,从而把单目图像里的纹理线索、深度线索和语义线索利用起来,填补大基线带来的信息空洞。

3.2 隐式高斯解码的设计思路

虽然官方论文的具体网络结构需要以原文和代码为准,但从“Implicit Gaussian Decoding”这个词组可以推断出它的基本设计思路。

首先,输入图像会被送入一个特征提取网络,得到多尺度的 2D 特征图。然后,通过对稀疏点云或者查询点进行投影,从 2D 特征图中采样对应的特征向量。接下来,这些特征向量会被送入一个隐式解码器,回归出每个查询点位置的高斯属性,包括位置偏移、协方差矩阵、颜色和不透明度。在渲染阶段,仍然沿用 3DGS 的可微泼溅渲染,把解码出来的高斯投影到 2D,和真实图像计算损失。

这个设计和 NeRF 系列的“隐式场景表示”有相似之处,两者都是通过网络回归场景属性。但 InfiniSplat 的输出不是连续的辐射场,而是一组离散的 3D 高斯原语。换句话说,它保留了 3DGS 高效渲染的优点,又获得了隐式方法对稀疏输入更强的泛化能力。

3.3 整体流程

从使用角度看,InfiniSplat 的整体流程可以概括为:

  1. 数据准备:用单目相机拍摄或收集一组图像,用 COLMAP 估计位姿并生成初始点云。
  2. 特征提取:将输入图像送入特征提取网络,生成特征图。
  3. 隐式解码:在点云或者采样查询点上,从特征图中采样特征,再通过解码器生成 3D 高斯属性。
  4. 可微渲染:用 3DGS 渲染器把高斯泼溅到图像平面,计算渲染损失。
  5. 优化:反向传播更新特征提取网络和解码器参数,同时也可以对高斯位置做细粒度调整。

这套流程的好处是,模型见过的训练场景越多,它对新场景的初始化就越准。即使某个新场景的视角非常稀疏,模型仍然可以凭借学习到的先验,从少数图像中解码出相对合理的几何和外观。

4. 适用场景与使用边界

4.1 适合什么场景

InfiniSplat 最适合的研究和实验场景是:输入图像数量少、视角跨度大、单个物体或小场景的重建。典型的例子包括:

  • 用手机围绕一个物体拍 5 到 10 张照片,然后做新视角合成。
  • 室内小场景的多视角重建,输入是稀疏采样的图像。
  • 无人机或者手持相机拍摄的大基线视角图像,中间帧缺失严重。
  • 自动驾驶或者机器人领域,需要从稀疏视角预测新视角。

如果你有大量密集图像,传统 3DGS 已经能做得很好,InfiniSplat 在这种数据上的优势不会特别明显。它的价值恰恰在数据不足、视角不足的情况下体现出来。

4.2 不适合什么场景

  • 大规模城市级场景重建,这类任务通常需要分块处理和多视角融合,单模型直接做不现实。
  • 动态场景、包含大量运动物体的场景,3DGS 的动态扩展版本会更合适。
  • 实时交互级应用,如果模型需要每帧推理解码网络,帧率会受到影响,需要额外优化。
  • 对绝对精度要求极高的测绘、工业测量任务,隐式解码引入的先验可能带来偏差。

4.3 版权、隐私与安全边界

这里必须单独提醒。视图合成和 3D 重建技术可以用于物体、场景、人物肖像等数据的处理,但使用时必须遵守以下边界:

  • 采集和使用的图像、视频素材,要确保拥有合法授权。
  • 如果涉及人脸、人物肖像、私人空间,需要获得明确同意,不能用于伪造、欺骗或恶意用途。
  • 发布、商用重建结果前,要确认素材版权和肖像权。
  • 不要用该技术对受版权保护的模型、角色、产品进行未经授权的重建。

5. 环境准备与前置条件

复现 InfiniSplat 的环境准备,和大多数 PyTorch 3D 视觉项目类似。下面给出一套通用检查清单,具体版本需要以官方仓库的 requirements 为准。

5.1 硬件环境

  • NVIDIA GPU,建议显存不低于 8GB,具体取决于输入图像分辨率和批量大小。
  • 测试机器上建议安装 CUDA 11.8 或更高版本。
  • 磁盘剩余空间至少 20GB,数据集、中间输出和模型权重都会占空间。

5.2 软件环境

  • Ubuntu 20.04/22.04 或 Windows 10/11。
  • Python 3.8 到 3.10。
  • PyTorch 和对应版本的 CUDA。
  • COLMAP,用于位姿估计和稀疏点云生成。

5.3 通用环境安装命令

以下命令是通用模板,实际项目可能会有所不同,需要按官方仓库替换版本号:

# 创建虚拟环境 conda create -n infinisplat python=3.9 -y conda activate infinisplat # 安装 PyTorch,以 CUDA 11.8 为例 pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118 # 安装基础依赖 pip install opencv-python tqdm tensorboard

依赖安装有一个常见问题:submodules/diff-gaussian-rasterization这类可微渲染模块通常需要从源码编译,编译前需要确认 CUDA 环境变量正确,否则会报找不到 CUDA 的错误。如果是在 Windows 上编译,还需要对应版本的 Visual Studio C++ 工具链。

6. 安装部署与启动方式

因为 InfiniSplat 是论文复现项目,下面给出一套通用的部署流程。假设你已经从官方渠道拿到了源码,并且仓库结构和常见 3DGS 项目类似。

6.1 克隆仓库与安装依赖

git clone https://github.com/your-official-source/infinisplat.git cd infinisplat conda activate infinisplat pip install -r requirements.txt # 编译可微渲染模块,模块名以仓库实际目录为准 pip install submodules/diff-gaussian-rasterization

如果仓库中使用了third_party或者submodules目录,需要逐个安装或者通过脚本一键安装。安装完成后,可以用下面的命令快速验证:

python -c "import torch; print(torch.cuda.is_available())"

输出为True,说明 PyTorch 能正常访问 GPU。

6.2 准备训练数据

以单目图像序列为例:

# 数据目录结构建议 data/ └── my_scene/ ├── images/ │ ├── 0000.png │ ├── 0001.png │ └── ... ├── sparse/ │ └── 0/ └── poses.txt

其中images/存放输入图像,sparse/存放 COLMAP 输出的相机位姿和稀疏点云,poses.txt并不是必须的,取决于代码读取方式。

6.3 运行 COLMAP 生成位姿

如果图像还没有位姿,可以用 COLMAP 命令行生成:

# 以图片文件夹运行为例 colmap feature_extractor \ --database_path data/my_scene/database.db \ --image_path data/my_scene/images colmap exhaustive_matcher \ --database_path data/my_scene/database.db mkdir -p data/my_scene/sparse colmap mapper \ --database_path data/my_scene/database.db \ --image_path data/my_scene/images \ --output_path data/my_scene/sparse

COLMAP 处理完成后,需要把稀疏模型导出为 TXT 格式:

colmap model_converter \ --input_path data/my_scene/sparse/0 \ --output_path data/my_scene/sparse/0 \ --output_type TXT

对于大基线数据,COLMAP 可能无法估计出完整的位姿。遇到这种情况,可以尝试使用sequential_matcher代替exhaustive_matcher,或者手动给定位姿文件。InfiniSplat 的很多实验价值正是在这种情况下体现的,位姿不全时,它的隐式解码先验可以补上部分几何信息。

6.4 训练模型

训练命令需要以官方仓库 README 为准,下面是一个通用模板:

python train.py \ --config configs/infinisplat.yaml \ --data_path data/my_scene \ --output_path output/my_scene

配置文件里面通常包含:输入图像分辨率、初始高斯数量、隐式解码器的隐藏层维度、学习率、迭代轮数、批大小、渲染分辨率等内容。

6.5 渲染新视角

训练完成后,渲染命令一般是:

python render.py \ --model_path output/my_scene \ --config configs/infinisplat.yaml \ --output_path output/my_scene/render

渲染脚本会读取训练好的模型,在测试视角上生成新视图,并输出图像。如果代码支持评估模式,还可以顺便计算 PSNR、SSIM、LPIPS 等指标。

7. 功能测试与效果验证

7.1 测试目标

部署完成后,第一步不是直接上自己的复杂数据,而是先跑通一个小场景,验证四个问题:

  1. 训练是否能顺利开始,loss 是否下降。
  2. 渲染脚本是否能正常输出图像。
  3. 评估指标是否在合理范围。
  4. 显存占用是否符合预期。

7.2 小场景快速验证

建议从公开数据集里选择一个场景,或者自己拍 5 到 10 张图,分辨率控制在 800x800 以内,训练迭代次数降低到默认值的一半左右。这样做的目的是快速发现代码和环境的坑,而不是第一次就追求完美效果。

跑通后可以这样判断:

  • 如果训练 loss 稳步下降,说明前向和反向传播都正常。
  • 如果渲染输出的图像在训练视角上接近原图,在中间视角上能看到完整结构,说明隐式解码器确实学到了场景先验。
  • 如果 PSNR 在测试集上明显高于传统 3DGS 在稀疏输入上的结果,说明 InfiniSplat 的方法改进有效。

7.3 大基线效果验证

InfiniSplat 的核心卖点是大基线,所以验证时一定要设计大基线对比实验:

  • 方案一:从一段连续视频中每隔 5 帧抽一帧,作为稀疏输入。
  • 方案二:从一段连续视频中每隔 20 帧抽一帧,作为大基线输入。
  • 方案三:直接把相邻视角之间的重叠率控制在 30% 以下。

然后分别用同一个训练配置跑 InfiniSplat 和一个基础 3DGS 基线,对比两组测试视角上的渲染结果。这里要重点看两个地方:一是大视角切换时能不能保持物体结构连续,二是遮挡区域是不是会出现明显的“胶状拖影”或者空洞。

7.4 判断成功的标准

  • 新视角下的物体边缘干净,没有明显重影。
  • 相机快速横移时,背景没有“融化”和“拉伸”。
  • 纹理重复区域没有出现严重错位。
  • 从稀疏输入解码出的高斯点云在三维空间中是致密的,而不是集中在少数视角附近。

7.5 失败时的排查方向

如果训练后渲染质量很差,先检查这几个点:

  • 输入图像的位姿是否准确,COLMAP 输出的位姿如果发散,后续所有工作都会受影响。
  • 训练分辨率是否太低,低分辨率会丢失纹理细节。
  • 迭代次数是否足够,隐式解码网络需要更多迭代才能收敛。
  • 高斯初始化是否合理,如果初始点云过于稀疏,解码器没有足够的查询位置来覆盖场景。
  • 学习率是否过大,3DGS 类项目的学习率设置比较敏感,过大会导致几何崩溃。

8. 接口 API 与批量任务

8.1 是否有现成 API

从目前公开信息看,InfiniSplat 是学术研究项目,大概率不会直接提供 HTTP API。你拿到的仓库应该只有训练、渲染、评估的 Python 脚本,没有server.py或者api.py这类文件。

如果你希望把训练好的模型接入到自己的工具链中,可以自己包装一个推理服务。下面给出一段通用 FastAPI 封装示例,但接口路径、请求参数、返回格式都需要根据你实际下载的模型代码调整。

8.2 FastAPI 推理服务封装模板

import torch from fastapi import FastAPI, UploadFile, File, Form from io import BytesIO from PIL import Image from model import create_model from render import render_view app = FastAPI() model = None device = "cuda" if torch.cuda.is_available() else "cpu" @app.on_event("startup") def load_model(): global model model = create_model() checkpoint_path = "./output/my_scene/checkpoint.pth" model.load_state_dict(torch.load(checkpoint_path, map_location=device)) model.to(device) model.eval() @app.post("/render") async def render( image: UploadFile = File(...), pose: str = Form(...), ): content = await image.read() img = Image.open(BytesIO(content)).convert("RGB") pose_matrix = eval(pose) # 生产环境请不要用 eval,应改为 JSON 解析 output = render_view(model, img, pose_matrix, device) return {"success": True, "shape": output.shape}

这个模板只展示了一个基本思路,生产环境需要改成 JSON 传输姿态矩阵、添加鉴权、限制请求大小、做异常重试。

8.3 批量训练任务

批量任务的思路是按场景分目录管理数据,然后写一个脚本遍历所有场景,依次启动训练进程。建议输出目录按以下格式组织:

output/ ├── scene_001/ │ ├── checkpoint.pth │ └── render/ ├── scene_002/ │ ├── checkpoint.pth │ └── render/ └── train.log

批量训练时要注意 GPU 显存释放问题。如果训练脚本没有在每次训练结束后显式清理 CUDA 缓存,连续跑多个场景时显存会逐步增加。建议在场景切换之间加上:

import torch torch.cuda.empty_cache()

8.4 失败重试建议

批处理任务里,单个场景失败不应该中断整个队列。可以在外层脚本加 try-except,把失败场景记录到日志里,最后统一查看:

python batch_train.py --data_root data/batch --output_root output/batch 2>&1 | tee batch_train.log

如果某个场景因为 OOM 失败,可以单独降低该场景的分辨率或者迭代次数重试。

9. 资源占用与性能观察

9.1 显存观察方法

训练过程中开一个终端,实时监控 GPU 资源:

watch -n 1 nvidia-smi

需要重点观察两类值:Memory-UsageVolatile GPU-Util。显存占用决定了能不能继续加大分辨率,GPU 利用率则能判断是训练代码瓶颈还是显卡算力不够。

9.2 影响资源占用的因素

  • 输入图像分辨率:分辨率从 800 提高到 1600,显存占用会超过翻倍。
  • 高斯数量:3DGS 训练过程中会动态增加高斯数量,这会让显存使用曲线呈阶梯状上升。
  • 隐式解码网络的宽度和深度:网络越大,前向推理和反向传播的显存开销越大。
  • 批大小:批大小是显存占用的线性乘数,OOM 时优先把它降到 1。
  • 渲染分辨率:如果训练和渲染都使用高分辨率,显存压力主要在反投影梯度的计算上。

9.3 如何降低显存占用

  • 把图像 resize 到 640x640 或者 512x512 先跑通流程。
  • 减小隐式解码器的隐藏层宽度。
  • 降低批大小到 1。
  • 使用梯度检查点技术,以训练时间换显存空间。
  • 如果训练时出现 OOM,关掉其他占用显存的进程,比如浏览器硬件加速、其他训练任务。

9.4 性能观察记录

建议每次实验都记录一份运行日志,包括数据规模、分辨率、迭代次数、显存峰值、单次迭代耗时、最终 PSNR。这样后续调参和对比不同场景时会非常方便。

10. 常见问题与排查方法

问题现象可能原因排查方式解决方案
训练一开始就 OOM输入分辨率过高、批大小过大、高斯数量增长过快查看显存占用曲线,定位 OOM 发生阶段降低分辨率、批大小设为 1、限制最大高斯数量
CUDA 编译失败缺少 C++ 工具链、CUDA 版本不匹配查看编译日志,确认 nvcc 版本安装匹配版本的 Visual Studio 或 GCC,切换 CUDA 环境
COLMAP 位姿发散大基线图像特征匹配失败查看 sparse 模型相机数量,用 GUI 检查位姿改用 sequential_matcher、手动提供位姿、增加图像数量
渲染结果有大量空洞高斯初始化点云稀疏、隐式解码器未收敛检查初始点云密度和训练 loss增加初始点数量、延长迭代、提升解码器容量
训练 loss 不下降学习率过大、特征提取网络梯度消失查看 loss 曲线、检查梯度范数降低学习率、调整网络初始化、检查特征归一化
输出新视角有重影和拖影大基线几何不存在、高斯协方差退化检查训练视角覆盖范围、查看高斯椭球形状增加输入视角、限制高斯各向异性、提高位置损失权重
模型加载时权重不匹配官方权重版本与代码不一致打印 model 和 checkpoint 的 key 对比使用同版本代码、重新训练模型
批量任务在某个场景卡死数据路径错误、数据缺失、死锁观察日志输出到哪个场景在该场景前加异常处理和超时重启

11. 最佳实践与使用建议

11.1 第一次实验不要追求效果

第一次跑 InfiniSplat,不要直接上高分辨率、大场景、完整数据。建议用 5 到 8 张低分辨率图像,把流程跑通。跑通之后再逐步加大数据规模。这样能帮你快速区分“环境问题”和“算法问题”。

11.2 保留最小可用配置

当你在某个场景上得到了一组能工作的配置,把配置文件和运行命令备份到一个固定目录。后续遇到新场景失败时,先用这套配置验证,再逐步调整,避免一次改太多参数导致无法定位问题。

11.3 数据结构化

建议按下面的结构管理实验:

project/ ├── configs/ │ ├── infinisplat_default.yaml │ └── infinisplat_large_scene.yaml ├── data/ │ ├── scene_001/ │ └── scene_002/ ├── output/ │ ├── scene_001/ │ └── scene_002/ └── logs/ ├── train_scene_001.log └── eval_scene_001.log

11.4 位姿质量优先于模型调参

对于大基线输入,位姿是所有后续工作的地基。如果 COLMAP 输出的位姿不稳定,花再多时间调模型参数都没用。可以先做一件事:用传统 3DGS 在同样的稀疏输入上跑一次,如果它的渲染结果已经出现明显畸变,说明位姿和数据本身就很难,此时 InfiniSplat 的优势更容易体现;如果传统 3DGS 都能做好,说明数据难度不足以验证方法价值。

11.5 合规使用提醒

复现实验时优先使用公开数据集,例如多视角物体数据、NeRF 系列公开场景、以及论文作者发布的测试数据。如果使用自己拍摄的数据,要确保拍摄对象和场景已获得必要授权。不要用未授权的人脸照片、私人空间、版权模型进行重建和发布。

12. 总结与下一步

InfiniSplat 最值得尝试的点,是它把 3DGS 从“每场景独立优化”扩展到了“带隐式先验的解码式生成”,这正好打在大基线单目视图合成的痛点上。如果你做的新视角合成任务经常遇到输入视图稀疏、位姿不稳定、图像覆盖不足,那这个方向值得深入往下看。

最先应该验证的功能,不是跑通整个训练流程,而是拿一组稀疏视角图片和一组密集视角图片做对比实验。重点看隐式解码在高斯数量增长、空洞填补、大视角切换这几个维度上的表现。最容易踩的坑有三个:一是 COLMAP 位姿在大基线数据上发散,导致后续无从谈起;二是可微渲染模块编译失败,环境卡住一整天;三是盲目上高分辨率导致 OOM,还没看到训练曲线就先被显存劝退了。

后续可以继续扩展的方向包括:把隐式解码器替换成更轻量的结构,验证实时渲染性能;在动态场景数据上测试是否具备时间维度的一致性;或者把训练好的模型封装成推理服务,接入到自动化三维内容生产管线里。建议收藏备用,等官方代码和权重发布后,可以第一时间用本文这套流程来复现验证。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询