3DGS,这一次,我们全都要
近几年的三维视觉领域,没什么比3DGS更能称得上顶流的了。但热闹归热闹,过去几年,3DGS一直处在一个尴尬的境地:能看,但不好用,能做出来,但用不起来。
画质好的,数据量大到普通设备跑不动;加载流畅的,细节却丢了;能拍大场景的,精度不够;精度高的,拍摄门槛高得离谱。多项核心性能如何兼得,是全行业共同探索的方向。
为了让3DGS更加通用,我们正在不断拓宽3DGS的能力边界。
细节与流畅,不必再二选一
很多人对3DGS有一个误解:输入大,高斯点多,画面越清晰。但,真正决定画质的,是高斯点的分布效率,而非绝对数量。
简单说就是——该精细的地方精细,该节省的地方节省。
墙面、天花板这种平坦区域,用少量大高斯点覆盖就行;文字、雕花、纹理边缘,精准生成小高斯点抠细节。
当每一个高斯点都被置于合适的位置、发挥精准的作用,模型便能在保持高质量画面的同时,实现大幅度的数据精简。
同一个场景,更精细的表现,文件体积只有原来的1/4-1/5,意味着什么呢?
加载时间随之缩短,中低端设备也能流畅运行。换句话说,“清晰”这件事,不再需要靠堆硬件、堆存储、堆算力来换。
从一间房到一座园区,大场景装得下、跑得动
大场景是3DGS绕不开的一道坎。从一间房到一个园区,难点远不止数据变多:空间关系更复杂、训练成本成倍上升,或者是模型大到跑不动——要么显存被撑爆,要么被迫牺牲细节。
我们的思路是把大问题拆成小问题,再拼回一个整体:
把大型空间切成多个规模可控、可独立训练的分块,让每一块都获得充分的高斯表达,最后统一对齐、融合成连续完整的真实空间。场景规模因此不再受单次训练上限的约束,可以随分块持续扩展。
拆得开,也合得上。我们设计了一套“粗调定骨架、微调制细节、轻量级完美对齐”的自研管线,既保留了微米级的雕花字迹,又彻底消除了分块接缝,拼成一个严丝合缝的完整世界。
更大的意义在于“跑得动”。用户可以像看流媒体视频一样走进一个大型空间,而不是等它全部加载完。
当单体重建走向可扩展、可流式呈现的大型真实空间,3DGS才能从展厅里炫酷demo,走进住宅、园区、工业设施这些需要“用起来”的场景。
随手拍,也可以是3DGS的起点
诚然,搭载LiDAR的专业空间采集设备是目前3DGS最高效的产出来源——如视伽罗华P4、庞加莱R1等自研设备,在3DGS重建效果上均有出色表现。
但是,真实世界的三维重建,不应该只属于专业设备。我们正在把 3DGS 的输入能力进一步扩展到全景图、全景视频、单反照片、普通针孔图像与视频等纯视觉数据。
传统纯视觉方案靠特征提取、特征匹配、多阶段几何求解来“猜”出这些信息,一旦遇到重复纹理、低特征的大空间、共视区域不足,就很容易失稳。我们换了一条路:让大模型直接“看”懂空间。
基于积累的大规模真实空间数据,自研Argus空间大模型能从多视角视觉输入中做前馈式空间推理,一次得到图像位姿、深度、点云等关键信息,为后续3DGS建立稳定的空间先验。
在内部对比验证里,那些容易让传统方法翻车的场景——重复弱纹理、低特征大空间、低共视区域——Argus反而表现得更稳。
当空间理解从逐帧计算变成模型一步到位,重建的输入门槛被真正拉低。一部手机、一台全景相机、一组单反照片......这些日常就在手边的素材,都能成为通往三维空间的新入口。
不止于“看”,更是空间智能的基石
三维重建的价值,从来不只停留在“视觉效果”本身。
当3DGS能够以更低门槛覆盖更大场景、保留更多细节时,它便不再只是一个可视化工具,而是空间智能的基础设施。可测量的真实尺度、可编辑的空间结构、可理解的语义信息——这些隐藏在视觉背后的数据资产,才是真正具有长期价值的部分。
从更广的维度看,纯视觉3DGS路线正在打开比传统LiDAR路线更广阔的战略纵深:
世界模型数据飞轮。 传统LiDAR管线依赖专业车队与团队采集,数据总量有限、更新缓慢;而纯视觉3DGS可以吸收互联网海量的公开视频、街景与开源图像,构建互联网级规模的3D世界模型,让空间数据的积累从“线性增长”走向“指数飞轮”。
虚实共生与场景泛化。 LiDAR只能数字化真实存在的物理环境;而结合AI生成图像,纯视觉3DGS可以快速创造数以亿计的合成训练场景,为机器人提供长尾极端环境的训练场——从地震废墟到极夜暴雪,不再受现实采集条件的限制。
具身智能仿真。 纯视觉3DGS保留了逼真的光影反光特性,让机器人在仿真环境中的视觉感知与真实世界几乎100%吻合,实现Zero-shot Sim2Real的跨越——在虚拟环境里学会的技能,可以直接迁移到真实世界。
空间计算与LLM交互。 纯视觉管线天然易于与2D/3D视觉语言大模型(VLM/MLLM)联合,将图像中的语义特征直接嵌入高斯点,让空间从“可看”走向“可理解、可对话、可编辑”。未来的空间,不只是被记录,而是可以被询问——查询某个区域、定位某个物体、编辑某个结构,都将成为可能。
这也是我们在算法优化、数据表达和工程化落地上持续投入的根本原因——我们不仅仅在做一个“好看”的3D场景,而是在构建让机器理解空间、让空间赋能智能的底层能力。
真实世界,值得被更好地记录、理解和交互。现已开放内测,扫码联系我们,体验你的第一段3DGS。


