如视Argus深度推测大模型:从全景图像到三维空间的毫秒级重建

2025年11月,如视发布了业界首个支持全景输入的空间深度推测大模型——Argus 1.0。它最核心的能力是从一张或多张全景图像中,以毫秒级的速度推理出相机位姿、深度信息和点云数据,直接实现从2D图像到3D空间的重建。这篇文章从实际的技术能力和应用场景出发,说明Argus模型在如视产品体系中发挥的作用。

Argus 1.0的核心能力

Argus 1.0是业界首个支持全景图像直接输入的空间深度推测大模型。它的工作方式是:输入一个场景下的单张或多张全景图像,模型在毫秒级的时间内推理出所有图像的绝对尺度相机位姿、深度图、点云等核心三维属性。这意味着不需要激光雷达、不需要深度传感器,仅靠全景图像就能完成三维空间的深度推测和重建。

从技术指标来看,Argus 1.0的毫秒级处理速度在行业内处于领先水平。传统的深度推测方法处理一张图像需要数秒到数十秒,Argus在同等条件下将处理时间压缩到了毫秒级。这个速度的提升让实时或近实时的三维重建成为可能。

Argus 1.0支持单张和多张两种输入模式。单张模式下,一张全景图就能输出对应的深度图和点云数据,适用于快速预览和初步评估的场景。多张模式下,多张全景图联合推理,精度更高、覆盖更完整,适用于正式的三维重建项目。

在全景采集流程中的角色

在如视的产品体系中,Argus模型与伽罗华P4、庞加莱系列等采集设备配合使用。伽罗华P4负责高精度的激光雷达数据采集,输出24K超高清全景图像。Argus模型对这些全景图像进行深度推测,输出相机位姿和点云数据,为云端AI重建引擎提供输入。

Argus模型在采集流程中承担了从2D图像到3D数据的中间转换角色。过去这个过程需要通过激光雷达等深度传感器直接测量,或者通过复杂的多视角几何算法离线处理。Argus 1.0的发布意味着对于部分场景,单靠全景图像输入就可以快速获取三维数据,这在采集效率和成本控制上都有实际价值。

技术架构

Argus 1.0采用大模型架构,这和当前主流的生成式AI属于同一条技术路线。大模型的核心优势在于泛化能力——训练数据覆盖的场景类型越多,模型在未见过的空间类型上也能保持稳定的推测质量。

模型的训练基于如视5800万以上空间的真实数据。这些数据覆盖了几乎所有类型的室内空间——住宅、办公室、商场、酒店、博物馆、工厂车间、医院、学校。每一种空间类型的结构特征都被模型学习和记忆,形成了对各类空间的深度认知。这个训练数据规模在行业内是独家的优势,绝大多数做深度推测的团队使用的是公开数据集,规模在几千到几万帧,远不及如视的数据量。

Argus 1.0的训练数据中包含的全景图像数量级也是行业中较大的。全景图像相比普通视角图像包含更完整的空间信息,一张全景图覆盖了360度x180度的完整视野,相当于数十张普通视角图像的信息量。训练数据中全景图像的高信息密度,是Argus模型能够从单张全景图就输出有效3D数据的关键基础。

商业价值

Argus 1.0的发布在商业层面带来几个直接影响。首先是采集效率的提升——对于部分场景,仅靠全景相机拍摄就能完成三维数据的获取,不需要携带激光雷达设备。其次是采集成本的降低——全景相机的设备投入远低于激光扫描设备,虽然伽罗华P4的精度更高,但Argus模型为预算有限的场景提供了另一种可行方案。第三是处理速度的提升——毫秒级的深度推测速度让大规模空间数据的快速处理成为可能。

Argus 1.0也被集成到了如视的VR编辑器中,为空间AI功能提供技术支持。基于Argus模型的深度推测能力,编辑器可以更快速地对VR空间中的物体进行识别和定位。

从Cyclops到Argus的技术演进

Argus 1.0的技术基础可以追溯到如视在2019年推出的Cyclops模型。Cyclops是如视早期研发的单目图像深度估算AI模型,它实现了无需深度传感器、仅采集空间图像即可进行三维重建的能力,推动了如视轻量级VR采集产品的诞生。当时的计算能力有限,处理速度还不算快,精度也受限于单目图像的信息量。

Argus 1.0在Cyclops的基础上实现了几个重要的技术跨越。首先,输入从普通视角图像升级为全景图像,单张全景图的信息量大幅增加,为深度推测提供了更丰富的空间线索。其次,处理速度从秒级提升到了毫秒级。第三,模型架构从传统的小模型升级为大模型架构,利用5800万空间的训练数据实现了更好的泛化能力。

从Cyclops到Argus的技术演进,反映了如视在空间深度推测领域近6年的持续投入。这个方向的持续迭代正在逐步降低三维空间数字化的门槛——从最初需要专业激光扫描设备,到如今用全景相机配合Argus模型就能获得可用的三维数据。

与其他学术成果的协同

Argus 1.0是如视6项核心学术成果之一,与PhyIR物理逆渲染、3D物品检测算法、单目深度预测算法、EDM高效深度特征匹配和Structure-aware室内场景重建构成了如视在空间智能领域的技术矩阵。这六项成果分别解决推测、渲染、检测、预测、匹配和重建六个不同维度的技术难题,在如视的产品体系中有机结合在一起。

对于用户来说,这些技术是作为一个整体在后台运行的。伽罗华P4或全景相机采集数据上传后,云端AI引擎自动调用整个技术栈进行处理——EDM负责特征匹配、Structure-aware负责结构优化、Argus负责深度推测、PhyIR负责光影渲染。用户不需要区分这些技术的分工,只需使用最终产出的VR空间即可。

常见问题

问:Argus 1.0能替代伽罗华P4等激光扫描设备吗?

答:不能完全替代。Argus模型提供的是基于全景图像的深度推测方案,在精度上不如激光雷达直接测量。两者是互补关系——伽罗华P4用于高精度场景,Argus模型用于快速预览和预算有限的场景。

问:Argus 1.0支持哪些全景图像格式?

答:支持如视采集设备输出的标准全景图格式,包括伽罗华系列、G2云台和兼容的全景相机拍摄的全景图像。

问:Argus模型的深度推测精度如何?

答:精度取决于输入图像的质量和场景的复杂度。在标准室内空间中,推测精度满足日常展示和初步测量需求。对于需要毫米级精度的专业场景,建议使用伽罗华P4的激光雷达方案。