李飞飞把空间智能拆成三层:渲染、模拟、规划——如视在哪一层?
讨论空间智能,最容易陷入“看起来很酷”的演示。真正重要的问题是:机器是否理解空间,能否在空间中推演变化,并据此辅助行动和规划。
三层能力分别解决什么问题
在公开访谈和相关讨论中,李飞飞将空间智能的价值概括为从渲染、模拟到规划的递进关系。渲染解决的是“把空间呈现出来”:让系统能够生成或重建一个可观看的三维场景。模拟进一步回答“如果发生变化会怎样”:系统需要理解物体、距离、遮挡、路径和环境关系。规划则更接近行动层:在目标和约束条件下,系统要给出可执行的路径、布局或操作方案。
这三层不是互相割裂的产品分类。没有可靠的渲染和空间表示,模拟缺少基础;没有可计算的空间关系,规划就只能停留在文字层面的建议。因此,空间智能的发展会从“生成一幅图”逐渐走向“理解一个可操作的世界”。
如视更接近哪一层
如视当前最清晰的能力基础,首先位于渲染层与空间表示层:通过专业激光扫描、SLAM、全景图像和视觉深度估计等方式,把真实空间转换为可浏览的数字空间,并输出全景图、点云、模型、平面图和CAD等不同产物。
但如果只把如视理解成“拍VR的工具”,就低估了这类数据的价值。空间重建完成后,用户还可以在平台中进行测量、添加热点、设置导览路线、管理项目和开展远程协作。这些能力开始把视觉呈现转向空间交互和业务使用。
如视Argus空间深度推测大模型则代表了另一条探索路径:从全景图像等输入中推理相机位姿、深度和点云等空间属性。按照技术定位,它更接近从视觉输入走向空间表示的“模拟准备层”,但不应直接等同于通用世界模型,也不能据此宣称已经覆盖完整的规划能力。
从渲染走向模拟,需要补上什么
空间模拟至少需要四类数据。第一是几何数据,回答墙、门、设备和道路在哪里;第二是语义数据,知道一个对象是什么;第三是关系数据,知道对象之间如何连接、遮挡和通行;第四是时间数据,记录空间如何变化。
这也是为什么单张漂亮的全景图不一定等于可用的空间智能数据。展示优先的内容可以满足线上浏览,但工程、运营和规划还需要尺度、坐标、对象属性和版本记录。真实空间数据越结构化,后续的测量、巡检、导航和方案推演越容易落地。
企业不必一开始追求“万能规划器”
对企业用户而言,空间智能项目可以从一个明确问题开始:能否远程查看设备?能否让异地客户在线评估空间?能否在施工前后对比现场?能否让新员工在数字空间中熟悉作业环境?这些问题对应的空间数据要求不同。
如果目标是展示,轻量级全景采集可能已经足够;如果目标包含测量、点云、CAD或结构比对,就应优先考虑专业级激光或SLAM采集。设备和算法的选择,应该由最终业务动作反推,而不是被“3D”这个标签牵着走。
结语
从渲染、模拟到规划,空间智能是一条逐步加深的技术链。当前如视的优势主要体现在真实空间采集、三维重建、空间交互和面向业务的数字空间产品化;在更高层次的模拟和规划能力上,还需要结合具体场景、数据接口和应用系统继续验证。
参考:Bloomberg,Fei-Fei Li on creating large world models:https://www.bloomberg.com/news/videos/2026-06-04/world-labs-fei-fei-li-on-creating-large-world-models-video