文/VR陀螺 小鱼
近日,3D原生智能企业VAST宣布完成约30亿人民币B轮和B+轮融资。至此,不到半年的时间里,VAST累计融资约50亿人民币,刷新了3D原生智能领域融资额纪录。
本轮融资由经纬创投领投,完美世界、蓝色光标、芯动能投资、延趣游戏、中科创达、广电投资、三七互娱等一线产业资本,鼎晖VGC、中金资本、CMC资本、洪泰基金、三正健康投资、中平资本、福建产投基金、福创投、卓源亚洲、江西金控等一线财投联合参投,老股东达晨财智、春华资本、四三九九、慕华科创、绿洲资本、渶策资本、华控基金持续超额追投。
从投资阵容来看,本轮投资不仅有顶级VC,还有XR、游戏、文旅、影视、广告等产业资本的入局。其中,芯动能投资背后的京东方等企业和机构,位于XR供应链的上游,中科创达亦是XR行业的重要玩家。他们的加入,也侧面印证了VAST的价值在XR场景中正不断凸显。
眼下,XR行业的硬件基础正在逐渐成熟。从今年公布的新一代设备来看,部分VR/MR头显的重量已经可以降到260克以内,且近眼显示效果明显提升,最新一代MR设备还采用了Micro-OLED等高分辨率显示方案,单眼分辨率达到4K级,像素密度进一步提高。与此同时,Spatial AI开始支持3D生成、空间锚定和物体识别,头显对现实环境的感知与理解能力也在继续提高。

但硬件就绪后,内容供给便成为XR发展的一大难点。不同于传统互联网内容,XR需要的是一个三维世界。从游戏场景、虚拟角色,到数字人、工业仿真和沉浸式体验,都需要大量3D资产支撑。但传统3D制作依赖专业团队,成本高、周期长,难以满足未来XR应用规模化发展的需求。
https://res.vrtuoluo.cn/production/admin/uploads/20260904/1788486183369p2.0+preview国内.mp4
伴随着这轮融资,VAST推出Tripo P2.0 3D原生基础模型和StereoWorld双目世界模型,分别覆盖3D资产生成和立体世界生成等环节,将其产品能力进一步延伸到XR的「内容生产」。
在头显里「说」出世界,Tripo把创作搬进空间计算
过去的XR内容生产,很多时候是先要在电脑端完成建模,再经过材质、贴图、引擎导入、场景搭建和交互开发,最后才被送进头显。
等用户真正进入VR/MR空间时,看到的基本都是开发团队提前「预制」的内容,鲜少能自己直接参与到内容创作当中去。当3D生成模型被搬进了头显,用户无需研究复杂的3D软件,仅需直接在设备中提出需求,就可以实时生成自己想要的3D内容。
可究竟该怎么在头显里输出需求呢?目前不少VR/MR设备已经支持手柄、手势和眼动等交互方式,这些方式在选择、点击、拖拽和空间操控上已经相对成熟,但面对较长的Prompt输入,虚拟键盘的点击体验仍然谈不上顺畅。
针对这类痛点,Tripo将语音直接接入3D生成流程,用户戴上MR设备后,只需要说出需求,如「生成一盏台灯」或者「给我一座中世纪城堡」,内置Agent便会理解用户意图,并调用Tripo模型生成相应内容,从而将自然语言表达、3D生成与空间操作串联在同一个交互环境中。
不过,当3D模型真正进入XR环境之后,光会「生成」还远远不够。网页中的模型只要在视觉上成立基本就完成了任务,而MR中的虚拟物体的「空间关系」,也会直接影响虚拟内容能否真正融入现实空间。
对此,Tripo 进一步接入空间锚定、环境感知和物体识别等Spatial API,并结合原生GPU渲染,让生成内容能够与现实桌面、地面等环境建立相对稳定的位置关系,同时支持放置、堆叠和碰撞等物理交互。
在此基础上,Tripo还支持用户将多个生成物体组合成完整场景并发布到社区,让其他用户直接进入体验,3D生成的单位也由单个Asset进一步向Scene延伸。对于XR而言,这意味着过去高度依赖专业团队完成的部分场景搭建工作,开始出现由普通用户通过语音生成、摆放和组合内容的可能,从而为UGC内容生产提供一条门槛更低的路径。
数秒生成原生四边面,Tripo P2.0直面XR**「可用」难题**
在头显里通过一句话生成一个物体,听起来挺爽的。但对于XR开发者来说,生成的东西能不能用,是更为关键的事情。
相比传统PC游戏或者离线渲染,XR设备对3D资产的要求更为苛刻。一方面,头显受到算力、功耗和散热限制,还需要同时渲染左右眼画面;另一方面,场景中的物体经常需要被抓取、移动、缩放,甚至进一步进行骨骼绑定和动画驱动。因此,一个模型除了外形和纹理,还要考虑面数、Mesh结构以及后续编辑能力。

P2.0选择从面数控制入手,其支持500至50000个三角面,以及500至25000个四边面的范围控制,开发者可以根据移动VR、MR或者PC VR等不同终端调整模型复杂度,这项能力会直接影响同一场景能够承载多少物体,以及设备能否保持稳定帧率。
在控制模型面数之外,P2.0还把重点放在生成资产能否直接用于生产上。
过去不少AI 3D模型主要关注几何外形和视觉相似度,生成结果经常是结构杂乱的三角面碎网。这类模型虽然可以用于展示,却往往难以直接导入引擎,也无法顺利完成骨骼绑定和动画制作。美术人员仍要花费数小时重新整理Mesh和拓扑结构,AI缩短了生成模型的时间,却没有省去后续繁琐的加工过程。

P2.0将拓扑整理前移到模型生成阶段,可以在数秒内生成布线较为规整的四边面网格。四边面是影视和游戏制作中普遍采用的网格形式,更适合模型平滑、角色变形、骨骼绑定和动画制作。配合完整的UV、PBR材质和最高8K贴图,生成的模型可以直接导入Unity、Unreal等引擎,继续添加动画、物理效果和交互功能。

这使XR开发者拿到的3D模型从一份预览素材变成了可以继续投入生产的资产,也缓解了过去AI 3D模型「能看不能用」的问题。模型生成后可以更快进入引擎,随后完成动画绑定和交互开发,开发者无需在每一个环节重新加工资产。对于需要大量角色、道具和场景的XR内容生态来说,资产可用性的提升,才有可能把AI 3D的速度优势转化为更大规模的内容供给。

生成速度同样影响着AI 3D能否进入XR的实时交互场景。传统方式从零制作一个3D资产,往往需要数小时甚至数天,很难回应用户在虚拟空间中的即时需求。P2.0将四边面拓扑网格的生成时间压缩到数秒,用户输入语言指令后,模型可以迅速生成相应的3D物体。
当3D资产能够在数秒内完成生成并进入交互,XR内容也从开发者提前制作,走向用户在体验过程中即时创造。
让AI拥有「双眼」,StereoWorld处理空间一致性
当AI生成内容真正进入XR,空间稳定性会成为另一个绕不开的问题。
目前大量视频生成和世界模型仍以单目RGB内容作为训练和生成基础。但仅凭单张二维图像,很难唯一确定物体真实的距离和尺寸。
普通视频中,轻微的物体漂移、尺度变化或者局部形变,有时并不会立刻影响观看体验。但在XR环境里,用户会不断转头、移动,甚至绕到物体侧面和背后观察。一旦同一个物体在不同视角下出现位置漂移、结构变化或者深度关系错乱,用户很容易察觉,沉浸感也会随之被打断。

△左:单目depth warp+inpaint;右:StereoWorld双目生成
为了解决这些问题,VAST算法团队联合香港大学、PICO等机构开源了双目世界模型StereoWorld,相关论文发表于CVPR 2026。它可以根据单张图像、文字描述和相机运动指令,同时生成后续的左眼与右眼视频,让画面内容和双目几何关系在同一模型中共同演化。


双目视觉的价值来自左右视图之间细微的位置差异。相机焦距和双目基线已知时,视差可以直接对应真实尺度下的深度,相当于给生成过程加入一个稳定的三维「物理锚点」,从根本上缓解了模型的漂移和变形问题。

训练过程中,StereoWorld无需额外的深度图监督,仅使用RGB双目视频即可从左右视图之间的视差中学习几何关系。

同时通过Camera-Frame RoPE对相机内外参数和相对位姿进行建模,可支持相机汇聚,以及水平、垂直和深度方向上的不同双相机轨迹。


这套能力除了用于直接生成双目内容,也延伸出了一项比较实际的「视图补全」能力。给定一段完整的左视图视频和目标相机轨迹,StereoWorld可以生成与之对应的右视图。这意味着,部分已有的单目视频未来存在通过生成方式补齐另一侧视角的可能,不必全部重新进行双目拍摄。对于立体视频和XR内容制作而言,将有机会降低部分双目采集、素材制作和后期处理成本。


不过,要让这类模型进入XR,实时性是一道门槛。原始StereoWorld采用双向注意力,一次最多生成81帧。研究团队随后把模型蒸馏为四步生成的因果自回归模型,并为左右视图分别维护带有相机位置编码的KV Cache。蒸馏后的模型可以生成约10秒的双目视频,速度从约0.25 FPS提高到约3 FPS,快了约10倍。
可见,StereoWorld已经开始把双目世界生成从短片段验证,向更长时、更连续的空间内容生成推进,也为后续交互式立体世界生成提供了技术基础。
写在最后
过去,XR行业最大的挑战,是如何让用户进入一个更真实的数字世界;而未来,更大的挑战是如何持续创造足够丰富的内容,让用户愿意长期留在其中。
从这个角度看,AI 3D带来的价值,除了提高建模效率,还有改变了空间内容的生产方式。当3D模型生成速度从小时级缩短到秒级,当普通用户也能够通过语言直接创造物体、搭建场景,当AI能够理解现实空间并生成具有几何一致性的立体内容,XR的内容生产将不再完全依赖专业开发者,而有机会形成类似移动互联网时代UGC内容生态。
对于XR产业而言,硬件决定了空间计算能走多远,而3D模型能力拓展了这个空间里的可能性。
随着AI 3D技术不断成熟,未来的XR设备或许会逐渐成为每个人创造和体验数字世界的新入口。而3D能力的提升,也将推动XR从小众群体迈入更大规模的消费市场。










