作者|星奈
媒体|AI大模型工场
想象一下这样一个 3D 建模过程。
你给 GPT-6 Astra 一张挖掘机的参考图,它先理解这台机器由哪些部分组成:驾驶舱、履带、底盘、动臂、斗杆、铲斗……
随后,这些主要部件被分别送进一个专业 3D 生成模型,几十秒后以独立资产的形式返回。
接下来,GPT-6 Astra 开始接手。
它判断每个部件的尺度和空间关系,把履带放到底盘两侧,把动臂接到车身,再把斗杆和铲斗依次装上;主体结构完成后,它继续通过 Three.js 补上液压管、螺丝、转轴,以及驾驶舱里的操作摇杆。
最后,一台完整、结构化,还可以继续修改的挖掘机出现在三维场景中。
这不是单纯的图生 3D,也不是单纯的代码生成。
而是两种 AI 能力开始以一种更自然的方式配合起来:
GPT-6 Astra 负责理解、规划和构建,专业 3D Foundation Model 负责复杂几何。
这也是极顶数创旗下 V2Fun 最近正在尝试的一种新工作流。
而它背后的一个更大变化是:3D Agent 正在从“自己生成所有东西”,走向“知道什么时候该调用什么模型”。
TURNING POINT GPT-6 Astra 已经会做 3D,下一步是什么?
GPT-6 Astra 带来的一个重要变化,是大语言模型正在真正进入三维世界。
过去,我们更习惯让 AI 生成一张图片、一段视频或者一段文字。现在,依靠越来越强的多模态理解、空间推理和代码能力,GPT-6 Astra 已经可以理解一个三维对象的结构,再通过 Three.js 等程序化方式把它真正搭建出来。
比如一条工业流水线。
GPT-6 Astra 可以识别其中的传送带、滚轮、支撑框架、电机和不同工作模块,再逐步生成对应的几何结构。
这类对象尤其适合程序化建模,因为它们通常拥有明确的数学关系和重复结构。一根支撑柱可以由基础几何体表达,一个滚轮可以复制几十次,一段传送带的长度和位置也可以直接通过参数控制。
更重要的是,这样生成出来的并不是一个完全黑盒的 Mesh。
流水线中的各个部件仍然是独立对象,可以继续移动、复制、删除和修改。
从这个角度看,GPT-6 Astra 已经不只是“生成 3D”,而开始具备一种更接近 3D 工程师的能力:理解一个对象由什么组成,并把它构建出来。
但当对象越来越复杂,一个新的问题也随之出现。
如果面对的不是流水线,而是人物面部、生物、服装、雕塑,甚至只是一台拥有复杂工业曲面的挖掘机——是不是仍然应该让 GPT-6 Astra 把所有几何都通过代码写出来?
答案可能不是非此即彼,而这恰恰是 V2Fun 能够进入这个工作流的地方。
WHY V2FUN为什么是 V2Fun?
V2Fun 并不是为了这次 Demo 临时接入的一个 3D API。
它是极顶数创(Vertex Lab)长期研发 AI 3D Foundation Model 的产品化入口。
极顶数创成立于 2025 年,核心方向一直围绕 3D 生成、空间智能以及更长期的世界模型基础设施展开。
此前,V2Fun 已经作为鸿蒙系统首个 3D 大模型 AI 原生应用亮相 HDC 2026,并通过移动端和 Web 工作台覆盖从大众创作到专业 3D 内容生产的完整链路。
它做的事情,本质上一直是如何把一个复杂的三维对象,以更低的门槛、更短的时间,变成真正可继续使用的 3D 资产。
即将上线的 V2Fun 2.0,会进一步升级这套能力。
新版本将搭载最新一代 3D Foundation Model,并支持最高 8K 级贴图生成,重点提升复杂几何、人物、生物、服装、雕塑以及其他非规则曲面的生成质量。
这也是为什么,V2Fun 和 GPT-6 Astra 的结合并不是一个偶然的产品联动。
两边擅长解决的问题,本身就是互补的。GPT-6 Astra 强在理解、规划、空间关系、代码和 Agent 调度,V2Fun 强在直接生成复杂三维几何和高质量表面。
一个更擅长回答:“这个东西应该怎么构建?”
另一个更擅长回答:“这个复杂部件本身应该长什么样?”
当这两种能力结合起来之后,3D 生成就不再只剩下一条路径。
CHALLENGE 有些东西适合写代码,有些东西更适合直接生成
还是回到那台挖掘机。
从结构上看,它非常规则。
GPT-6 Astra 很容易理解一台挖掘机由底盘、左右履带、车身、驾驶舱、动臂、斗杆和铲斗组成,也能够理解这些部件之间应该如何连接。
但继续往下看,问题就变得不同。
驾驶舱不是一个简单立方体,车身外壳也不是几个 Primitive 拼在一起就能准确表达。铲斗拥有连续曲面,机械臂有复杂轮廓,履带与底盘本身也包含大量工业设计细节。
GPT-6 Astra 当然可以继续通过程序化代码逼近这些结构。但几何越复杂,需要生成和修改的代码就越多,迭代轮次也会增加。对于 Agent 来说,这意味着越来越多 Token 被消耗在底层几何描述上。
于是我们换了一种方式。
GPT-6 Astra 先负责“看懂”挖掘机。然后把驾驶舱、履带、机械臂、铲斗等复杂主体分别交给 V2Fun 2.0 生成。
生成完成之后,再由 GPT-6 Astra 重新接管,完成尺度调整、旋转、位置匹配和整体装配。
这里,V2Fun 发挥的正是它一直在积累的能力:
从视觉输入中直接恢复复杂三维结构,而不是让语言模型通过大量代码间接描述曲面。
这一步看似只是少写了一些 Three.js,实际上改变的是整个计算路径。
更有意思的是,V2Fun 并没有取代 Three.js。组装完成以后,GPT-6 Astra 仍然会继续自己生成很多东西。
例如液压管。它本质上就是沿几个关键点连接起来的一条管状结构,非常适合程序化表达。
再比如螺丝、连接轴和摇杆。这些对象尺寸规则、结构简单、数量又很多。如果每一个都单独调用一次 3D Foundation Model,反而会增加整个流程的成本和复杂度。
所以最终看到的挖掘机其实是一个真正的 Hybrid Asset。复杂主体由 V2Fun 生成,规则细节由 GPT-6 Astra + Three.js 完成,最后再由 GPT-6 Astra 把两者组织成同一个结构化 3D 对象。
这也是这套方案真正有意思的地方:
不是“代码生成”和“3D 大模型”二选一,而是让 Agent 自己决定,哪一部分最适合哪一种能力。
MORE COMPLEX 如果对象变成一个人,V2Fun 的价值会更明显
挖掘机仍然是一个偏硬表面的对象。真正把纯程序化路线推向极限的,是人物和复杂有机曲面。
为此,我们又做了一个更激进的 Demo:让 GPT-6 Astra 构建一名全副武装的国王。
这个角色不仅有人体本身,还拥有复杂铠甲、头部、剑和盾牌。相比机械设备,人类角色更加难以用规则表达。
一个脸“像不像”,不是因为眼睛、鼻子和嘴的大致位置正确就够了。脸型、颧骨、眼窝、鼻梁、嘴唇以及这些结构之间连续而微妙的曲率变化,共同决定了最终形象。
铠甲也是如此。它虽然属于硬表面,却不是简单的工程件。大量浮雕、装饰、连续曲面和风格化造型共同构成角色视觉特征。
这恰恰是 V2Fun 2.0 新一代 3D Foundation Model 更适合处理的对象。
在这个 Demo 里,GPT-6 Astra 首先理解整个角色,并将其拆解成头模、身体与铠甲、剑和盾几个主要部分。随后,这些复杂部件分别通过 V2Fun 生成。
GPT-6 Astra 再负责后面的事情:
头部尺度是否正确,如何与身体连接;剑和盾牌应该放在什么位置;各个部件之间比例是否协调;哪些模型需要减面;最终怎样整理成一个可继续编辑和使用的 3D Asset。
换句话说,V2Fun 解决的是“复杂几何如何快速、高质量地出现”,GPT-6 Astra 解决的是“这些几何如何成为一个完整对象”。
V2Fun 为什么能承担这一层复杂几何?
原因并不只是“它也是一个图生 3D 模型”。极顶数创过去一段时间的核心研发,一直围绕两个最基础的问题展开:几何如何表达得更准确,以及高分辨率纹理如何在三维表面上保持一致。
在几何侧,团队持续迭代 3D 表达和生成架构,希望减少无效几何表达,把模型能力集中到高曲率、薄结构和复杂区域。
在纹理侧,则重点解决多视角、高分辨率生成时常见的纹理错位、撕裂和细节损失问题。
这也是 V2Fun 2.0 能进一步做到 8K 级高质量贴图的基础。
对于一个 Agent 来说,这类能力非常重要。因为它调用的不是一个“看起来像 3D”的视觉生成工具,而是一个真正输出三维资产的专业模型。
生成出来的资产还要继续被 GPT-6 Astra 组合、减面、修改,甚至进入后续动画、游戏、打印或其他 3D 工作流。
这正是 V2Fun 过去一直在解决的产品问题:让 AI 生成的不只是一个结果,而是一个真正可以继续工作的 3D Asset。
EFFICIENCY 更高质量,只是一部分,另一个变化是 Token
这套工作流还有一个很直接的收益:Token 效率。
当 GPT-6 Astra 用 Three.js 描述一个简单结构时,Token 使用效率非常高。
一个圆柱、一条液压管、几个螺丝,只需要很少的代码。
但如果让同样的方法去逼近人物面部、衣物褶皱或者高复杂度工业曲面,需要输出和修改的几何代码会快速增加。
于是大量 Token 被花在:
“这个曲面应该怎样再接近一点。”
“这个轮廓需要怎样继续调整。”
“这一部分应该增加多少几何细节。”
而当复杂部分直接交给 V2Fun 后,这些底层过程被压缩成一次专业模型调用。
GPT-6 Astra 可以把更多推理资源放在真正需要 reasoning 的地方:
如何拆分对象;哪些部分应该分别生成;不同部件是什么空间关系;最终如何组装;哪里需要继续修改。
这也是为什么 V2Fun 2.0 带来的不只是“模型更好看”。
它还有机会同时降低 GPT-6 Astra 在复杂 3D 任务里的 Token 消耗和整体建模时间。
原本可能是:
理解 → 写几何 → 修改 → 再写几何 → 再修改
现在变成:
理解 → 拆分 → 并行生成 → 组装 → 局部补充
当多个复杂部件能够同时生成时,这种效率差异还会进一步放大。
CLOSING 从“生成一个模型”,到“成为 Agent 的 3D 基础能力”
过去几年,AI 3D 的核心问题一直是:怎么生成一个更好的模型?
但随着 GPT-6 Astra 这样的模型拥有越来越强的多模态理解、代码和 Agent 能力,这个问题正在发生变化。
未来,AI 不一定需要用一种技术完成所有 3D 工作。
简单结构,可以直接写代码。
复杂曲面,可以调用 V2Fun。
已有资产,可以直接复用。
需要减面、组合、调整结构,再交给 Agent 继续执行。
这和 3D 生成行业正在从“单次生成工具”走向“Agent 化生产力”的变化是一致的。参考文章也把这个趋势概括为:3D 生成正在从类似早期 Chatbot 的阶段,转向 Agent 模式的生产力阶段。
对于极顶数创而言,这个方向其实和它长期的技术判断是一致的。
公司从一开始就没有把 V2Fun 只定义成一个“图生 3D 网站”。
从移动端降低 3D 创作门槛,到 Web 端进入专业资产生产,再到 3D 模型、动画、动作以及更长期的空间智能和世界模型方向,极顶数创真正想做的,一直是三维内容生成和空间智能的基础设施。
而 Agent 的兴起,可能让这件事情有了一个新的入口。
未来用户未必需要知道自己到底应该调用哪个模型、写哪段代码、选择什么建模方式。
他只需要说一句:“把这个做成 3D。”
GPT-6 Astra 负责理解这个需求,并决定怎么完成。而 V2Fun 2.0 希望成为它在复杂三维世界里的那一项专业基础能力。
GPT-6 Astra 负责理解、规划和构建。
V2Fun 负责把复杂的三维想象真正变成资产。
GPT-6 Astra × V2Fun:从代码生成,走向模型协同。
极顶数创是一家专注于AI 3D内容生成与空间智能应用的科技公司,致力于通过生成式AI降低3D内容生产门槛,提升从创意生成、模型生产到动画应用的整体效率。
公司围绕AI 3D大模型、内容生成工具与企业级技术服务构建业务体系,通过V2Fun产品矩阵,为创作者、开发者及企业客户提供从图像、文本、视频输入,到3D模型、纹理、动画及标准资产输出的一体化能力。
数据支持天眼查,大模型独家合作账号










