不卷coding,卷原生多模态世界模型:智象未来拿下15亿C轮融资?

IP归属:北京

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

作者|冰拿铁

编辑|星奈

媒体|AI大模型工场

2026年过一半,全球AI行业本该见证属于Coding赛道的高光时刻。

Kimi K3的发布被寄予厚望,国产大模型在代码能力上对Claude的追赶,似乎只差“临门一脚”。

然而,这“临门一脚”不仅没能踢开胜利的大门,反而一脚踢崩了资本市场:

发布次日,智谱股价暴跌28.49%,MiniMax暴跌15.62%,大洋彼岸同样寒意逼人。美国AI板块随之集体下挫,即便是一度被视为独立模型公司天花板的Anthropic,其二级市场估值预期也面临显著回调。

这就很反差,你可能很好奇,明明技术取得了突破,为何资本市场反手就是一巴掌?

原因并不复杂,Coding赛道正在陷入残酷的“马太效应”内卷中。

Claude依然牢牢攥住全球超六成的Coding请求,而国产头部模型即便在内部测试中已宣称接近Claude的水平,实际对比下仍存差距。这看似一步之遥的距离,恰恰是其估值逻辑的“阿喀琉斯之踵”。

随着Coding场景下的同质化竞争全面提速,各家模型在主流Benchmark上咬得越来越紧,用户切换API的迁移成本却无限趋近于零,如今,Coding API也开始卷起Token价格战时,资本终于忍不住追问一个本质问题:

这个赛道的护城河,到底在哪里?

值得注意的是,就在“语言大模型”贴身肉搏时,另一条赛道却跑出了发展加速度,有一家视觉生成赛道的公司悄悄拿到了15亿元融资。

这家公司不做Coding,不抢代码赛道,而是在视觉多模态赛道闷声发力,三个月内完成三轮融资,累计超21亿元,从估值看已经正式跻身全球AI独角兽。

社保基金、工银资本、华策影视……“国家队”和产业资本领衔的多元资本,正在用真金白银悄悄押注一家叫智象未来的公司。

这让行业感慨,众里寻他千百度,暮然回首,风口却在灯火阑珊处:

大模型公司的下一个主战场,可能不在代码里,视觉多模态,正在成为大模型公司下一个兵家必争之地。

多模态视觉赛道,坡长雪厚

把目光从代码的红海上移开,你会看到另一片蓬勃生长的绿洲。

如果说Coding赛道是“存量博弈”,那么视觉生成赛道就是“增量爆发”。

近两年,视频生成和图像生成早已不是实验室里的“玩具”,而是展现出高确定性和高成长性的商业赛道。更重要的是,在多模态视觉领域,中国企业展现出了引领全球的底气和优势。

而在这条赛道上,智象未来的崛起速度令人侧目。

这家公司近三个月内完成了三轮密集融资,累计融资额超21亿元。

其最新完成的C轮融资,金额达15亿元,由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视等多家机构跟投,老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。

拆解这份投资方名单,你会发现它的“含金量”远不止于金额本身。

这是一个极为稀缺的“复合型资本结构”:国家队耐心资本、金融国家队、影视产业国家队、头部产业资本、顶级市场化VC。

朋友们,在一个多模态模型赛道上同时获得五类投资方认可的公司,屈指可数啊,难度不亚于集齐七颗龙珠。

这些投资者抢占的是啥?

答案是“视觉生成作为下一代世界模型入口”的战略高地。不止于此,视觉赛道与Coding赛道的主流叙事截然不同,行业竞争已从“单一模型参数竞赛”升级为综合竞争,头部厂商也更具护城河。

什么是综合竞争?就是说,模型能力只是入场券,数据稀缺性、产品化能力、工程效率、行业Know-how和工作流深度绑定,才是真正的胜负手。单纯依赖单一大模型服务,越来越容易陷入价格战与性能追赶的双重压力。

视觉模型的逻辑完全不同。它的底层模型、数据壁垒更高,要有高质量图像、视频、影视素材涉及版权、IP和品牌规范;工程壁垒更高,又有需要处理空间、时间、运动、光影、物理规律和多主体交互;

评价体系更复杂,审美、镜头语言、风格一致性、可控性和业务转化效果缺一不可;工作流绑定更深,一旦嵌入影视制作、广告营销、电商内容的生产流程,迁移成本极高。

下面,我们就以“国家队”重仓的智象未来为例,拆解一下这个赛道的护城河。

视觉赛道的SOTA级产品,长什么样

如果你还停留在“AI视频就是Sora那个样子”的认知里,那你已经落后了两个时代。

Sora们长什么样,一个输入框,一个生成按钮。你敲一段prompt,等几十秒,出来一段几秒钟的视频。不满意,再敲一段prompt,重新“开盒”。

每次生成都是孤立的,角色不连续、风格不稳定、镜头之间没有逻辑关系。它不记得上次做了什么,也不理解你真正想要一个什么样的作品。这种模式,对生成一段15秒的“整活”画面够用,但对“做一个完整的视频项目”来说,远远不够。

AI视频生成从来不是一锤子买卖,TA是一个反复修改、持续迭代的创作过程。

智象未来在今年WAIC上发布的全球首个无限时长内容创作智能体vivago R1,彻底改写了Sora们的逻辑。

它的底层充分提供Agent可调用的基础资源和原子能力,构筑智能体的执行底座,最上层是调度层,只沉淀最终定稿,不保留过程噪声,就像一个总导演,只记住角色设定、叙事主线和最终决策。

中间是专家层,编剧、导演、设计师、剪辑师等专家Agent各自拥有独立记忆,负责各自专业环节。最下面是执行层,负责分段并发生成,每个执行子Agent只处理一段任务,用完即走;某一段失败,只重试该段,不影响整体。

这个架构思路与Claude Code的多Agent协作异曲同工。但Claude Code解决的是代码开发任务,vivago R1解决的是长链路内容创作,一个是帮你写一个软件项目,一个是帮你完成一个视频项目。

基于此,vivago R1的产品形态已经接近“AI原生内容生产工作流”,而非单纯的视频生成工具。我自己第一次接触的时候,就很惊艳,它像一个“永不喊累的制片”加一个“全能的后期团队”的合体。

我实测了一下,告诉它“创作一段1分钟连续叙事生活短片,主题是普通人平凡的一日。从清晨起床、早餐、通勤、午后工作、傍晚散步完整流程。”

系统不会简单地生成一段视频,而是调用多镜头叙事流程,把完整故事拆分为多个场景,启动多Agent分工:一个Agent构思故事线、一个写分镜脚本、一个生成核心画面、一个串联成片……

整个过程就像你下达一个指令,然后看着一个专业团队在后台高效运转,最终交付完整的作品。

来看结果,展现出极佳的角色一致性。无论在自然光、室内冷光还是夜晚路灯下,男子的面部特征、发型和体态始终保持高度统一,没有发生常见的“换脸”或形变。

画面质感也达到了电影级水准,光影过渡自然,咖啡萃取的油脂感、烤面包的焦脆色泽、地铁金属扶手的反光……都处理得细腻逼真。动作连贯性也较为出色,无卡顿。场景转换逻辑清晰,叙事完整。

最关键的是一条过,我打90分!

数据也佐证了我的体感:

他们把内容有效可用成功率提升至85% 左右,朋友们,85%是商业规模化交付的门槛啊,你生成100条素材,85条能直接用,这个比例才让企业有意愿把AI纳入生产线。

如今,vivago海外版已覆盖5000万用户、100多个国家和地区,今年5月灰度版登顶Product Hunt日榜第一,拥有百万级付费用户。

这些数据说明一个事实:

多模态智能体,正在光速进入真实的内容生产场景,创造真金白银的价值。

从“生成视频”到“构造世界”:智象未来的棋盘比你想的更大

如果你觉得已经很厉害了,那我要告诉你,智象未来的想象空间不止于此。

问你一个问题,视频生成的终局是什么?

如果你以为是“更长更惊艳的视频”,那可能只看到了冰山一角。真正的终局,叫做“世界模型”。

世界模型是让AI不仅能“看见”世界,还能理解物理规律、推演因果关系、预测动作后果,最终重塑真实世界的认知内核。它的重要性在于,它是AI从“理解世界”走向“改变世界”的唯一桥梁。

目前,全球通向世界模型主要有几条技术路线在并行探索:

一类是3D原生模型路线,从三维空间和几何结构出发,优势是空间一致性强,但文本理解和泛化仍有提升空间。一类是多模态视频模型,通过视频生成推动世界模拟,成熟度最高,也是当前视觉生成赛道的主攻方向;

一类是具身智能路线,从VLA向WAM架构迁移,强调动作规划与物理交互。

还有一类是视觉模型路线,以智象未来的UiT架构为代表,从底层统一建模文本、图像、视频、空间、动作等信号,也是其中最具产业落地确定性的一条代表性路线。

没有世界模型,AI永远停留在“生成内容”的阶段:

它给你一张图、一段视频,但它不知道这张图背后的物理规则是什么,不知道这段视频里的因果关系是否成立。有了世界模型,AI才能真正感知物理世界、推演因果、预测后果,然后指导具身智能去执行真实世界的任务。

那么,在厂商纷纷押注的当下,什么是真正的世界模型?智象未来创始人梅涛对这个问题有一个清晰的界定:一个真正的世界模型必须同时具备三个能力,表达世界、推演世界、构造世界。

“我们经常说model the world,但我觉得真正的世界模型更应该是mold the world,它不仅要理解世界,还要能构造、重塑世界。你如果不能创造这个世界,你也不能真正理解这个世界。”

真正的世界模型怎么搭建呢,智象未来的选择很明确:不走“多模态拼接”的捷径,而是做“原生全模态”的硬骨头。

其最新发布的HiDream-O1-Image 系列模型,开始采用自研的全新原生全模态UiT架构,摒弃了传统路径中的VAE图像压缩和独立文本编码器,将图像像素、文本Token、视频体素以及音频、动作、空间关系等原始信号映射进同一个共享Token空间,直接与同一套UiT,像素级统一的Unified Transformer进行交互,在统一表征系统中完成理解、生成和推理。

Artificial Analysis的文生图榜单

这条路更难,但更有可能走向学术定义上的“世界模型”。

因为真实世界本来就不是单模态的。一张图像,定格了某一时刻的世界状态;视频记录了时间变化;空间带来立体结构;动作带来交互;语言则承载知识、意图和抽象推理。如果这些模态只是被不同模型分别处理、再在外层简单拼接,系统永远无法真正理解世界内部的时空关系和因果规律。

这条难而正确的路,也正在成为行业共识。

2026年初,谷歌发布Gemini Embedding 2,将文本、图像、音视频乃至PDF文档融合进统一向量空间,实现跨越五大模态的直接检索。与此同时,英伟达推出Nemotron 3 Nano Omni,将全模态感知、理解、推理整合为单一模型闭环。

英雄所见略同。全球科技巨头正在用行动证明,原生全模态更有可能是通往世界模型的必经之路。

所以你看,放眼AGI未来,从图像到视频,从视频到空间,从空间到动作,再到反馈闭环,AI正在从“模拟世界”走向“预测世界”,最终走向“重构世界”。

这,也是为什么“国家队”愿意用真金白银,为智象未来“像素里的未来”投票。

历史总是惊人的相似,所有人挤在同一条赛道里贴身肉搏时,总有人选择抬头看路,然后把目光投向更辽阔的疆域。

数据支持天眼查,大模型独家合作账号

— END — 

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

AI大模型工场专栏: https://www.tuoluo.cn/columns/author1911862/

本文网址: https://www.tuoluo.cn/article/detail-10130136.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章