前言:
大模型学会聊天之后,开始学着「过日子」了。近日,京东把实时可交互世界模型JoyAI-Echo WM摆上开源社区;字节被曝把各模型方向中最高的资金投入,压向了同一个靶心。
作者 | 方文三
图片来源 | 网络
AI「补课」物理常识,世界模型成了最贵的学分
世界模型内核朴素,让AI在脑子里装下世界的规律。杯子松手落地,拐角后有遮挡。语言模型熟读全部文字,却没端过一杯水,迈不进物理世界的跛脚就在这。
Genie 3生成可探索环境,V-JEPA 2做机器人规划,Cosmos定位Physical AI底座。它早不该被归进视频生成赛道,视频生成只答下一帧,空间智能还得追问物体在哪、动作带来什么。
热度遮不住边界,视觉合理不等于物理准确,门看着能开,未必懂门轴和摩擦。
李飞飞拆解冷静,渲染、模拟、规划三位一体,最难啃的是模拟器。世界模型如今大致相当于2019年的语言模型,密码还没破。
冷静拦不住热钱,World Labs融资12.3亿美元,估值50亿美元,英伟达与AMD罕见同框。
国内前7个月一级市场砸进666亿元,64家公司58家拿到融资。
钱在抢跑,尺子还没造好,连世界模型都没共识,质变或许要等到2028年。收入那头,至今没人披露过规模化进账,技术还住在demo里,门票已开卖,行话叫期货。
可账本另一端诱人,IDC测算中国具身机器人支出从2025年14亿美元蹿到2030年770亿美元,年复合增速94%。国务院发展研究中心更乐观,预计2035年破万亿。
字节不缺模型,缺的是下一块屏幕
字节闯入世界模型的姿态很字节,承认来晚,然后加倍下注。
2024年周畅从阿里通义加盟,内部判断路线未明,先打视频模型的仗。2025年两支VLA成军,一路吃仿真数据,一路吃自然数据。
2026年春节后牌桌重洗,Seed新设世界模型研究组,前Meta FAIR研究员范浩奇挂帅,走3D仿真路线瞄准游戏娱乐,两支VLA合并归入周畅麾下,Seed Robotics随后并入。
钱的流向更诚实,世界模型数据预算数千万元,是其他厂商的3到4倍。年底对标Google Genie 3,差距约10%。豆包DAU已破2亿,全球最肥的一块AI流量田。
字节的焦虑是结构性的,抖音把二维信息流做到注意力极限,用户时长和广告加载率都有物理上限,文本牌桌只排第8,推荐引擎需要一块装得下下一次生命的新屏幕。
硬件是它交过学费的地方,2021年90亿元抢下Pico,2022年PICO 4发布喊出销量破100万台。3个月后ChatGPT出世,风向掉头,次年目标腰斩到50万台。2023年二季度中国VR/AR头显只卖出15.6万台,同比减半。每一代头显的墓碑上刻着同一个死因,内容荒。
世界模型恰好能治这个病,Seedance 2.5单次生成拉到30秒,可消化50个参考素材。Seed3D 2.0输出带关节、可拆分、可进仿真引擎的3D资产,被称半个世界模型。9月的目标参数值得咀嚼,端到端延迟约50毫秒,每秒约20帧,画面全部云端生成。
50毫秒是一道门槛,人眼对延迟的容忍阈值在50到100毫秒,低于这道线,大脑会把虚拟空间误判为真实在场,VR行业卡了10年。
云端生成顺手改写成本结构,头显只剩显示和传感,VR从硬件生意变成云服务生意。原定9月的Pico Space Pro推迟到四季度,等的显然就是这口气。
把推荐引擎从二维屏幕搬进三维空间,让内容像自来水一样实时生成,内容荒这个老死因才被连根拔除。这与其说是技术野心,不如说是一个内容帝国的形态自救。
京东把供应链搬进了仿真器
京东做世界模型,画风与别家不同。这家公司的弹药库里没有日活神话,有的是别人抄不走的东西,20多年供应链、60万一线员工,和全中国密度最高的物理场景。
JDD大会上,京东开源JoyAI-Echo WM。它随用户移动持续生成场景,同步输出720P视频、环境音与语音,支持多轮交互,在WBench Navigation评测中以81.6分登顶。
模型只是水面上露出的尖,水面之下,京东计划两年采集超1000万小时人类真实场景视频,建设全球最大的具身智能数据采集中心,开源的行业最大第一视角数据集EgoLive覆盖1969类物体、1796种动作,引来8个国家上百所高校申请。
这笔账算得清楚,机器人最贵的一课是摔跤,真实试错按小时计费,遥操作采集一小时动辄数万美元。仿真把摔跤搬进虚拟世界,成本趋近于电费。
京东恰好握着中国最完整的可仿真现实,仓库、分拣线、配送站、无人车,每天产出带动作标签的物理数据,这类数据在游戏视频里长不出来。
卡位动作密不透风,未来5年采购300万台机器人、100万台无人车、10万架无人机,全国布局80个RoboBase基地,JoyInside牵手近200个硬件品牌,年内接入终端超千万台,投资名单从智元、逐际动力、众擎排到帕西尼,本体、零部件、具身模型全链条通吃。
这家公司在做一笔资产重估,把20年攒下的供应链从成本中心改写为AI时代的训练场。
入口是面子,收租权是里子
舆论爱讲入口之争,这个词值得拆开验货。
押宝头显入口,是2016年VR元年就演过的剧本。Vision Pro卖了两年多仍是富人的玩具,Quest守着小众盘子,Pico刚从寒冬里缓过气。硬件这道门,还远远没装上。
卡位的真正对象,是空间计算时代的生产成本定义权。
字节押空间内容的生产成本趋零,内容荒消失后,它向内容产业收生成税。
京东押物理作业的试错成本趋零,机器人上岗前都在它的仿真里练手,它向机器人产业收仿真税。
两家排的是同一个售票处的两个窗口,卖的都是2028年的票。
生态动作都在为收租铺路,字节自研加投资,影眸科技、生数科技、自变量机器人陆续进了购物车。
京东投资加渠道加地产,200多个品牌接入JoyInside,80个基地圈地,1000万小时数据持续喂养模型。
两边的算盘都清楚,世界模型成熟那天,平台上跑着别人生意的那家,就成了事实标准。
软肋也该摆上桌面,字节的二维信息流与三维实时交互隔着技术代差,Pico的前科提醒市场,这家公司的硬件耐心不算长。
京东场景全是自家的,数据闭环漂亮,可操作系统的价值取决于第三方数量,它的世界模型眼下最大的客户恐怕只有自己。
两家争夺的底层是同一种能力,持续的空间理解。字节握着模型、内容生态和终端,京东握着供应链、物流和可验证的物理场景,两家都还没有闭环。
结尾:
拼模型像不像世界的阶段正在退潮,拼谁的世界装得下别人生意的阶段正在涨潮。
世界模型的战略价值,可能远超模型API本身。
部分资料参考:京东探索研究院:《From AI Models to the Physical World: Highlights from JDDiscovery 2026》,字节跳动Seed:《Seed Research: BAGEL, The Open-Source Unified Multimodal Model, An All-in-One Model》,Meta AI Research:《V-JEPA 2: Advancing World Models for Physical AI》







