刘知远押注具身智能,面壁想做的不止VLA

IP归属:北京

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

作者|齐马

编辑|星奈

媒体|AI大模型工场

“如果目标是登月,仅仅不断爬树,并不能真正到达月球。”刘知远说。

在具身智能成为显学的当下,这句话多少显得有些不合时宜。

过去一年,机器人学会了跑步、跳舞、叠衣服、打乒乓球,也开始进入工厂,尝试分拣、搬运和装配。在今年的世界人工智能大会上,能完成什么动作、进入多少场景、距离量产还有多远,几乎成为所有机器人公司证明自身进展的共同方式。

但在面壁智能联合创始人、首席科学家刘知远看来,一段完成度很高的Demo,并不必然意味着机器人正在走向通用智能。

“现在很多叠衣服、打乒乓球等具身系统,仍沿用2018年以前的专用智能路线:直接学习某一种能力。”刘知远说,“未来三到五年,具身智能也一定会走向‘先通后专’。人类也是先形成对世界的常识,再去学习开车、做饭或叠衣服,而不是只靠成千上万条单项任务数据。”

这也是面壁智能进入具身智能时,试图与行业拉开的第一重差异:不从某一个专用Skill出发,逐步拼出一台看起来无所不能的机器人,而是先寻找具身智能的通用基础能力,再让通用模型进入具体场景。

7月19日,面壁智能发布并开源了首个具身智能系列成果MiniCPM-Robot,包括面向机器人操作的通用VLA模型MiniCPM-RobotManip、面向四足机器人的跟踪导航模型MiniCPM-RobotTrack,以及具身智能推理框架PhyAI。

两款模型的参数量都不大,却在多项基准上取得了接近或达到同类模型最佳的成绩。

成绩背后,仍是面壁熟悉的小模型路线。

产品形态发生了变化,面壁讲述的故事却没有完全改变。

过去几年,面壁一直试图用更高的模型密度和更低的计算成本,把语言、多模态模型装进手机、汽车和摄像头等终端。如今,它开始把同一条路线延伸到机器人。

在刘知远的设想中,语言模型提供思考、决策和规划,多模态模型负责感知,具身智能则补上动作与行动能力,三者最终形成“感知—思考—行动”的完整闭环。

具身智能不是面壁突然增加的一条业务线,而是端侧智能进入物理世界后的自然延伸。MiniCPM-Robot想验证的,也不只是机器人能否完成一次三明治制作,而是一条在语言模型中得到证明的“先通后专”路线,能否在机器人身上重演。

不为一段Demo反复“爬树”


具身智能眼下最容易被看见的是动作,也是最容易制造误解的部分。

外界看到机器人完成了任务,却很难判断它究竟理解了任务,还是记住了一套经过反复训练的动作。

“目前大家主要通过Demo和案例了解具身智能的能力,但Demo并不完全代表行业的真实进展。”面壁智能多模态首席科学家姚远直言,“为了展示好某个场景,团队可以针对特定任务采集上千条数据,专门训练一个专家模型;在没有实际硬件供公众测试的情况下,做出一段效果不错的Demo并不难。”

真正困难的是,当桌子换了、物体变了,或者指令增加了一步,机器人还能不能继续完成任务。

按照姚远的观察,当前不少所谓的“通用模型”,仍然需要针对不同任务分别微调。为了评测十个Benchmark,可能需要训练十套模型;一旦场景发生变化,能力就会明显下降。

姚远认为,行业正在逐渐形成一个共识:让同一套模型参数完成更多任务,走向Generalist。一个足够好的通用模型,也应该能够吸收不同来源的数据,而不是让不同能力相互冲突。

MiniCPM-RobotManip正是这一思路的初步验证。它只有1.5B参数,没有围绕某一个动作进行深度定制,而是尝试把多种任务统一训练到同一套参数中,在保留语言和视觉理解能力的同时,学习与真实世界交互。

面壁希望复制大语言模型“先通后专”的发展路径。

其底层逻辑是,模型先掌握关于世界的通用知识,再被培养成某个领域的专家,专业能力的上限才会更高。

在他看来,今天真正产生商业价值的Coding模型,并不是只用代码训练出来的。它首先是一个掌握了通用语言、知识和推理能力的基础模型,随后才成为专业程序员。具身智能也应该先成为“大学生”,再学习做饭、巡检和分拣,而不是一开始就被锁定为某条流水线上的熟练工。

这条路线短期内不一定最容易展示效果。单项任务可以通过大量专用数据快速优化,而通用能力的提升更慢,也更难仅凭一段视频证明。

面壁也没有断言自己已经找到终局。姚远将今天的具身智能类比为2018年前后的预训练模型:当时BERT、GPT和T5等路线并存,行业还不知道谁会胜出。

姚远也提醒,具身智能的技术路线尚未收敛,“当前最火的不一定是能笑到最后的”。

MiniCPM-Robot因此更像一次路线验证:面壁要证明的不是自己能否再做出一个机器人Demo,而是小尺寸基础模型能否获得跨任务、可扩展的行动能力。

机器人要有记忆,先要压缩视觉Token


要从专用动作走向通用能力,机器人首先要解决一个基础问题:记住过去。

目前许多VLA模型仍采用接近“单帧反应”的方式,根据当前画面和指令预测下一步动作。如果任务是拿起桌上的食材,当前画面可能已经包含全部答案;但当指令变成“点击第二个按钮5次”,机器人必须知道此前已经按过几次,才能决定何时停止。

“原生上下文记忆,对我们来说是一个自然应该具备的能力,但此前很多具身模型并没有将它纳入设计。”姚远解释,当前许多VLA模型只能根据当前画面决定动作,缺少对历史状态的记忆。

MiniCPM-RobotManip因此把上下文记忆作为关键能力之一,可以保留约一分钟的视觉历史。但一分钟连续画面放到机器人身上,会迅速变成数百张图片和数万乃至十万个视觉Token。

机械臂通常同时接收主视角和腕部摄像头的多路画面。如果模型每执行一步,都重新计算此前的全部视觉信息,就很难保持实时响应,更难部署到端侧设备。

要在端侧处理如此长的视觉历史,模型既需要极致的视觉Token压缩,也要解决流式上下文管理和训练问题。

这恰好是面壁从多模态模型切入具身智能的技术支点。高清图片和长视频一直是多模态模型的计算瓶颈,同一画面需要被转换成多少Token,不仅决定推理成本,也决定模型能在上下文中同时容纳多少帧信息。

据姚远介绍,相比市面上绝大多数模型4倍的视觉压缩率,面壁在无损情况下做到了16倍,还可以通过视觉编码器内部融合进一步降低计算量。

面壁希望用更少的Token表示每一帧画面,再通过流式计算保留历史,使机器人拥有记忆的同时,不让推理成本随着上下文长度同步增长。

小模型也不只是成本选择,而是机器人能否实时工作的前提。模型如果等待一两秒才能预测下一步动作,机器人会出现明显卡顿;在目标跟踪等动态场景中,过高延迟甚至意味着结果已经过时。

这也是刘知远反复强调模型密度的原因。在端侧,参数更多并不天然意味着技术含量更高;在尺寸、功耗和响应时间的限制下保持能力,反而更具挑战。

MiniCPM-RobotTrack体现了这条路线的另一面。它被部署在宇树Go2 Edu上,不依赖云端API,只通过机器狗的摄像头和本地算力,完成自然语言指令理解、目标识别和持续跟踪。即使拔掉网卡,也能在电梯、停车场等无网或弱网环境中运行。

但具身模型的技术难题不只有计算效率,还有数据。

姚远认为,具身智能无法像语言模型一样快速发展的重要原因,是缺少可以直接利用的海量互联网语料。

互联网视频规模最大,却缺少精确的机器人动作信息;仿真数据容易生成,但与真实世界存在差距;真机数据精度最高,成本也最高。面壁同时使用开源、采购、仿真和自主采集数据,并让模型在真实交互中暴露长尾问题,再补充下一轮训练数据。

“没有一种数据是完美的,要么就是量不够,要么就是精度不够。”姚远如此概括当前的数据困境。

Token压缩解决“算不算得动”,上下文记忆解决“记不记得住”,数据闭环则决定模型能不能持续进化。这三者共同构成面壁从多模态模型走向物理世界的技术基础。

不造机器人,只做“通用大脑”


进入具身智能后,面壁没有把自己定义为一家机器人公司。

它不生产本体,也不准备围绕某一种机器人建立封闭的软硬件体系,而是希望把模型部署到机器狗、机械臂、人形机器人、汽车和其他端侧设备中。

刘知远用“大脑”和“小脑”解释面壁与本体厂商的边界。

“像宇树这样的企业,他做本体做得很好,在这个基础上,我感觉他们更适合做这个本体上的小脑。”刘知远解释,“我们说的具身模型,还是发挥大脑的角色。”

小脑负责控制身体,大脑负责理解指令、形成规划、管理记忆和迁移任务。未来面壁与本体厂商的合作,也将更多建立在“大小脑协同”之上。

这是一种与垂直一体化不同的产品思路。有人希望像苹果一样,把模型、系统和本体全部掌握在自己手中;面壁现阶段更倾向于生态打法。

在刘知远看来,企业的禀赋与基因决定了它不可能把每个环节都做好。相比模型、本体和硬件全部自己完成,聚焦模型、与其他厂商合作,是面壁胜算更大的选择。

当记者追问面壁是否会自己下场做本体时,他回答得更加直接:“如果既做模型也做本体,我们一定不如只把模型做好能够取得的胜算更大。”

因此,MiniCPM-Robot并不是一款直接面向普通消费者的机器人产品,而是面壁向产业链交出的一组底层模块:通用VLA提供“大脑”,MiniCPM-RobotTrack验证纯本地执行,PhyAI降低模型进入不同硬件的推理与部署成本。

开源则是面壁扩大本体覆盖范围的方式。

开源是这套生态打法的重要支点。具身智能拥有大量不同本体,需要完成各种适配,仅靠一家公司很难推动。面壁希望借助开源模型和推理框架,让开发者与本体厂商共同补全生态。

面壁希望通过模型、框架和合作进入更多机器人,而不是自己制造一台机器人包办所有环节。它要争取的,是下一代终端生态中“通用大脑”的位置。

商业化尚早,时间也是朋友


对于具身智能当前的商业阶段,面壁的态度相对克制。

“具身智能目前还没有到大规模商业化的阶段。”姚远表示,在技术跨越质变点之前,更重要的是推动技术本身增长;基础能力突破后,更多应用场景才可能自然出现。

面壁并非拒绝商业化。它已经与吉利等伙伴探索实际场景,也需要通过项目积累工程能力和合作关系。但现阶段,它不愿为了短期订单,把主要研发资源锁定在某一个专用Skill上。

刘知远将具身智能放在更大的端侧商业版图中理解:语言模型最成熟,多模态感知其次,具身行动仍处于早期。不同能力会按照成熟度逐次进入应用,而不是同时迎来商业爆发。

刘知远把面壁的落地节奏概括为:先语言模型,再多模态感知,最后进入行动。只有技术逐步成熟,相应的商业化才可能展开。

面壁押注的是两个趋势:模型密度持续提高,同等能力所需的参数和计算量继续下降;与此同时,端侧芯片为Transformer和多模态模型进行原生优化,终端算力继续增长。当两者交汇,端侧模型才可能从有限的专用任务走向通用能力。

这仍需要时间。

“跑得早、跑得快都不重要,重要的是你跑得准。”刘知远强调,能否判断对未来的发展方向,才是这场竞争的关键。

结语


从MiniCPM-RobotManip完成一次三明治制作,到机器狗在断网状态下跟随指定目标,面壁已经让MiniCPM从理解屏幕中的文字和图像,迈出了作用于物理世界的第一步。

但按照面壁自己的标准,这些Demo还不能证明它抵达了“月球”。

它们更像是几次路线验证:上下文记忆能否让机器人摆脱单帧反应,视觉Token压缩能否让连续感知进入有限算力,通用基础模型又能否跨过任务和本体之间的边界。

如果“先通后专”能够在机器人上复制语言模型的演进,面壁获得的将不只是某一个场景的解决方案,而是一颗可以进入不同本体的通用大脑;但如果具身智能长期依赖高度专用的数据和模型,这条路线也将承受更大的时间成本。

MiniCPM-Robot当然还不是一枚已经升空的火箭。

但至少,面壁开始拒绝用一棵树的高度,衡量自己与月球之间的距离。

数据支持天眼查,大模型独家合作账号

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

AI大模型工场专栏: https://www.tuoluo.cn/columns/author1911862/

本文网址: https://www.tuoluo.cn/article/detail-10130128.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章