给机器人刷的短视频,该怎么拍?


LingBot-Video

刚刚,蚂蚁灵波开源了 LingBot-Video:面向具身智能的视频生成模型

等等…机器人也要刷视频?

实际是这样的:

大语言模型的训练,需要的是文本,互联网上全是,抓过来洗洗就能用

具身智能的训练,则需要物理数据,比如「怎么抓杯子」、「怎么好茶摇一摇」等

很显然,这种可用的、标注给机器人的视频,网上几乎没有

那怎么办?

很容易想到的办法,是人肉采集。流程大概是:一个老哥遥操机器人,然后逐帧录制,成本嘛…很显然上天了,并且很难规模化。即便是行业最大的开放数据集之一 Open X-Embodiment,仍远不及互联网视频的零头

另一种常见的数据方法,是仿真器训练。但行业有个老问题叫 sim-to-real gap,大致就是说「在虚拟环境里学会的技能,到真实世界经常不好使」,三年模拟,还是比不过五年高考

于是,我们又有了另一条路:特调一版给机器人用的视频生成模型。基于互联网上的视频规模,参杂有效的具身数据,用奖励极致推进把交互的正确性,然后产出足以可用的机器人拿来当训练数据

那么,说到这,你可能又会好奇了:我直接一个 SD 或者 Sora,ok 吗?还真不 ok

过去两年,视频生成的主线是内容创作,大家主要卷的维度是画面一致性、美学、时常等等,毕竟搞视频创作,需要给观看的人足够的爽感

但很显然,机器人完全不在乎这些…

对于良好的具身智能数据而言,画面构图无所谓,但物理性质必须准确,比如东西推了就得按着惯性走,玻璃杯碎了不会自己复原

举个🌰:在 AI 漫剧里面,手指随便穿场景,反正ub也天天穿,玩个刺客信条帽子漏在草丛外面也不影响前行

但是呢,这些东西如果真的用在机器人训练上,那结果就炸了…大概就是物理学不存在了

针对这一问题,蚂蚁集团下面的灵波团队(Robbyant)拿出了解决办法,并连同模型和技术报告一并放了出来

→ GitHub:github.com/robbyant/lingbot-video

→ 技术报告:https://arxiv.org/abs/2607.07675

30B 容量,3B 速度

介绍下这个模型的参数吧:30B 总参数,3B 激活,MoE 架构,能够有效的模拟流体、刚体、材质,以及各种镜头运动

这个模型还有个特点:快,能够满足训练和策略迭代时要用的大量模拟、预测、试错需求

上文提到,这个模型的背后,是互联网视频数据,混着大量的具身数据,而里面,具身数据超过 7 万小时,来源多种多样,包括不仅限于真机采的、仿真的、开源的…从机器人类型来说,机械臂、人形机器人、四足机器人…啥都有,足够的宽

如果对于这些数据进行分类,会包含以下三种:

VLA 也就是视觉(V)、语言(L)、动作(A)三件套,比如「拿起杯子」这个指令对应什么动作序列、杯子在这个过程中状态怎么变化

VLN 按语言指令在空间里导航,就像「走到厨房然后左转」这种

Ego-vision 第一视角数据,也是最接近机器人看世界的方式

为了让这些数据,发挥更高的作用,团队弄了个颇为聪明的做法:把视频字幕做了结构化处理,将每个动作切成带时间戳的阶段,这样模型学到的就是完整的动作的结构:什么时间、对什么、做了什么

而在真正的训练环节,共分为分五个阶段进行,如下:

第一阶段:192p,纯图片

在训练的一开始,只喂视频的第一帧,让模型建立最基础的视觉理解,物体长什么样、材质是什么、场景结构怎么回事。图片被当作只有一帧的视频来处理

第二阶段:192p,图片+视频

这一步开始喂视频数据,也包括之前的那些具身数据,让模型开始学时间维度的东西,比如帧和帧之间关系、镜头的运动方法等等,从结果上来说,在这一步里文生视频被完成了

第三阶段:480p,图片+视频

在这一阶段,分辨率扩大到了 480p,同时解锁图生视频任务:给初始帧,让模型预测后续画面演化

第四阶段:480p,图片+视频

这一步调的是数据配比,从通用视频中精选出高质量Motion数据,同时几乎完整保留具身数据,把模型效果从「画质优先」掰向「物理优先」

第五阶段:1080p,纯视频

在模型的最后阶段,用质量最高的数据完成精修;在这一步里,其实还训练了一了一个精修模型,专门把 480p 的输出拉到 1080p。它只管补清晰度,不动前面学到的运动和物理逻辑

当然,这里的具体信息,都可以在报告里找到,欢迎去看原文

一定不要穿模

视频模型训练好了,但从为了保证其生成的数据,能够被用于真实世界,还要狠狠的的强化学习一个:感知、物理、执行

感知这一块,有两个模型在分别负责

视觉质量,基于 HPSv3,逐帧扫画面,模糊、伪影、低分辨率,都扣分

文本对齐,会先把文本描述拆成结构化的动作序列,每个动作标上时间窗口,然后用 Qwen3.6-27B 逐个窗口核实

在物理性质方面,则三个模型一起出力,分别负责以下:

运动强度,用 VLM 给运动程度打 1 到 5 分,防止模型偷懒生成静态画面

运动速度,基于 Pulse-of-Motion,校正视频模型常见的「慢动作回放」毛病

人体一致性,从五个维度打分:拓扑结构、面部变形、手部畸形、肢体数量、身体半透明

至于最后一个物理感知,虽然只有一个模型,但管的最宽,会逐帧验证四件事儿:

运动因果:没有外力就不能自己动

物体恒存:不能凭空消失,不能穿模

材质真实性:不同材质的运动方式要对得上各自的物理特性

任务完成度:文本描述里的动作有没有真正完成

最终效果

这里就放 bench 吧,对比了五个开源模型:Cosmos 3、Wan 2.2、混元 1.5、LongCat-Video、LTX-2.3

虽然在画质上没拿全第一,但在具身上却拿了第一,还赢了 Cosmos3(英伟达的物理 AI 模型)

跟 DreamDojo 对比了案例:桌上的黄苹果不会凭空消失,机械手的姿态跟动作指令严格对应

最后

回到最开始的问题:机器人的训练数据又贵又少

那么有了这个模型,就可以自己批量生成物理正确的训练数据了

当然,也可以拿来当视觉模拟器用,去评估策略,又或者预测「接下来会发生什么」,进行辅助实时决策

有兴趣的朋友可以去试试,有关链接我都贴在下面了

Github:github.com/robbyant/lingbot-video

Project page:technology.robbyant.com/lingbot-video

Huggingface:huggingface.co/collections/robbyant/lingbot-video

Model Scope:www.modelscope.cn/collections/Robbyant/LingBot-Video

            预览时标签不可点