给机器人刷的短视频,该怎么拍?
- 公众号:赛博禅心
- 发布时间:2026-07-09T13:20:47+08:00
- 微信链接:https://mp.weixin.qq.com/s/zhQD8hsm1r8HBHmizHuQqQ
- RSS ID:3934419561-2247518626_1
- Feed ID:MP_WXS_3934419561
- Glance 当前首页可见:是
LingBot-Video
刚刚,蚂蚁灵波开源了 LingBot-Video:面向具身智能的视频生成模型
等等…机器人也要刷视频?
实际是这样的:
大语言模型的训练,需要的是文本,互联网上全是,抓过来洗洗就能用
具身智能的训练,则需要物理数据,比如「怎么抓杯子」、「怎么好茶摇一摇」等
很显然,这种可用的、标注给机器人的视频,网上几乎没有
那怎么办?
很容易想到的办法,是人肉采集。流程大概是:一个老哥遥操机器人,然后逐帧录制,成本嘛…很显然上天了,并且很难规模化。即便是行业最大的开放数据集之一 Open X-Embodiment,仍远不及互联网视频的零头
另一种常见的数据方法,是仿真器训练。但行业有个老问题叫 sim-to-real gap,大致就是说「在虚拟环境里学会的技能,到真实世界经常不好使」,三年模拟,还是比不过五年高考
于是,我们又有了另一条路:特调一版给机器人用的视频生成模型。基于互联网上的视频规模,参杂有效的具身数据,用奖励极致推进把交互的正确性,然后产出足以可用的机器人拿来当训练数据
那么,说到这,你可能又会好奇了:我直接一个 SD 或者 Sora,ok 吗?还真不 ok
过去两年,视频生成的主线是内容创作,大家主要卷的维度是画面一致性、美学、时常等等,毕竟搞视频创作,需要给观看的人足够的爽感
但很显然,机器人完全不在乎这些…
对于良好的具身智能数据而言,画面构图无所谓,但物理性质必须准确,比如东西推了就得按着惯性走,玻璃杯碎了不会自己复原
举个🌰:在 AI 漫剧里面,手指随便穿场景,反正ub也天天穿,玩个刺客信条帽子漏在草丛外面也不影响前行
但是呢,这些东西如果真的用在机器人训练上,那结果就炸了…大概就是物理学不存在了
针对这一问题,蚂蚁集团下面的灵波团队(Robbyant)拿出了解决办法,并连同模型和技术报告一并放了出来
→ GitHub:github.com/robbyant/lingbot-video
→ 技术报告:https://arxiv.org/abs/2607.07675
30B 容量,3B 速度
介绍下这个模型的参数吧:30B 总参数,3B 激活,MoE 架构,能够有效的模拟流体、刚体、材质,以及各种镜头运动
这个模型还有个特点:快,能够满足训练和策略迭代时要用的大量模拟、预测、试错需求
上文提到,这个模型的背后,是互联网视频数据,混着大量的具身数据,而里面,具身数据超过 7 万小时,来源多种多样,包括不仅限于真机采的、仿真的、开源的…从机器人类型来说,机械臂、人形机器人、四足机器人…啥都有,足够的宽
如果对于这些数据进行分类,会包含以下三种:
VLA 也就是视觉(V)、语言(L)、动作(A)三件套,比如「拿起杯子」这个指令对应什么动作序列、杯子在这个过程中状态怎么变化
VLN 按语言指令在空间里导航,就像「走到厨房然后左转」这种
Ego-vision 第一视角数据,也是最接近机器人看世界的方式
为了让这些数据,发挥更高的作用,团队弄了个颇为聪明的做法:把视频字幕做了结构化处理,将每个动作切成带时间戳的阶段,这样模型学到的就是完整的动作的结构:什么时间、对什么、做了什么
而在真正的训练环节,共分为分五个阶段进行,如下:
第一阶段:192p,纯图片
在训练的一开始,只喂视频的第一帧,让模型建立最基础的视觉理解,物体长什么样、材质是什么、场景结构怎么回事。图片被当作只有一帧的视频来处理
第二阶段:192p,图片+视频
这一步开始喂视频数据,也包括之前的那些具身数据,让模型开始学时间维度的东西,比如帧和帧之间关系、镜头的运动方法等等,从结果上来说,在这一步里文生视频被完成了
第三阶段:480p,图片+视频
在这一阶段,分辨率扩大到了 480p,同时解锁图生视频任务:给初始帧,让模型预测后续画面演化
第四阶段:480p,图片+视频
这一步调的是数据配比,从通用视频中精选出高质量Motion数据,同时几乎完整保留具身数据,把模型效果从「画质优先」掰向「物理优先」
第五阶段:1080p,纯视频
在模型的最后阶段,用质量最高的数据完成精修;在这一步里,其实还训练了一了一个精修模型,专门把 480p 的输出拉到 1080p。它只管补清晰度,不动前面学到的运动和物理逻辑
当然,这里的具体信息,都可以在报告里找到,欢迎去看原文
一定不要穿模
视频模型训练好了,但从为了保证其生成的数据,能够被用于真实世界,还要狠狠的的强化学习一个:感知、物理、执行
感知这一块,有两个模型在分别负责
视觉质量,基于 HPSv3,逐帧扫画面,模糊、伪影、低分辨率,都扣分
文本对齐,会先把文本描述拆成结构化的动作序列,每个动作标上时间窗口,然后用 Qwen3.6-27B 逐个窗口核实
在物理性质方面,则三个模型一起出力,分别负责以下:
运动强度,用 VLM 给运动程度打 1 到 5 分,防止模型偷懒生成静态画面
运动速度,基于 Pulse-of-Motion,校正视频模型常见的「慢动作回放」毛病
人体一致性,从五个维度打分:拓扑结构、面部变形、手部畸形、肢体数量、身体半透明
至于最后一个物理感知,虽然只有一个模型,但管的最宽,会逐帧验证四件事儿:
运动因果:没有外力就不能自己动
物体恒存:不能凭空消失,不能穿模
材质真实性:不同材质的运动方式要对得上各自的物理特性
任务完成度:文本描述里的动作有没有真正完成
最终效果
这里就放 bench 吧,对比了五个开源模型:Cosmos 3、Wan 2.2、混元 1.5、LongCat-Video、LTX-2.3
虽然在画质上没拿全第一,但在具身上却拿了第一,还赢了 Cosmos3(英伟达的物理 AI 模型)
跟 DreamDojo 对比了案例:桌上的黄苹果不会凭空消失,机械手的姿态跟动作指令严格对应
最后
回到最开始的问题:机器人的训练数据又贵又少
那么有了这个模型,就可以自己批量生成物理正确的训练数据了
当然,也可以拿来当视觉模拟器用,去评估策略,又或者预测「接下来会发生什么」,进行辅助实时决策
有兴趣的朋友可以去试试,有关链接我都贴在下面了
Github:github.com/robbyant/lingbot-video
Project page:technology.robbyant.com/lingbot-video
Huggingface:huggingface.co/collections/robbyant/lingbot-video
Model Scope:www.modelscope.cn/collections/Robbyant/LingBot-Video
预览时标签不可点