LingBot-Video 物理训练数据流水线
方法内核
LingBot-Video 的核心不是单纯生成“好看视频”,而是用具身视频数据和物理一致性检查,批量生成可用于机器人训练和策略评估的数据。文章提到训练数据规模约 7 万小时,覆盖真机、仿真、开源数据,以及机械臂、人形和四足机器人。
关键步骤
- 将视频字幕结构化为带时间戳的动作阶段,明确“什么时间、对什么、做了什么”。
- 分五阶段训练:192p纯图片 → 192p图片+视频 → 480p图片+视频 → 480p精选高质量运动数据 → 1080p纯视频精修。
- 用视觉质量、文本动作对齐、运动强度、运动速度、人体一致性和物理感知模型筛选结果。
- 重点检查运动因果、物体恒存、材质真实性和任务完成度,减少穿模、物体消失和动作不符合指令的问题。
适用边界
适合机器人训练数据稀缺、需要视觉模拟器或辅助实时决策的场景;不能替代真实世界数据,尤其不能直接证明复杂接触动力学、长时任务和真实执行安全性。可与已有具身智能、空间智能沉淀配合使用。