LingBot-Video 物理训练数据流水线

方法内核

LingBot-Video 的核心不是单纯生成“好看视频”,而是用具身视频数据和物理一致性检查,批量生成可用于机器人训练和策略评估的数据。文章提到训练数据规模约 7 万小时,覆盖真机、仿真、开源数据,以及机械臂、人形和四足机器人。

关键步骤

  1. 将视频字幕结构化为带时间戳的动作阶段,明确“什么时间、对什么、做了什么”。
  2. 分五阶段训练:192p纯图片 → 192p图片+视频 → 480p图片+视频 → 480p精选高质量运动数据 → 1080p纯视频精修。
  3. 用视觉质量、文本动作对齐、运动强度、运动速度、人体一致性和物理感知模型筛选结果。
  4. 重点检查运动因果、物体恒存、材质真实性和任务完成度,减少穿模、物体消失和动作不符合指令的问题。

适用边界

适合机器人训练数据稀缺、需要视觉模拟器或辅助实时决策的场景;不能替代真实世界数据,尤其不能直接证明复杂接触动力学、长时任务和真实执行安全性。可与已有具身智能、空间智能沉淀配合使用。

原文赛博禅心 - 给 🤖 的赛博饲料,要怎么做? - 3934419561-2247518633_1