具身视频生成训练数据补充
赛博禅心对 LingBot-Video 的补充说明是:机器人训练用视频的价值不在画面美学,而在物理一致性和可执行动作。模型以约 7 万小时具身数据为基础,采用 30B 总参数、3B 激活的 MoE 架构;训练先从 192p 图片和视频建立运动理解,再提升到 480p,并通过结构化动作字幕和多阶段训练提高 sim-to-real 可用性。
适用场景:为具身策略学习批量制造带动作语义的视频数据。边界:生成结果需要物理正确性验证,不能把传统内容生成视频直接当作机器人训练集。
赛博禅心对 LingBot-Video 的补充说明是:机器人训练用视频的价值不在画面美学,而在物理一致性和可执行动作。模型以约 7 万小时具身数据为基础,采用 30B 总参数、3B 激活的 MoE 架构;训练先从 192p 图片和视频建立运动理解,再提升到 480p,并通过结构化动作字幕和多阶段训练提高 sim-to-real 可用性。
适用场景:为具身策略学习批量制造带动作语义的视频数据。边界:生成结果需要物理正确性验证,不能把传统内容生成视频直接当作机器人训练集。