The Well 统一物理仿真数据基准
核心方法
The Well 把 16 类物理系统、约 15TB 时空仿真数据统一为“轨迹 × 时间步 × 空间网格 × 物理场分量”的结构,用 HDF5 存数据、YAML 描述坐标/边界条件/单位,并预先划分训练、验证、测试集。核心价值不是提供一个新模型,而是减少跨物理领域训练前反复清洗和适配数据的成本。
适用场景
- PDE 代理模型、物理场预测和科学基础模型训练。
- 比较模型能否跨流体、等离子体、声学、生物系统等领域泛化。
- 需要统一数据入口和可复现实验预算的研究团队。
实践要点
- 先用 Hugging Face 流式读取或选择约 6.9GB 的小数据集验证管线,不要一开始下载完整 15TB。
- 用
WellDataset接入 PyTorch DataLoader,统一处理切片、批处理和数据划分。 - 用 FNO、TFNO、U-Net、ConvNeXt U-Net 基线,在单张 H100、12 小时预算下做可复现对照。
- 正式大规模训练改用本地数据,避免持续远程读取成为瓶颈。
适用边界:它解决数据结构和基准一致性,不自动解决物理方程差异、模型泛化或算力成本问题;对通用 AI 应用的直接价值有限。
原文:GitHubStore - 15TB 物理仿真数据集!物理AI再也不愁数据了 - 3916483328-2247495764_1