【英伟达】宇宙世界基金会物理AI模型平台_75页_3mb
报告摘要
NVIDIA Cosmos世界基金会物理AI模型平台旨在通过可扩展的预训练和后训练策略构建物理AI系统的核心世界模型。该平台包含可视化视频处理管道与多模态模型架构,核心技术包括:
-
世界基模型(WFM)架构
WFM分为预训练和后训练两种范式:- 预训练采用基于Transformer的扩散模型(Diffusion)和自回归模型(Autoregressive),前者利用连续潜在表示生成3D一致视频,后者通过离散潜在表示逐步预测序列。
- 后训练通过微调优化模型,使其适配特定任务,如机器人操作、摄像头控制和自动驾驶。
-
视频数据处理流程
依次进行框架分割、质量过滤、语义标注、去重和分片:- 分割:基于HSV直方图检测场景边界(如PySceneDetect),并采用深度学习模型(如TransNetV2)预测帧内过渡概率。
- 过滤:通过运动过滤(如Farnback光流)、文本过滤(针对后处理新增文本)和视觉质量评估模型(如DOVER评分)清洗数据。
- 分词:构建多压缩率的视频标记器家族,如Cosmos-01-Tokenizer(8×8×8)和Cosmos-10-Tokenizer(16×16×16),支持图像和视频的联合处理。
-
模型训练技术
- 扩散模型通过EDM框架实现,利用H264编码器/解码器加速视频处理,且支持多GPU并行训练。
- 自回归模型结合3D旋转位置编码(RoPE)和绝对位置嵌入(APE),并引入层级归一化(AdaLN)和低秩适应(LoRA)优化训练效率。
- 混合精度训练:保留FP32权重的数值稳定性,同时用BF16提升速度,且结合FSDP和CP并行策略扩展模型容量。
-
人机交互优化
- 提示放大器:通过VLM(如Panda-70M)将用户提示转换为详细描述,放大提示中的物理动态信息。
- Medusa推测解码:注入多头推测生成器,将推理速度提升20×(4B模型)和32×(5B模型),并在跨帧生成中减轻连续性影响。
- 三维一致性:籍由3D高斯飞溅(3DGS)和多视角生成技术,确保生成视频与三维物理世界对齐。
-
应用与性能
- 机器人操作:Cosmos-10-Diffusion-7B-Video2World-Sample-ActionCond等模型在Bridge数据集上实现多视角、动作序列生成,提升26%轨迹一致性(ATE<7cm)。
- 自动驾驶:动态生成多视图(6个摄像头视角)覆盖真实道路场景(如收费站、隧道),通过SDT和SOTA模型框架(如MagicDriveEdit)实现稳定3D模拟。
- 性能指标:在DAVIS数据集上,CosmosTokenizer的PSNR比现有技术提升4dB;高压缩率(8×8×8)下的模型泛化性能及传统评测(如FID/FVD)表现最优。
-
安全防护机制
- 预过滤:利用Aegis关键词黑名单和LLM(如LlamaGuard)检测危险提示(如暴力、性内容)。
- 后过滤:采用视频内容分类器(如SigLIP)和人脸识别模糊化,确保生成内容合规。
-
技术局限与改进方向
- 当前模型在物理交互(如物体持久性、接触动力学)和多模态生成(如VoVNet)存在挑战。
- 未来计划优化多模态对齐(如动作-语言联合训练)、提升逆向渲染精度,并扩展测评体系(如自动评估工具)以应对复杂物理场景。
-
对比与创新
相较于VideoLDM等现有模型,Cosmos通过因果架构和联合图像/视频预训练提升了3D一致性(PSNR/SSIM分高于VideoLDM-MultiView)和运动预测能力(如TSE/CSE指标更优),并首次实现多视角物理驱动的视频生成与控制。
该平台通过系统化数据处理与高效模型架构设计,为自动驾驶、机器人和虚拟世界生成等提供通用物理模拟基准,同时通过多层级防护确保模型使用安全,是物理AI领域的重要进展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载