2025-01-08-英伟达-宇宙世界基金会物理AI模型平台_75页_3mb
报告摘要
宇宙世界基金会物理AI模型平台总结
核心内容
NVIDIA 提出了 Cosmos World Foundation Model (WFM) 平台,旨在帮助开发者构建物理AI系统所需的定制化世界模型。该平台提供了一套完整的工具链,包括视频筛选流程、预训练的世界基础模型、后训练的示例、视频分词器和防护系统,以确保模型的安全性与有效性。
主要观点
- 物理AI的定义:物理AI是一种具备传感器和执行器的AI系统,能够观察和修改物理世界。其发展受限于数据扩展的挑战,因为需要交错的观察和行动序列。
- WFM的作用:WFM是物理世界的安全数字孪生体,用于解决数据扩展问题。它被分为预训练和后训练两个阶段,分别用于学习通用物理知识和适应特定应用场景。
- 训练范式:采用预训练-后训练的范式,其中预训练阶段利用大规模视频数据集,后训练阶段使用特定任务的数据进行微调。
- 视频处理流程:平台包括视频策展、分词、预训练、后训练和防护系统,其中视频策展涉及分割、过滤、标注、去重和分片,以提高数据质量。
- 分词器设计:Cosmos Tokenizer 是一个高效的视觉分词器,支持连续和离散表示。其架构采用编码器-解码器结构,结合时间因果机制和小波变换,以优化视觉表示。
- 模型性能:Cosmos Tokenizer 在多个图像和视频基准数据集上表现优异,尤其是在高压缩率下,其重建质量与现有技术相比具有显著优势。
- 开源与许可:平台开源,提供开放权重模型,并采用 NVIDIA 开放模型许可协议,允许开发者自由使用。
关键信息
视频数据处理流程
- 分割:将视频分割为无镜头切换的片段,以确保数据的一致性。
- 过滤:移除低质量、无意义或包含文本的视频片段,以提高数据的实用性。
- 标注:使用视觉语言模型(VLM)为视频片段生成字幕,以提供监督。
- 去重:采用语义去重技术,去除重复或相似的视频片段。
- 分片:根据分辨率、宽高比和长度对视频进行分片,以适应模型训练需求。
分词器设计
- 类型:包括连续和离散两种类型。
- 架构:采用编码器-解码器结构,结合时间因果机制和小波变换。
- 训练策略:采用交替训练策略,使用L1损失、感知损失、光流损失等。
- 性能:Cosmos Tokenizer 在多个数据集上表现优异,尤其是在高压缩率下,其重建质量优于现有技术。
世界基础模型(WFM)
- 预训练:使用扩散模型和自回归模型进行预训练,以学习通用物理知识。
- 后训练:通过微调,使WFM适应特定物理AI应用,如摄像头控制、机器人操纵和自动驾驶。
- 防护系统:包含前防护和后防护模块,以阻止有害输入和输出。
平台组件
- 视频策展人:负责筛选和整理视频数据。
- 视频分词器:将视频转换为紧凑的语义令牌。
- 预训练世界基础模型:提供通用的物理知识。
- 后训练样本:用于微调WFM以适应特定任务。
- 防护系统:确保模型的安全使用。
技术细节
- 视频数据集:包含2000万小时视频,涵盖多种物理AI应用场景。
- 分词器压缩率:支持多种压缩率,如 $8 \times 8$、$16 \times 16$ 等。
- 模型训练:使用大规模GPU集群(1000个NVIDIA H100 GPU)进行训练,耗时三个月。
- 开源资源:提供预训练模型和分词器,以及训练脚本,供开发者使用。
未来展望
- 应用场景:WFM可用于政策评估、模型预测控制和合成数据生成。
- 研究方向:尽管平台已具备多项功能,但世界基础模型的问题仍未完全解决,需要进一步研究以推动其发展。
附录信息
- 数据集:Cosmos TokenBench 数据集包含多种视频类别,如鱼眼视角、驾驶、机器人操纵等。
- 性能评估:在多个基准数据集上,Cosmos Tokenizer 表现优异,如MS-COCO 2017、ImageNet-1K、DAVIS等。
- 模型发布:Cosmos WFM 1.0 包括扩散模型和自回归模型,分别支持文本到世界和视频到世界生成任务。
总结
NVIDIA 的 Cosmos World Foundation Model 平台提供了一套完整的工具链,以支持物理AI系统的构建。通过视频数据处理、分词器设计和世界模型预训练,该平台旨在解决数据扩展问题,并提供高效、安全的模型。Cosmos Tokenizer 在多个基准上表现优异,证明了其在物理AI领域的潜力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载