2025生成未必理解:基于扩散模型能否实现视觉世界模型?_30页_7mb
报告摘要
袁粒及其团队探讨了基于扩散模型的视觉生成是否真正理解了视觉世界模型的构建。核心观点包括:生成模型与理解模型存在本质差异,生成未必理解,理解无法直接生成;视觉生成依赖扩散模型,而视觉理解多采用自回归生成模型(如LLM),两者在建模方式、参数规模上有所不同。当前视觉生成尚未完全收敛于扩散模型,自回归Transformer架构可能成为统一生成与理解的关键。部分研究尝试将物理先验知识与全景3D信息作为输入,推动生成模型构建多视角世界的4D或3D表示。
在技术实现上,Open-SoraPlan等开源项目通过3D因果VAE、任意分辨率/时长训练、稀疏注意力机制等技术提升视频生成能力,并借助昇腾异构计算架构优化硬件性能。其开源社区活跃,一周内获14万次访问,超200次模型更新,代码被克隆数千次。但当前AI视频生成领域仍以闭源模型为主,开源项目较少。
统一生成与理解框架的探索面临多重挑战:如何设计通用编码器兼顾压缩与对齐;离散(如文本)与连续(如图像)模态的处理差异;任务冲突(如生成与理解的梯度矛盾);视觉CoT(思维链)的引入方式;以及是否优先统一Loss函数或建模方式。部分研究提出混合注意力专家(MoE++)与混合专家架构(MoH)作为统一路径,同时强调高效注意力机制的重要性。如Janus-Pro等模型尝试在统一架构中融合多模态理解与生成任务,但尚处探索阶段。
争议焦点在于:统一框架应侧重Loss设计还是建模方式整合?类Sora架构虽具备生成与理解能力,但其底层逻辑仍需突破。技术方向上,压缩即智能(如Od-VAE)和多模态CoT增强(如LLaVA-CoT)被视为重要路径。目前主流仍采用分立架构,但向统一框架演进的趋势明显,涉及多模态Scaling Law验证、混合注意力机制优化等技术进展。
试读结束,高清完整版pdf/doc/ppt,请点下载