生成未必理解:基于扩散模型能否实现视觉世界模型?_30页_7mb
报告摘要
袁粒来自北京大学深圳研究生院,提出“生成未必理解”的问题,引用费曼名言讨论视觉生成与理解的关系。当前视觉生成依赖扩散模型(如DDPM、DDIM、LDM),而视觉理解主要基于大型语言模型(LLM)的自回归生成架构。两者建模方式差异显著,生成模型参数规模通常为数十亿至百亿,理解模型可达千亿级别。世界模型的发展方向强调统一视觉与语言模态的框架,需解决编码器统一、离散/连续模态选择、量化损失补偿、梯度冲突处理等技术挑战。
学术与应用同步推进:OpenAI提出DALL-E(基于Transformer)与Sora(T2V模型),清华提出CogView(Transformer-based文本生成),郑爽团队基于Stable Diffusion推出MidJourney系列。开源项目如Open-SoraPlan获得广泛参与,一周内吸引14万次访问和技术贡献,推动视频生成技术发展。该计划通过3D因果VAE、稀疏注意力、图生视频模型等技术实现高分辨率长时长视频生成,并兼容文生图与文生视频任务。
视觉世界模型探索方向包括:1)以相机位姿为物理先验,构建4D世界模型(ViewCrafter已开源);2)利用全景二维信息生成3D全景世界(Holodreamer研究);3)自回归生成架构(如Llama)可能超越扩散模型。争议点集中在统一建模方式(如自回归Transformer)或统一损失函数的选择,以及视觉模态应采用离散(需大词汇量)还是连续表示。研究提出通过混合注意力专家(MoE++)和多头注意力机制(MoH)增强模型的多模态能力,并探索自回归Transformer统一视觉理解和生成的潜力。
此外,多模态思维链(CoT)技术(如LLaVA-CoT/o1)通过结合文本提示与视觉推理提升生成质量。高效注意力机制与硬件优化(如昇腾架构的算子开发、分布式训练加速)成为实现大规模模型训练的关键。尽管生成与理解路径存在分歧,但统一框架的探索持续进行,涉及多模态Scaling Law验证、开源社区协作及前沿技术融合,为未来AI视频生成和世界建模提供重要方向。
试读结束,高清完整版pdf/doc/ppt,请点下载