北京大学2025生成未必理解基于扩散模型能否实现视觉世界模型30页_7mb
报告摘要
视觉生成与理解的统一路径
核心观点
-
生成与理解的关系:
Feynman提出的“创造即理解”理论被重新诠释,生成模型是否真正理解其生成内容存在争议。理解能力无法直接反推生成能力,二者需独立研究。 -
技术路线分野:
- 视觉生成依赖扩散模型(DDPM、DDIM、LDM、LoRA)实现高质量图像/视频生成,如Open-SoraPlan、Pika系列、StableVideoDiffusion等。
- 视觉理解基于大型语言模型(LLM)和自回归架构,如DALL-E、CogView、LLaVA系列,后者聚焦多模态理解与生成。
-
参数规模差异:
视觉理解模型(如LLaVA系列)可达到千亿参数规模,而生成模型通常局限于百亿参数。多模态大模型研究(如LanguageBind、Arxiv2024)试图弥合差距。
关键技术进展
-
扩散模型优势:
- 扩散模型在图像合成领域超越GANs(NeurIPS2021),支持长时视频生成及动态场景重构。
- 结合物理先验知识(如相机位姿)构建4D世界模型(ViewCrafter, 2024),实现跨视角新型视图生成。
-
多模态统一架构:
- Autoregressive Transformer被提出为通用框架,支持理解(VQA)与生成(T2I/T2V)任务。
- MoE++与MoH架构(混合注意力专家)实现多模态任务的端到端训练,例如Janus-Pro(2025)。
-
算子优化与硬件适配:
- 借助昇腾异构计算架构(如DVPP、BLAS、FlashAttention)提升模型精度与训练效率,Open-SoraPlan在GitHub获14万访问量。
- 多流内存复用、任意分辨率及时长训练等技术加速模型发展。
技术挑战与争议
-
统一建模方式:
- 生成与理解的编码器需兼容不同模态(离散/连续),但单纯增加词表规模可能低效。
- 离散模态需设计多层级字典以补偿量化损失,连续模态则需平衡计算复杂度。
-
任务冲突与梯度协调:
- 视觉与语言模态的梯度方向不同,需通过特定机制(如CoT增强、自回归训练)整合。
- 视觉多模态慢思考模型(LLaVA-CoT/o1)尝试解决生成与理解任务的协同问题。
-
模型收敛性存疑:
- 自回归模型(如Llama)在图像/视频生成中展现潜力,但扩散模型仍主导生成领域。
- 路线之争:是否完全依赖自回归架构,或在损失函数层面统一?
开源与行业应用
-
开源项目活跃度:
- Open-SoraPlan支持视频生成、3D全景重建等应用,代码被克隆千次,社区贡献显著。
- StableVideoDiffusion、StableDiffusion(v1-v4)、DALL-E2等模型推动行业应用(如ChatLaw、ChatExcel)。
-
多模态技术验证:
- LanguageBind(ICLR2024)通过多模态Scaling Law验证统一模型的有效性。
- 多模态生成与理解在Science领域(NCS、NC论文)获得应用,但闭源模型仍主导商业生态。
未来方向
-
统一框架探索:
- 通过混合注意力专家(MoH)和自回归Transformer实现编码器统一,解决压缩与对齐问题。
- 3D因果VAE、任意帧控制等技术推动生成与理解能力融合。
-
性能与精度提升:
- 优化算子(如RoPE3D、AscendC)释放硬件性能,支持长视频压缩与高分辨率生成。
- 多模态模型需处理视觉-语言模态冲突,完善注意力机制与梯度协调策略。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载