2025-03-24-中智凯灵_北京_科技-基于物理条件约束的可信视觉生成大模型_35页_11mb
报告摘要
演讲内容聚焦于基于物理条件约束的可信视觉生成,探讨了如何将物理世界建模整合到视频生成模型中以提升可靠性和效率。主题涵盖朱思语教授的研究背景、视觉生成模型的演进,以及物理建模的挑战和未来方向。
朱思语教授是复旦大学教授和研究员,研究方向包括视频和三维生成式模型,发表60余篇论文和多个大模型,如Sora、Champ、Hallo等。主要工作包括视频生成、三维重建和理解,强调了模型在物理条件约束下的应用。
视觉生成模型的发展从早期方法如VAE、GAN、Flow-based models到现代Diffusion models(如Sora),实现了高保真和长视频生成。Sora突破性在于它的一致性、长时序连贯性和高分辨率能力,但建模物理世界存在困难,如几何、外观、光照和运动问题。
物理世界建模面临挑战:世界复杂性导致概率模型不适用,恒定建模资源消耗(如海量数据和计算)。失败案例包括几何扭曲、光照不准确和动画不协调,促使了模型如Gaussian-Flow、VideoMV和STAG4D的创新。
解决方案涉及应用确定性条件来简化建模,减少数据和参数需求。例如,在人类动画和表情合成中使用Champ和Hallo,以及动态蛋白质结构预测。未来工作旨在将确定性条件整合到概率扩散模型中,增强可信度和泛化能力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载