基于物理条件约束的可信视觉生成大模型_34页_11mb
报告摘要
朱思语是2024AI+研发数字者会上的演讲嘉宾,复旦大学教授、博士生导师,主要研究方向包括视频和三维生成式模型,如视频重建和生成。他在该领域发表60余篇高水平论文,包括CVPR、ICCV等会议,以及Halpaper、Champ、AnimateAnything等影响力大的模型。
技术上,他讨论了视频生成的发展,涉及扩散模型、Gan、Flow-based模型等,突出了Sora模型的创新,如长视频生成、高保真度和一致性。Sora使用DiT框架和相关技术实现了视频生成的进步,但面临物理世界建模的挑战,包括几何、光照和运动方面的失败案例。
为解决挑战,他提出几何增强、Sora相关改进模型如VideoMV和STAG4D,以及将确定性条件应用于概率扩散模型,以减少数据需求。
未来工作焦点是优化扩散模型,整合确定性元素,确保模型泛化能力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载