【极客传媒】快手可图大模型的技术演进与应用探索_36页_5mb
报告摘要
快手可图大模型技术分享会内容总结(2024年8月18日,上海)
本次分享围绕快手自研多模态大语言模型“可图”展开,重点涵盖技术原理、应用实践与未来趋势。主讲人李岩从模型架构、训练方法、中文文字生成及虚拟试穿场景等维度解析大模型技术路径,并结合行业案例探讨开源生态与商业价值。
可图大模型概述
可图是快手推出的文生图大模型,通过开源策略推动社区生态发展。其技术体系包括多个子模型,如IP-Adapter、ControlNet系列及Inpainting模型,支持端到端训练与插件生态扩展。开源对齐需关注模型参数来源及数据训练比例,若仅获取代码而缺乏数据细节,难以实现技术迭代。快手开源Kolors后,获得GitHub、HuggingFace及B站等平台的广泛响应,反映出开源对构建技术生态的重要性。
文本表征选择技术讨论
- CLIP模型:基于图文对比学习,通过预对齐空间降低扩散模型训练难度,但仍存在细粒度语义理解不足、多主体关系混淆等问题。
- Encoder-Decoder架构:如T5系列,适合英文场景,但中文语料占比低(C4数据集中不足2%),且数据时效性差,限制语义理解能力。
- Decoder-only LLM:具备百亿至千亿参数规模,可处理长文本与复杂结构,擅长文本生成但弱于多模态理解。
- General Language Model:结合自回归填空机制,通过双向注意力编码提取文本表征,适配图文生成需求。
核心原则:优先使用T5处理英文场景;多模态表征组合优于单一模型;LLM需结合Prompt优化与连接器提升效果;端到端训练优于冻结编码器;多语言表征模型更符合实际需求。
RLHF技术关键因素
RLHF(人类反馈强化学习)通过Reward Model对生成图像进行评分,提供正负反馈以优化模型效果。对比QT(基于人工标注数据的精调),RLHF具备更高效果天花板与更强泛化能力,但存在反馈质量敏感、数据收集成本高、训练复杂性等问题。
技术框架:
- 人工标注需在四维(美学、细节质量、语义对齐、整体评分)进行评分,数值范围1-5并转化为布尔值(0/1)。
- 奖励模型需精确模拟人类偏好,当前可图团队提出多维度人偏学习框架,以提升生成图像与人类审美的一致性。
中国字生成技术挑战
开放域中文文字生成需解决“写对”与“写好”的双重难题:
- 数据维度:训练数据分为两类——合成数据(覆盖生僻字,但真实感弱)与自然数据(真实美感但覆盖有限)。
- 技术要点:
① 结合TextAdapter与ControlNet实现双重可控;
② 引入文字感知损失函数以提升准确性;
③ 采用两阶段训练策略(合成数据→自然数据);
④ 实际效果:句准率提升至80%+,字准率(Levenshtein Ratio)达90%+。
虚拟试穿技术实践
虚拟试穿需满足6大要求:保持模特人脸ID、体态特征、服装款式与细节,并确保跨场景稳定性。
技术框架:
- 基于扩散模型的通用试穿方案,需处理多模态输入(模特图、服装图)与动态效果生成。
- 实际应用中,可图与可灵协同工作:可图生成虚拟试衣效果,可灵通过图生视频技术延展内容。
行业痛点:需解决服装与人体特征的精准对齐、材质纹理还原、跨风格一致性等问题。
视觉生成未来展望
- 可控性:行业仍需突破高质量可控生成的技术瓶颈。
- 模型尺寸:Scaling Law将验证模型性能,但小型化通用模型趋势明显。
- 数据生态:数据供应商将涌现,版权纠纷或成常态。
- 技术框架:U-Net到DiT的演进已成共识,AR框架优势凸显(易融合理解能力)。
- 合法溯源:生成内容需建立可追溯机制,明确责任归属。
- 开源趋势:视频生成领域将爆发开源项目,但高校因算力限制难以参与。
- 场景定位:高成本影视特效生成是视频生成的合理落地场景,而非C端内容生产工具。
行业对比与启示
李彦宏指出,模型开源并非代码开源,需关注数据与训练细节。扎克伯格强调开源对生态建设的价值,但Meta等公司仍保持技术优势。StabilityAI因高成本与亏损问题引发行业关注,反衬开源策略需平衡商业与技术可持续性。快手通过持续开源可图Kolors,推动文生图技术普惠,同时借力RLHF与多模态控制技术深化应用。
试读结束,高清完整版pdf/doc/ppt,请点下载