人工智能49:SinGAN单样本生成-20211024-华泰证券-24页_1mb
报告摘要
SinGAN 单样本生成详细总结
核心内容
SinGAN 是一种基于单样本生成任意尺寸模拟样本的生成对抗网络(GAN)变式,能够有效解决传统 GAN 在样本量和序列长度上的局限性。该模型通过多层级架构实现从粗糙到精细特征的学习,其研究曾获得2019年国际计算机视觉大会(ICCV2019)最佳论文奖。
主要观点
- 样本量悖论:传统GAN需要大量样本进行训练,这与“解决样本稀缺”的初衷相矛盾。
- 长度不匹配问题:金融时间序列通常通过“切片”方式采样,导致生成序列长度短于真实序列,难以复现长时程性质。
- SinGAN的创新设计:
- 采用金字塔结构,不同层级GAN依次训练,低层学习全局特征(低频信息),高层学习局部纹理(高频信息)。
- 判别器为马尔可夫判别器,关注更多局部信息,提升细节保持能力。
- 损失函数结合对抗损失和重构损失,提升训练的稳健性。
- 金融应用表现:
- 在日频沪深300和月频标普500、欧元兑美元等任务中,SinGAN在拟真性和多样性上优于WGAN。
- 能更完整地捕捉真实序列的频域特征,特别是中、长尺度周期。
关键信息
模型架构
- SinGAN由 $N + 1$ 层GAN组成,每层生成器 $G_n$ 的输入是当前噪音 $z_n$ 和上一层生成器输出上采样后的假样本 $(\tilde{x}_{n+1})\uparrow^r$。
- 判别器 $D_n$ 的输入是当前层生成器输出的假样本或下采样后的真样本。
- 每层卷积核长度为3,步长为1,填充为0,非输出层通道数为32,输出层为1。
损失函数
- 对抗损失采用WGAN-GP形式,公式为:
$$
L_{adv} = D_n(\tilde{x}n) - D_n(x_n) + \lambda (|\nabla{\tilde{x}_n} D_n(\tilde{x}_n)|_2 - 1)^2
$$ - 重构损失用于确保特定噪音生成真样本,公式为:
$$
L_{rec} = | G_n(0, (\tilde{x}_{n+1})\uparrow^r) - x_n | ^2
$$
训练和生成流程
- 逐层训练,从最粗糙的层级开始,依次训练到最精细的层级。
- 每层训练结束后参数固定,再训练下一层。
- 生成阶段通过各层随机噪音依次输入,最终生成与原始序列长度相同的假样本。
SinGAN的优势总结
- 生成序列长度:SinGAN可以生成与原序列等长甚至更长的序列,克服传统GAN的长度限制。
- 拟真性:在日频沪深300和月频标普500、欧元兑美元等任务中,SinGAN生成序列更接近真实序列。
- 多样性:SinGAN在多样性指标上优于WGAN,特别是在样本量较小的科创50生成任务中表现显著。
- 频域特征捕捉:SinGAN能完整复现中、长周期信号,而WGAN在这些方面表现不足。
实证结果
日频沪深300
- SinGAN和WGAN在拟真性和多样性指标上均表现良好。
- 两者生成序列在时域和频域上均与真实序列接近。
日频科创50
- WGAN出现严重模式崩溃,生成序列高度一致,缺乏多样性。
- SinGAN在真实性和多样性指标上全面占优。
月频标普500
- SinGAN生成序列具有42、100、200个月附近的周期,与真实序列高度一致。
- WGAN无法复现中、长周期信号。
月频欧元兑美元
- SinGAN生成序列与真实序列在频域特征上高度相似。
- WGAN生成序列频域信号与真实序列差异较大,缺少100个月附近的中周期。
风险提示
- SinGAN生成序列是对市场规律的探索,不构成投资建议。
- 深度学习模型存在过拟合风险,且无法保证在市场规律变化时仍有效。
评价指标
- 时域指标:包括自相关性、厚尾分布、波动率聚集、杠杆效应、粗细波动率相关、盈亏不对称性、长时程相关性。
- 频域指标:通过傅里叶变换分析周期性,关注42、100、200个月附近的周期信号。
总结
SinGAN通过其多层级架构和创新的损失函数设计,在金融时间序列生成任务中表现出色,尤其在样本量较小或序列长度受限的情况下,其在拟真性和多样性上优于传统GAN。SinGAN不仅能够生成与原序列等长的模拟数据,还能更完整地捕捉数据的频域特征,为量化研究提供了新的思路和方法。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载