【中国移动研究院】存算一体白皮书(2022年)
报告摘要
存算一体白皮书总结
核心内容
存算一体是一种新型计算架构,旨在解决冯·诺依曼架构下的“存储墙”和“功耗墙”问题,通过将存储与计算融合,实现计算能效的显著提升。该技术被认为是未来先进算力的代表性技术之一,已被中国移动确定为算力网络十大关键技术之一。本白皮书系统性地分析了存算一体的核心技术、应用场景、发展路线及面临的挑战,并提出了相应的发展建议。
主要观点
- 存算一体通过将存储与计算融合,克服传统架构瓶颈,提升能效。
- 存算一体技术可分为近存计算(PNM)、存内处理(PIM)和存内计算(CIM)三类。
- CIM作为狭义的存算一体,直接实现存储与计算的融合,具有更高的能效比。
- 存算一体技术在端侧、边侧和云侧均具有广泛应用前景,特别是在AI推理和训练领域。
- 存算一体技术的发展面临五大挑战,包括新器件成熟度低、电路设计不成熟、芯片架构通用性差、EDA工具链不完善、软件及算法生态不健全。
关键信息
技术分类
- 近存计算(PNM):通过先进封装技术,将存储单元与计算单元靠近,提升访存带宽。
- 包括存储上移(如HBM)和计算下移(如CSD)两种方式。
- 存内处理(PIM):在内存芯片中集成计算单元,实现部分数据处理,如HBM-PIM和PIM-DIMM。
- 存内计算(CIM):真正实现存储与计算的融合,适用于AI算子加速,如卷积神经网络(CNN)和循环神经网络(RNN)。
存储器件分析
| 器件 | 易失性 | 多值存储 | 现有工艺节点 | 理论工艺极限 | 单比特存储面积(F²/bit) | 读写次数 | 应用场景 |
|---|---|---|---|---|---|---|---|
| SRAM | 易失 | 否 | 5nm | 2nm | ~300 | 无限 | 云侧和边侧推理与训练 |
| NOR Flash | 非易失 | 是 | 28nm | 14nm | ~7.5 | 10^6 | 边侧和端侧推理 |
| RRAM | 非易失 | 是 | 28nm | 5nm | 20~40 | 10^8 | 云侧、边侧和端侧推理 |
| MRAM | 非易失 | 否 | 16nm | 5nm | ~30 | ~10^15 | 云侧和边侧推理与训练 |
| PCM | 非易失 | 是 | 28nm | 5nm | ~24 | 10^8 | 云侧、边侧和端侧推理 |
应用场景
- 端侧:用于智能终端设备,如智能眼镜、耳机、摄像头等,满足低功耗、高能效需求。
- 边侧:用于云游戏、车联网等边缘计算场景,满足高时延、高算力需求。
- 云侧:用于大规模AI芯片,满足高带宽、低功耗、大算力需求。
技术挑战
- 新器件成熟度低,制造工艺难升级:新型存储器件如RRAM、PCM、MRAM在一致性、可靠性等方面仍有提升空间。
- 电路设计影响芯片算效提升:电路设计尚未成熟,尤其是模拟存内计算涉及ADC、DAC、TIA等模块,带来设计复杂度。
- 芯片架构场景通用性及规模扩展能力较差:当前芯片算力有限,缺乏通用性和扩展性。
- EDA工具链尚未健全:缺乏标准单元库、仿真验证工具及误差评估工具,影响设计效率。
- 软件及算法生态不完善:缺乏通用开发环境和编译器,算法与芯片计算特性不匹配。
发展建议
- 协同先进封装技术:推动RRAM、PCM、MRAM等新型器件与先进工艺兼容,实现芯片高度集成。
- 优化电路与芯片架构:加强存算阵列与周边模块设计,构建通用、可扩展的芯片架构。
- 加速EDA工具孵化:推动EDA工具链发展,缩短芯片研发周期,促进国产EDA产业。
- 构建开发生态与编程框架:搭建通用编程框架,支持并行计算特性,促进算法开发与应用迁移。
- 产学研紧密协同:推动端侧到云侧的演进,构建全链条合作平台,促进技术成熟与生态繁荣。
产业发展倡议
中国移动呼吁产学研界共同攻关存算一体核心技术,加快产业成熟,推动生态繁荣。通过标准制定、开源推动、产业合作等方式,加速技术落地,释放存算一体在性能与成本方面的巨大潜力,助力国家在先进计算领域实现高水平自立自强。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载