2024-03-26-Qualcomm-2024通过NPU和异构计算开启终端侧生成式AI报告_20页_4mb
报告摘要
通过NPU和异构计算开启终端侧生成式AI总结
核心内容
生成式AI正在迅速改变终端设备的计算需求,其多样化的应用场景要求更高效的计算架构。为了满足这些需求,高通通过集成神经网络处理器(NPU)和异构计算架构,打造了业界领先的终端侧AI解决方案。高通AI引擎结合了多种处理器,包括Hexagon NPU、Adreno GPU、高通Kryo或Oryon CPU、高通传感器中枢以及内存子系统,共同实现高性能、低功耗和高效的AI推理。
主要观点
- 生成式AI的多样化需求:生成式AI应用场景可分为按需型、持续型和泛在型,每种类型对处理器的选择和性能指标有不同的要求。
- 异构计算的重要性:利用CPU、GPU和NPU等不同处理器的协同工作,可以最大化性能、能效和电池续航,从而支持复杂的生成式AI工作负载。
- NPU的定制化设计:高通Hexagon NPU是专为AI推理设计的,具备低功耗、高性能和高面积效率,能够应对AI模型不断增长的计算和内存需求。
- 高通AI引擎的系统级优化:高通AI引擎是一个集成的异构计算架构,通过系统级设计和全栈优化,实现AI性能的全面提升。
- 软件栈的赋能作用:高通AI软件栈为开发者提供了统一的平台,支持多种AI框架和运行时,使AI应用的开发、优化和部署更加便捷和高效。
关键信息
1. 高通NPU的演进
- 2015年:骁龙820集成首个高通AI引擎,支持成像、音频和传感器运算。
- 2018年:骁龙855加入Hexagon张量加速器,提升AI处理效率。
- 2020年:HexagonNPU引入微切片推理和INT4支持,提升能效和性能。
- 第三代骁龙8:HexagonNPU实现98%的性能提升和40%的能效提升,支持大语言模型(LLM)和大视觉模型(LVM)的高效推理。
- 骁龙XElite:HexagonNPU算力达45TOPS,远超竞品X86架构芯片。
2. 异构计算的优势
- 按需型用例:如语音识别、图像生成等,适合在NPU、GPU和CPU上分配任务。
- 持续型用例:如实时翻译、视频处理等,对能效和电池寿命要求高,NPU是最佳选择。
- 泛在型用例:如AI助手、情境感知等,需要持续运行,NPU和传感器中枢提供高效支持。
3. 高通AI引擎的组成
- Hexagon NPU:专为AI推理设计,支持标量、向量和张量运算。
- Adreno GPU:支持高性能图形处理和AI并行计算,适用于大语言模型推理。
- 高通Kryo/Oryon CPU:提供低延迟、高计算能力,适合轻量级AI任务。
- 高通传感器中枢:始终在线、低功耗的AI处理器,适用于小型模型和泛在型应用。
- 内存子系统:通过大共享内存和高效数据传输,提升AI性能和能效。
4. 高通AI软件栈
- 支持主流框架和运行时:如TensorFlow、PyTorch、ONNX、Keras等。
- 提供多种SDK和工具:包括高通神经网络处理SDK、高通AI模型增效工具包(AIMET)等。
- 跨平台兼容性:支持Android、Linux、Windows和QNX操作系统,以及Docker、Kubernetes等部署工具。
- 量化技术:通过INT4量化,显著提升能效和性能,同时减少准确度损失。
5. 性能表现
- 第三代骁龙8:在MobileBERT、Llama2-7B等模型上表现优异,AI性能领先竞品。
- 骁龙XElite:在PC端实现领先的AI性能,支持更复杂的生成式AI任务。
总结
高通通过Hexagon NPU和异构计算架构,为终端侧生成式AI提供了高性能、低功耗的解决方案。结合系统级优化和软件栈支持,高通AI引擎能够灵活应对各种AI用例,推动生成式AI在智能手机、PC、汽车等终端的广泛应用。高通的定制化设计、快速创新和全栈AI优化,使其在AI性能和能效方面保持行业领先地位,助力生成式AI的规模化部署。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载