通过NPU和异构计算开启终端侧生成式AI-20页_4mb
报告摘要
通过 NPU 和异构计算开启终端侧生成式 AI 总结
核心内容
随着生成式AI在多个垂直领域的广泛应用,终端侧计算架构正面临前所未有的挑战。生成式AI的多样化需求和计算复杂性要求处理器具备更高的性能、能效和灵活性。为此,高通通过集成NPU(神经网络处理器)与异构计算架构,打造了面向终端侧的生成式AI解决方案,使AI应用在移动设备、PC和汽车等平台上实现高效运行。
主要观点
- 生成式AI需要多样化的处理器:不同的AI用例(按需型、持续型、泛在型)对处理器的性能、功耗、内存带宽等有不同需求,因此需要多种处理器协同工作。
- NPU是生成式AI的关键组件:NPU专为AI推理设计,能够以低功耗实现高性能计算,尤其适用于大模型推理。高通Hexagon NPU通过持续演进,不断优化以满足AI需求。
- 异构计算是实现最佳AI性能的关键:通过结合CPU、GPU、NPU和传感器中枢,高通AI引擎能够优化AI工作负载的分配,提升整体性能和能效。
- 高通AI引擎是业界领先的异构计算架构:它集成了多种处理器,支持多种AI任务,并通过系统级优化实现协同工作。
- 高通AI软件栈赋能开发者:提供统一的开发环境,支持主流AI框架和运行时,使开发者能够高效创建、优化和部署AI应用。
关键信息
1. NPU的发展历程
- 2015年:骁龙820集成首个高通AI引擎,支持成像、音频和传感器运算。
- 2018年:Hexagon张量加速器引入,提升AI处理能力。
- 2020年:HexagonNPU实现重要架构更新,支持微切片推理和INT4运算。
- 2023年:第三代骁龙8中的HexagonNPU带来98%性能提升和40%能效提升,支持大语言模型(LLM)和大视觉模型(LVM)的高效推理。
2. 高通AI引擎的组成
- Hexagon NPU:核心AI处理器,支持高性能、低功耗的AI推理。
- Adreno GPU:用于并行处理,支持高精度AI运算,如FP32、FP16和INT8。
- 高通Kryo或Oryon CPU:适用于低计算量、高时延敏感型任务。
- 高通传感器中枢:始终在线的AI处理器,适合小型神经网络和泛在型应用。
- 内存子系统:优化内存带宽和数据传输效率,以支持大模型运行。
3. 异构计算的系统级解决方案
- 高通采用系统级方法优化SoC设计,评估硬件、软件和系统架构之间的约束条件和依赖关系。
- 通过定制设计,高通能够实现更高效的处理器协同,而不是简单拼装第三方处理器。
- 异构计算让生成式AI应用在终端侧实现最佳性能、能效和电池续航。
4. 生成式AI用例分类
- 按需型用例:需要快速响应,如语音转录、图像生成等,通常使用NPU或GPU。
- 持续型用例:如实时翻译、视频处理等,需要长时间运行,NPU是最佳选择。
- 泛在型用例:如情境感知助手、自动填充等,适合始终在线的NPU或传感器中枢。
5. 高通AI软件栈
- 支持主流AI框架(TensorFlow、PyTorch、ONNX、Keras)和运行时(TensorFlow Lite、ONNX Runtime等)。
- 提供统一的开发环境,使开发者能够一次编写、跨平台部署AI应用。
- 集成量化工具(如AIMET),支持模型压缩和精度优化,提升能效和性能。
- 通过LLVM编译器和Direct SDK,实现高效的AI推理和跨平台开发。
6. 高通AI引擎的性能表现
- 第三代骁龙8:在MobileBERT模型上表现优于竞品,AI性能领先。
- 骁龙XElite:集成HexagonNPU,算力达45TOPS,支持PC端生成式AI应用。
- 在AI基准测试中,高通平台表现突出,如AIMark、AITuTu和ULProcyonAI基准测试。
结论
高通通过Hexagon NPU和异构计算架构,为终端侧生成式AI提供了高性能、低功耗的解决方案。结合定制设计、系统级优化和强大的AI软件栈,高通不仅在AI硬件上领先,也在软件生态和开发者支持方面具有显著优势。其异构计算架构能够满足从按需型到泛在型AI用例的多样化需求,助力生成式AI在终端设备上的广泛应用和规模化部署。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载