2025年NVIDIAAI研发技术开放日主题演讲-加速计算专场_206页_11mb
报告摘要
会议概述
本次事件为NVIDIA赞助的GPU编程与AI优化研讨会,包含主题演讲、分组讨论及答疑环节。演讲内容围绕GPU优化、大语言模型开发、向量数据库加速及推荐系统优化等AI领域焦点,展示了实际应用和技术深度。
主要演讲总结
-
开场致辞
李曦鹏(NVIDIA亚太区总经理)介绍了会议主题,强调GPU技术在AI生态中的核心角色,呼吁参会者探索高效计算策略。 -
GPU编程和优化 – 最佳实践分享(刘冰/郑鹏)
演讲聚焦CUDA优化基础:讨论了全局内存访问共alescence、共享内存银行冲突以及指令级和线程级并行(ILP/TLP)的重要性。案例分析包括矩阵运算(如GEMM)和Flash Attention实现,展示了通过优化内存访问和计算策略提升GPU利用率的具体方法,主要结论是最大化内存带宽并通过向量化技术加速运算。 -
NVIDIA NeMo框架介绍 – 大语言模型全周期开发(姚鑫/颜子杰)
基于NeMo框架的演示,分享了从预训练到推理部署的完整流程,支持Llama2等模型。突出了框架的可扩展性、分布式训练和优化工具(如ZeRO-1、FP8混合精度),并展示了NeMo Launcher的功能,它能自动化配置并加速训练(如H100 FP8对比A100 BF16的性能提升),适用于监督微调(SFT)和基于PPO的强化学习。 -
TensorRT Hackathon 2023总结(季光/陈庾)
回顾了Hackathon活动,主题包括AI生成内容(AIGC)和语言模型推理优化。初赛要求优化Stable Diffusion+ControlNet流水线,复赛允免费自选模型(如TensorRT-LLM),展示了开发者社区成果,如权重量化和INT8 KV缓存优化推荐。活动成绩显示了TensorRT在加速端侧应用的潜力,促进了NVIDIA生态开发。 -
向量数据库的加速策略和实战(王雍/张静蓉)
使用RAFT框架,探讨了GPU上近似最近邻搜索(ANN)的算法,比较了Brute-Force、IVF-Flat、IVF-PQ和CAGRA等方法。通过RAFT优化示例,突出了GPU的带宽优势和并行处理能力,针对高维数据集提出了平衡存储层级策略。 -
推荐系统的最新优化策略和实践(魏英灿/王泽寰)
中心议题是Hierarchical Parameter Server(HPS),用于大规模推荐系统。介绍了GPU嵌入推理缓存(EIC)的实现方式,包括锁机制(设备锁、主机锁、无锁),分析了不同策略在查询和更新场景下的性能。重点展示了EIC的硬件友好性,通过实际测试数据证明了其在NVIDIA GPU上的速度提升。
结语与问答环节
会议结束时进行了幸运抽奖,并邀请参会者参与NVIDIA专家技术讨论,进一步解答具体问题,强调了实践社区在推进GPU应用中的作用。推荐系统部分的优化策略已整合到开源工具中,可供下载使用。
试读结束,高清完整版pdf/doc/ppt,请点下载