> **来源:[研报客](https://pc.yanbaoke.cn)** # 科学计算与AI4S基础设施白皮书总结 ## 核心内容 本白皮书系统梳理了科学计算与AI4S(科学智能)的发展现状、技术体系、市场格局与落地实践,重点分析了AI4S在科研范式变革、产业应用与技术瓶颈方面的影响与挑战。白皮书指出,AI4S是推动科研迈向智能化、自动化的重要方向,其发展依赖于算力、模型与数据三大核心要素,其中数据成为当前最突出的“卡脖子”瓶颈。 ## 主要观点 - **AI4S是科研第五范式**,融合人工智能、大数据与高性能计算,实现科研全流程自动化,推动从基础研究到产业应用的高效转化。 - **科学计算是AI4S的核心支撑**,通过数值仿真与高精度建模,为AI模型提供高质量、标准化数据集,解决传统实验无法观测的微观机理问题。 - **算力需求可控**,但传统通用超算在处理复杂仿真任务时存在效率低、通信延迟高、能耗大等局限性,专用超算成为支撑高端科学计算的关键基础设施。 - **高质量数据集的构建面临三大挑战**:数据存量不足、整合困难、核心数据保密,需国家层面统筹布局,推动“端到端”数据体系建设。 - **数据是模型能力的决定因素**,AI模型的训练依赖于精准、完整、可复用的数据体系,需从“逆向”角度构建数据集,以提升模型的科学性和实用性。 - **专用超算是解决算力瓶颈的关键**,各国在生物、材料等领域的专用超算系统取得显著进展,而我国在材料科学专用超算方面仍处于起步阶段。 ## 关键信息 ### AI4S的核心要素 - **算力**:当前需求相对可控,无需巨额投入。 - **模型**:研发难度适中,依赖专业人才支撑。 - **数据**:是最大的瓶颈,需构建精准、标准化、端到端的高质量数据集。 ### 数据构建的核心挑战 - **数据稀缺**:生物医药、新材料等领域的实验数据多为碎片化、非标准化。 - **数据孤岛**:企业不愿共享核心数据,导致数据整合困难。 - **数据质量**:需确保数据的准确性、完整性与可解释性,避免模型学习错误规律。 ### 数据构建策略 - **逆向构建**:以已有上市药物和临床失败案例为基础,构建端到端数据集。 - **两步走策略**:先验证单条数据闭环,再批量构建代表性数据,确保数据的多样性与精准性。 - **系统规划**:需从科学角度出发,制定统一的数据标准与建设流程,整合多方资源。 ### 专用超算技术发展 - **“天穹”专用超算**:具备算法级全局优化能力,采用定制芯片、专用系统架构与计算软件,实现高性能、高能效。 - **国际发展现状**: - **美国**:开发了ANTON系列生物专用超算,具备超高模拟效率,TPU等AI专用平台也在快速发展。 - **日本**:富岳(Fugaku)超算在性能与能效方面领先,已应用于AI、药物研发、新材料等领域。 - **欧洲**:EuroHPC计划推动AI优化型超算和“AI工厂”发展,MaX专注于材料科学的E级计算优化。 - **中国**:在AI计算领域发展迅速,但在材料科学专用超算方面仍需加强。 ### 典型应用案例 - **生物医药**:AlphaFold、英伟达与礼来共建AI超级工厂、思朗科技基于“天穹”打造制药新引擎sDDE。 - **新材料**:谷歌DeepMind发现38万种无机材料、宁德时代筛选26种电解液添加剂、中石油与中石化开展高性能材料研发。 - **其他领域**:字节跳动推出BAMBOO助力电解质设计、波音利用虚拟仿真加速新机型研发、台积电采用英伟达平台突破芯片制程瓶颈。 ## 发展建议 - **国家层面统筹**:应由国家主导,推动科学数据中心、专用算力集群与产学研协同攻关体系的建设。 - **构建数据体系**:需建立标准化、可复用的端到端数据集,提升数据质量与多样性。 - **推动专用超算发展**:加快材料科学、生物计算等领域的专用超算研发,突破国外技术垄断。 - **加强产学研协同**:鼓励企业提出真实科研问题,AI企业围绕问题构建专用模型与数据体系,形成“产业出题、AI解题”的闭环模式。 ## 市场趋势 - **全球AI4S市场快速增长**,各国纷纷出台政策推动AI与科学深度融合。 - **我国在AI+制造、AI+生物等领域**已形成初步应用,但数据与专用超算仍需加强。 - **市场规模扩大**,预计在2027年实现100个高质量数据集、500个典型应用场景的落地。 ## 结论 科学计算与AI4S的深度融合将成为新一代科研范式的核心驱动力,是推动科技创新、提升产业竞争力的关键路径。AI4S的发展不仅需要算力与模型的协同优化,更依赖于高质量数据集的构建。未来,需通过国家统筹、企业协作、科研创新,构建自主可控的AI4S产业链生态,实现科技自立自强与全球科技竞争的突破。