2025年机器语言大模型赋能软件自主可控与安全可信报告-清华大学(朱文宇)_28页_3mb
报告摘要
小结:机器语言大模型赋能软件自主可控与安全可信
1. 背景与挑战
- 软件生态的基石但面临困境:
- 关键软件(操作系统、工业设计软件 CAD/CAE/CAM、工业控制软件、企业管理系统 ERP/CRM/SCM、移动应用生态等)长期以来由国外主导。
- 自主可控挑战: 面临断供风险、安全隐患、知识壁垒。许多关键软件闭源,供应链风险高。
- 安全可信挑战: 软件安全风险未知且层出不穷(恶意代码、未明漏洞、勒索软件等)。目标软件闭源导致分析难度大,隐藏安全问题深。
2. 研究的关键问题
- 核心问题在于分析和理解闭源的目标软件,特别是其安全性。
3. 智能化解决方案:机器语言大模型(MLLM)
- 核心理念: 利用大语言模型(LLM)能力解析二进制程序,解决软件自主可控和安全可信的技术瓶颈。
- 软件表示方式: 将软件解析为“源代码 - 二进制程序 - 程序执行”三个维度的表示,并建立抽象层级。
- 现有局限: 传统大语言模型对二进制程序的解析能力有限。
4. 技术突破与创新
- 融合领域知识的模型优化:
- 修改模型设计,融入代码指令语义和跳转关系等知识。例如,“跳转嵌入”概念的引入。
- 发表在 ISSTA 2022, IEEE S&P 等顶级会议/期刊。
- 基于对比学习的语义理解: 测量函数等代码元素的相似度,提高语义理解精度。
- 基于多模态学习的语义理解(CLAP): 融合汇编代码及其自然语言解释,对齐语义空间,提升二进制代码语义表示的准确性。
- 源自领域知识的数据生成: 通过专业数据标注(源代码、二进制、文本、二进制对齐数据)和模型优化来构建和训练专门面向二进制软件的模型。
5. 功能与愿景
- 对标传统工具: 其反汇编、结构分析、功能理解等核心功能已全面超越 IDA Pro。
- 超越人类专家: 实现接近或超越资深专家水平的程序语义理解。
- 软件分析新范式: 将人从繁琐的底层代码分析中解放,专注于高层分析任务。
- 广泛的应用场景:
- 软件供应链分析: 版权分析、漏洞挖掘、一致性检测、软件生态迁移。
- 软件逆向分析: 将黑盒二进制程序反编译似白盒代码,辅助安全分析、代码修复、功能还原。
- 攻击防御、软件保护分析、软件功能拓展等。
6. 产业意义
- 致力于提供安全分析、性能优化、功能拓展等智能化工具。
- 实现软件分析领域的创新,支持国家战略下的软件自主可控与安全可信发展。
7. 解决方案代表:机器语言大模型(MLM)
- 基于上述关键技术构建的全球首个专注于解析二进制程序的模型。
- 覆盖搜索、分类、比较、结构分析、语义理解、功能翻译等多功能。
- 是支撑软件自主可控与安全可信的具体核心技术解决方案。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载