金融大模型应用评测报告-摘要版(2024)_17页_1009kb
报告摘要
本次金融大模型应用评测报告(2024)由上海人工智能实验室、上海财经大学和上海库帕思科技合作发布,旨在推动金融科技创新应用,提升智能化水平,并探索大模型在金融领域的应用。报告基于《金融大模型应用评测指南》和自定义数据集,评测了14个机构的20个模型,涵盖通用基模和金融垂模。
评测涉及五大能力维度:模型基础能力、金融安全与价值对齐能力、金融风险控制能力、金融专业认知能力和金融业务辅助拓展能力。采用了OpenCompass评估平台,结合主观与客观评分,强调数据安全和准确性。综合评估分数采用线性加权模型,权重分布基于不同维度的重要性。
评测结果显示,模型平均总分为719分,Claude-35-Sonnet-20240620、Step-2-16k/Finstep和Qwen25-72B-Instruct-Qwen2-VL-72B位列前三。具体维度中,金融安全与价值对齐表现优异;但金融专业认知和多模态处理能力尚有不足,尤其在金融投研和投教方面表现较弱。
报告总结指出,当前大模型在金融应用中潜力巨大,但需加强高质量金融语料建设,特别是多模态数据集,以提升模型实际业务能力。建议拓展评测框架,动态更新以紧密结合实践,促进行业规范发展。此外,评测仅限于API或开源模型直接调用,不代表完整产品体验,并附带数据来源和使用限制声明。
报告强调了持续迭代评测方法和数据集的重要性,以应对未来金融安全挑战,并推动大模型在更广泛应用中的落地。总之,本次评测为行业发展提供了参考,指出了未来改进方向。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载