2023中国通用大模型内容生成及安全性能力评测报告-TE智库_25页_3mb
报告摘要
TE智库中国通用大模型内容生成及安全性能力评测报告总结
评测概况
本次评测聚焦中国本土通用大模型的综合能力及安全性表现,对比了文心一言、通义千问、ChatGLM、智脑、讯飞星火等模型与ChatGPT3.5。结果表明,中国大模型在基础服务、交互响应、理解创作等方面已实现与ChatGPT3.5平起平坐,尤其在安全体系能力方面表现领先,并已形成能力梯队。
模型综合能力评测
- 整体实力:国产精品模型(如文心一言、通义千问、ChatGLM)综合实力接近或超越ChatGPT3.5,特定场景表现突出。
- 细分维度:
- 安全体系能力:文心一言、ChatGLM表现领先,具备对违法乱纪、隐私涉密等问题的识别能力,并遵循社会主义核心价值观。
- 深度推理与专业领域:整体表现欠佳,存在幻觉高发、信息陈旧、缺乏专业归纳等问题。
- 基础服务与交互:多数模型表现良好,但文心一言在舆论、政治等领域的响应更优。
建议与措施
- 技术优化:加强专业领域知识更新、减少逻辑幻觉,提升模型的深度推理和归纳能力。
- 合规建设:完善《生成式人工智能服务管理办法》等法规落地,明确研发流程、数据安全标准,强化监管。
- 用户体验提升:加强个性化服务、隐私保护和交互界面优化,增强用户信任感。
- 安全体系强化:推广联合研发机制,构建多主体参与的技术生态,确保模型安全可控地发展。
附录信息
- 评测标准:涵盖基础服务、交互响应、安全体系等六大维度,共计27项指标。
- 模型版本:
- 文心一言:V2.20
- 通义千问:V1.02
- ChatGLM:ChatGLM-6B/ChatGLM-130B
- 智脑360:V3.50
- 讯飞星火:V1.5
通过全面评测与建议措施,国产通用大模型正在逐步缩小与国际产品的差距,并在多个领域实现超越,为中国数字经济的发展奠定了坚实基础。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载