> **来源:[研报客](https://pc.yanbaoke.cn)** 中国通用大模型内容生成及安全性能力评测报告分析总结 TE智库2023年6月发布的报告指出,中国本土通用大模型在技术进步与数据积累推动下,综合能力已接近ChatGPT3.5水平,尤其在安全体系能力方面显著领先。评测涉及6大维度(基础服务能力、交互响应能力、理解创作能力、深度推理能力、专业领域能力、安全体系能力)及27项细化指标,通过统一评测环境与标准化流程,对28个中国大模型及GPT3.5进行对比分析。 报告强调,中国大模型在基础服务及交互响应方面表现稳定,但深度推理和专业领域能力仍需提升。具体表现为:①幻觉发生率较高,出现大量无事实依据或过时信息;②缺乏有效归纳与专业性;③对复杂任务处理能力不足。安全体系能力方面,文心一言、ChatGLM等模型在识别违法乱纪、隐私涉密、谣言造假等任务时表现优异,能基于社会主义核心价值观进行争议性内容客观引导与逻辑诱导问题的正确指引,整体水平高于GPT3.5。 中国大模型发展现状显示,全球已发布79个大模型,其中79个为国产。评测指出,大模型需通过规范化路径保障技术健康发展,已出台相关法律法规如《个人信息保护法》《数据安全法》《网络安全法》及《生成式人工智能服务管理办法》。建议从五方面提升需求侧获得感:1.强化生成内容及安全性能力建设;2.提供个性化服务;3.增强用户体验;4.加强数据安全与隐私保护;5.提高模型准确性。 评测建议包括:①制定法规明确大模型定义、应用边界及合规标准;②建立监管与审计机制定期评估安全风险;③强化技术保障措施如数据加密与漏洞管理;④推动多方合作优化安全体系;⑤完善用户反馈机制持续修正模型缺陷;⑥鼓励安全领域创新研究;⑦开展安全意识培训提升使用规范性。附录显示参与评测的中国大模型包括文心一言、通义千问、ChatGLM、360智脑、讯飞星火等,均采用不同版本进行测试。 总体显示,中国大模型在安全合规性上具备优势,但需在专业领域知识更新与深度推理能力上进一步突破。报告认为,通过技术优化与制度完善,国产大模型有望实现全面超越。