浙江大学2025生成式人工智能赋能智慧司法及相关思考报告64页_8mb
报告摘要
生成式人工智能发展脉络以GPT系列和DeepSeek为例:GPT-1至GPT-4逐步实现从预训练到多模态、少样本学习的突破,参数规模从117亿增长至18万亿,训练数据覆盖45TB至5000亿token。DeepSeek通过混合专家模型、低秩注意力机制等技术,实现6710亿参数的模型构建,并推出开源版本R1,性能接近OpenAI的o1模型。其发展体现数据规模、模型复杂度与算力需求的协同增长。
生成式人工智能赋能智慧司法主要路径包括:1. 构建司法垂直领域大模型,如“智海-录问”,整合40G法律数据、3189部法律、50504部法规,通过多轮指令微调提升专业能力;2. 大小模型协同,如DeepSeek-R1与Qwen-14B结合,采用数据蒸馏、强化学习等技术优化法律推理;3. 应用于案情分析、判决预测、文书生成等场景,部分任务如裁判文书生成完整度达90-95%,当庭宣判率提升至90%以上。当前司法痛点包括案多人少、裁判标准不统一、模型可解释性不足等问题,垂直大模型通过知识注入和逻辑学习尝试解决。
生成式人工智能的局限性体现在:1. 数据关联不可解释,如混淆偏差导致虚假关联(如太阳镜销量与冰激凌销量的虚假相关);2. 关联无法支撑决策,如小孩阅读能力与鞋码的强相关性不代表因果关系;3. 关联不稳定,随数据变化而波动;4. 可能引发不公平性,如人脸识别系统可能因数据偏见产生歧视。技术瓶颈包括大模型幻觉问题、专业领域推理能力不足等。解决方案涉及因果推理框架、高质量数据训练、知识蒸馏及混合专家架构优化。
人类智能与机器智能存在本质差异:机器依赖数据驱动和概率输出,缺乏直觉和常识推理能力。莫拉维克悖论表明,复杂推理易解而简单任务难解。生成式AI需通过价值观对齐、安全性设计等技术突破实现从关联学习到因果推理的跨越,以达成“知其然并知其所以然”的目标。当前技术发展推动AI从内容生成向专业领域应用延伸,但需警惕虚假关联带来的决策风险,并探索人类与AI协同进化路径。
试读结束,高清完整版pdf/doc/ppt,请点下载