2024-01-15-社科院-调教最暖大模型_30页_3mb
报告摘要
文档总结:调教是太模范生
核心内容
本文通过一个小型实验,探讨了如何通过 prompt 调教 来提升大模型在回答问题时的“人情味”。实验结合了理论分析与实操测试,旨在揭示不同大模型在人情味方面的表现差异,并提供普通人可操作的调教方法。
主要观点
-
“人情味”定义
- 人情味是指人与人之间温暖、关怀的情感表达。
- 从美学、语言学、社会学等角度探讨了人情味的表现形式,包括语气、内容、形式等方面。
- 引入了“人情味量表”,从 拟人、共情、表达 三个层面衡量大模型回答的人情味。
-
实验对象与方法
- 实验对象包括 2款国外大模型(GPT-4、Vicuna) 和 3款国内大模型(W、X、Y)。
- 实验采用 “原则型” 和 “答案对型” 两种 prompt 类型,分别对大模型进行调教。
- 通过 焦点小组访谈 和 人工评分,评估不同大模型在不同话题下的“人情味”表现。
-
实验发现
- 原始状态下,国内大模型在 老年话题 下的人情味表现更佳,而国外大模型在 心情低落 相关话题中更胜一筹。
- Prompt 调教后,GPT-4 人情味提升最为明显(上升 24.31%),而 Vicuna 和国内大模型 X 更适合使用“答案对型” prompt。
- “原则型” prompt 在提升“拟人”层面表现更佳,而“答案对型” prompt 更适用于特定情境下的回答。
- 人类样本在“人情味”表现上显著优于所有大模型,表明人情味不仅是技术问题,更是情感与价值观的体现。
-
人情味提升的难点
- 大模型在“表达友善度”方面提升有限,说明“善意”和“温暖”的表达更难被程序化或结构化。
- 调教大模型需结合具体情境,不能只依赖“抄作业”或“喂答案”,而应理解其背后的价值观与情感逻辑。
-
公众科技力倡议
- 实验强调“公众科技力”(Intelligent Participation)的重要性,主张普通人应更多参与 AI 技术的调教与优化,特别是在弱势群体的视角下,使 AI 更贴近人类情感需求。
- 通过调教,普通人可以提升大模型的“人情味”,实现科技与人文的结合。
关键信息
- 人情味的三个层面:拟人、共情、表达。
- 两种 prompt 类型:
- 原则型:强调语气、内容、形式的“人情味”原则,如“温和建议”、“正确真实”、“多用‘你’和‘我’”。
- 答案对型:基于实际问答案例,邀请专家撰写回答,作为调教的参考。
- 实验结果:
- 国内大模型在老年话题下表现更优,国外大模型在职场发展相关话题中更得人心。
- GPT-4 在 prompt 调教后提升最大,达到 24.31%。
- 人类样本在“人情味”表现上全面领先,强调人类情感的不可替代性。
- 彩蛋:邀请 20 位 00 后大学生作为人类样本,参与人情味回答的撰写,并与大模型回答进行对比。
实验结构
- 前言:引出人情味的重要性,说明实验目的。
- 研究问题:明确实验要解决的核心问题,包括人情味的定义、表现及提升方式。
- 第一章 | 理论:从多学科角度探讨人情味的内涵与测量方法。
- 第二章 | 测温:展示原始状态下大模型在不同话题下的人情味表现。
- 第三章 | 实操:介绍如何撰写“原则型” prompt。
- 第四章 | 技巧:比较两种 prompt 的效果,提出最佳搭配组合。
- 第五章 | 实战:分析大模型在人情味方面的提升难点。
- 彩蛋 | 人类的光辉:展示人类样本在人情味上的优势。
- 附录:详细说明实验流程。
- 作者与团队:列出参与实验的顾问与研究团队。
总结
本文通过一个具有人文关怀的实验,揭示了大模型在“人情味”方面的表现与提升潜力。实验表明,普通人可以通过简单的 prompt 调教显著增强大模型的情感表达能力,但“善意”与“温暖”仍需更深入的价值观引导。同时,实验也提醒我们,AI 的发展不应只依赖技术,更应融入人类情感与社会需求,推动“公众科技力”的形成。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载