社科院-通过prompt调试并比较国内外大模型“人情味”的小实验-2024-30页_2mb
报告摘要
大模型人情味实验分析总结
一、核心研究问题
- 探索prompt调优对大模型“人情味”的提升效果
- 量化分析国内外主流大模型在人情味维度的表现
- 揭示普通人通过实验范式实操提升模型人情味的可行性
二、实验发现总结
1. 模型人情味表现
- 国内模型原生人情味>国外模型(WXY三模>GPT-4≈Vicuna)
- 场景差异:
- 老年话题:国内模型更具人情味
- 心情低落话题:国外模型表现更佳
- 人际关系/职场发展话题:国内模型优势明显
2. Prompt调优效果
- 原则型Prompt更利于提升“拟人”与“共情”维度
- 答案对型Prompt提升效果整体更稳定,效率约为原则型的1.43倍
- 模型适配性:
- 原则型:GPT-4、WXY模型提升更显著(最高提升2431%)
- 答案对型:Vicuna及某些国内模型更易吸收优化
3. 最佳人情味组合TOP3
- 国内模型Y+原则型Prompt(老年话题)
- 国内模型W+答案对型Prompt(残障话题)
- GPT-4+原则型Prompt(人际关系)
三、方法论撰要
1. 实验范式
graph TD
A[问题抽取] --> B[五类大模型原生回答]
B --> C[应用双prompt调试]
C --> D[人工评分体系]
D --> E[人情味三维分析]
2. 评估指标
- 拟人维度:关注回答能否体现人格化表达
- 共情维度:评价是否具备换位思考能力
- 表达维度:侧重温暖关怀的真情流露
四、人情味维度分析
- 拟人能力:所有模型通过原则型Prompt平均提升17.6%
- 共情质量:答案对型Prompt提升效果最佳(平均+25%)
- 表达温度:两项Prompt提升效果相近但天花板较低
五、人类参考基准
- 人类样本答案在全部指标上领先超5倍
- 人类优势集中体现在细微情感洞察力与弹性回应
六、技术启示
- Prompt工程可作为一种“价值上传”的有效技术路径
- 不同模型具备差异化的人情味表达潜力
- 公众参与调优(Public Technology Power)亟需被重视
七、未来建议
- 建立人情味标准接口(拟后续研究)
- 发展轻量化Prompt模板库
- 推动模型伦理方向与用户期待的正向对齐
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载