清华大学自动化系:2023预训练大模型与医疗:从算法研究到应用_53页_4mb
报告摘要
预训练大模型与医疗:从算法研究到应用
演讲者:闾海荣博士,清华大学自动化系
大模型概述
-
预训练基础
- 架构:从Word2Vec、Transformer到Context-Aware机制(如GPT)
- 训练:无监督预训练,使用大规模文本数据(如3000亿token),核心目标是预测下一个词
- 表示能力:通过嵌入向量(embedding vector)与位置信息提升
- 类模型:发展史、训练过程、GPT等代表性模型
-
大模型局限
- 可信性问题:缺乏证据支持,无法提供合理验证
- 成本与部署:训练成本高昂(如GPT-3 8.75亿至数千亿美元),工程要求高
- 数据偏见:反映标注者偏好,可能引入新偏见
- 时效性:知识冻结于预训练数据时间点,无法实时更新
- 领域适应性:通用数据训练导致专业领域表现欠佳
可靠性优化方法
- 参数控制:Temperature、Top-p参数调整减少高概率依赖
- 知识嵌入与预测:融合领域知识提升准确性
- 少样本提示与自我一致性:通过具体示例引导模型
- 可解释性技术
- 多层注意力机制解析信息流
- Prompt工程(如ChatGPT时代的交互式提示)
- 结合医学图像与语言模型的协同可解释性
医疗领域应用
- 自动印象生成
- ChatCAD模型融合医学知识与自然语言生成能力
- 医学图像辅助诊断(结合视觉模型与预训练医学知识)
- 临床实践创新
- 提出EnhancedBERT模型架构,优化医疗任务表现
- 开发数基生命交叉创新群体,推动三大方向:
- 医疗信息重构与呈递
- 数据与知识双驱动的数基生命模型
- 疾病数基推演、数智医院建设、全流程患者服务
未解难题
- 多机构数据隐私与安全挑战
- 知识图谱在Prompt设计中的整合
- 人机协作优化迭代机制(人在回路)
- 专业医疗数据集与多模态数据开发
参考文献
- Qiu, Jianing, * "Large AI Models in Health Informatics... arXiv:230311568 (2023)"*
清华探索
- 重塑智能医疗范式:以数据-知识驱动为核心,构建临床预训练模型与知识图谱结合,创新单细胞生物信息学、AI药物试验等领域。
THANKS
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载