Google上下文工程_会话和记忆_53页_5mb
报告摘要
上下文工程总结
核心内容
上下文工程是构建有状态、智能化的大语言模型(LLM)智能体的关键技术,它通过动态组装和管理信息,使AI能够“记住”用户、“学习”偏好并实现个性化交互。本白皮书围绕会话(Sessions)与记忆(Memory)两大支柱,探讨了它们的实现方式、管理策略、生产环境考量及与其他系统(如RAG)的协同。
主要观点
-
上下文工程的必要性:
- LLM本质上是“无状态”的,依赖于每次调用的上下文窗口。
- 为了实现个性化与持久性,开发者必须主动构建和管理上下文。
-
会话(Session)的定义与作用:
- 会话是单次交互的“快照”,包含事件日志与工作状态。
- 会话用于临时存储与当前任务相关的数据,如用户输入、模型输出、工具调用等。
-
多智能体系统中的会话管理:
- 会话历史可被共享或独立维护,取决于系统架构。
- 共享模式适用于紧密协作任务,独立模式适用于隐私敏感场景。
-
记忆(Memory)的定义与作用:
- 记忆是长期信息留存机制,用于构建个性化体验和持久认知。
- 与会话不同,记忆是经过提炼的、结构化的信息快照。
-
记忆的类型与组织模式:
- 记忆分为陈述性(Declarative)和程序性(Procedural)。
- 组织模式包括集合、结构化用户画像和滚动摘要。
-
RAG与记忆管理器的区别:
- RAG关注外部知识注入,记忆管理器关注用户个性化信息的提取与整合。
- 二者共同支撑智能体的认知能力,形成“外脑”与“内脑”的协同。
-
记忆生成与管理流程:
- 包括数据摄入、提取与筛选、整合处理、存储持久化。
- 提取过程需结合主题定义与LLM的智能判断。
关键信息
上下文工程的三类信息
- 指导推理的上下文:
- 包括系统指令、工具定义、示例。
- 事实与证据:
- 包括长期记忆、外部知识、工具输出、子智能体输出、工件。
- 当前对话的即时信息:
- 包括对话历史、状态/草稿板、用户当前提问。
上下文管理流程
- 获取上下文:从记忆库、RAG系统、对话历史中提取信息。
- 准备上下文:将信息动态组装成模型可理解的格式。
- 调用模型与工具:生成响应,并将结果追加到上下文中。
- 上传上下文:将新生成的信息写入持久化存储,用于后续记忆整合。
上下文压缩策略
- 简单截断:保留最近N轮对话。
- 基于token限制的截断:从最新消息反向累加token。
- 递归摘要:使用LLM对旧对话生成摘要。
- 成本考量:高级压缩策略可能增加LLM调用成本,需权衡。
记忆的存储与检索
- 存储架构:
- 向量数据库:支持语义相似性检索。
- 知识图谱:支持关系推理。
- 混合架构:结合向量与关系结构,实现最佳实践。
- 记忆作用域:
- 用户级:绑定用户ID,跨会话持久化。
- 会话级:仅限单次会话的摘要。
- 应用级:全局共享,但需脱敏。
记忆生成机制
- 提取方式:
- 基于Schema与模板提取。
- 基于自然语言的主题定义。
- 少样本提示提取。
- 整合策略:
- 冲突解决。
- 去重与归一化。
- 新信息与现有记忆的融合。
生产环境考量
- 安全性与隐私:
- 严格隔离,使用ACL与身份认证。
- 数据脱敏,防止敏感信息泄露。
- 数据完整性:
- 实施TTL策略,自动清理长期不活跃会话。
- 保证事件按时间顺序追加,确保数据一致性。
- 性能与可扩展性:
- 优化会话数据读写,减少延迟。
- 使用异步压缩与记忆生成,避免阻塞主流程。
技术建议
- 使用外部记忆服务(如Agent Engine Memory Bank)可减少开发负担,提升系统健壮性。
- 混合使用Schema与少样本提示,适用于不同类型的提取需求。
- 优先采用异步机制处理记忆生成与压缩,避免影响用户体验。
- 结合记忆与RAG,实现“外部知识”与“用户个性化”的双重支撑。
总结
上下文工程与记忆系统是构建Agentic AI的核心,它们共同解决了LLM的无状态性问题,使AI能够“记住”用户、理解任务并进行个性化交互。通过智能的会话管理与记忆生成机制,开发者可以构建更稳定、高效、个性化的智能体系统。同时,必须重视隐私、安全与性能优化,以确保系统的可持续发展与用户信任。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载