【谷歌】2025年Agents与基础应用白皮书_42页_4mb
报告摘要
代理人白皮书总结
核心内容
本白皮书探讨了生成式人工智能代理(Agent)的概念、结构和应用。代理是一种能够利用工具和外部信息来完成复杂任务的程序,其能力远超单一语言模型(LM)的限制。代理通过认知架构进行推理、规划和决策,能够自主执行任务并实现目标。
主要观点
-
代理的定义
代理是一种应用,通过观察世界并使用工具来实现目标。它们能够独立于人类干预执行任务,甚至在没有明确指令的情况下进行推理和决策。 -
模型的作用
在代理中,模型是决策的核心。它可以是通用型、多模式或微调后的语言模型,用于执行推理任务并决定何时使用工具。模型可以使用如ReAct、Chain-of-Thought(CoT)或Tree-of-Thoughts(ToT)等框架进行推理。 -
工具的类型与功能
工具是代理与外部世界交互的关键。它们可以是扩展、函数调用或数据存储:- 扩展:允许代理无缝调用外部API,例如Google Flights API。
- 函数调用:在客户端执行,提供对API调用的额外控制,适用于安全限制、异步操作或数据转换场景。
- 数据存储:为代理提供对结构化和非结构化数据的访问,支持检索增强生成(RAG)等应用。
-
编排层
编排层是代理的核心组件,负责信息处理、推理和决策。它通过循环机制(如ReAct)来引导代理执行任务,确保代理能够根据当前状态和外部信息动态调整策略。 -
代理 vs. 模型
模型和代理在功能上有显著区别:- 模型基于训练数据进行推理,无法与外部世界交互。
- 代理利用工具扩展其能力,能够访问实时数据并执行现实世界中的操作。
-
有针对性的学习方法
为了提升模型在代理环境中的表现,可以采用以下方法:- 上下文学习:通过提供提示、工具和示例,让模型在推断时“即兴学习”。
- 基于检索的上下文学习:从外部数据中动态检索相关信息,以增强模型的推理能力。
- 基于微调的学习:使用特定任务的数据集对模型进行微调,以优化其工具使用能力。
-
代理的实现与应用
代理可以通过开源工具如LangChain和LangGraph快速构建原型。Google的Vertex AI平台提供了一个完全托管的环境,允许开发人员轻松集成代理、工具、数据存储等组件,以构建生产级应用。
关键信息
- 代理通过使用工具扩展其能力,能够完成模型无法独立完成的任务。
- 编排层是代理实现复杂任务的关键,负责信息处理、推理和决策。
- 工具分为扩展、函数调用和数据存储三类,每种工具适用于不同的场景。
- 有针对性的学习方法(如上下文学习、基于检索的上下文学习和微调)有助于提高代理的性能和准确性。
- LangChain和LangGraph等库为代理开发提供了便利的工具,而Vertex AI平台则简化了生产级代理的构建和部署。
示例与实现
- 代理可以使用ReAct框架进行多步骤推理,例如搜索航班信息并获取目的地地址。
- 示例扩展如Code Interpreter允许代理生成并执行代码。
- 函数调用示例展示了如何将自然语言输出转换为结构化格式(如JSON)以便客户端处理。
- 数据存储通过向量搜索使代理能够检索并处理外部信息,从而支持RAG应用。
未来展望
- 代理的发展前景广阔,随着工具和推理能力的提升,它们将能够解决更复杂的问题。
- “代理链接”战略方法将推动多代理系统的发展,通过结合不同领域的专家代理,实现更全面和高效的任务执行。
- 构建复杂的代理系统需要迭代和实验,以适应不同业务需求和组织目标。
工具总结
| 工具类型 | 执行位置 | 用例 |
|---|---|---|
| 扩展 | 代理端 | 与API端点交互,多跳规划,使用预构建扩展(如代码解释器) |
| 函数调用 | 客户端 | 安全限制、异步操作、数据转换、避免部署额外基础设施 |
| 数据存储 | 代理端 | 访问结构化和非结构化数据,实现RAG应用 |
参考文献
- Shafran, I., Cao, Y. 等,2022年,'ReAct: Synergizing Reasoning and Acting in Language Models'. 链接
- Wei, J., Wang, X. 等,2023年,'Chain-of-Thought Prompting Elicits Reasoning in Large Language Models'. 链接
- Wang, X. 等,2022年,'Self-Consistency Improves Chain of Thought Reasoning in Language Models'. 链接
- Diao, S.等,2023年,'使用思维链的主动提示,针对大型语言模型'. 链接
- Zhang, H.等,2023年,'语言模型中的多模态思维链推理'. 链接
- Yao, S.等,2023年,'思维树:大型语言模型的刻意问题解决'. 链接
- Long, X., 2023, '大型语言模型指导的思维树'. 链接
- Google. 'Google Gemini 应用程序'. 链接
- Swagger. 'OpenAPI规范'. 链接
- Xie, M., 2022, '在上下文学习中如何工作? 理解与传统监督学习的区别的框架'. 链接
- Google Research. 'ScaNN (可扩展最近邻)'. 链接
- LangChain. 'LangChain'. 链接
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载