谷歌-2025年Agents与基础应用白皮书

  • 来源:谷歌
  • 发布时间:2025/03/27
  • 浏览次数:125
  • 举报
相关深度报告REPORTS

谷歌-2025年Agents与基础应用白皮书.pdf

谷歌-2025年Agents与基础应用白皮书。⼈类擅⻓于混乱的模式识别任务。然⽽,他们经常依赖⼯具-如书籍、⾕歌搜索或计算器-来补充他们的先前知识,然后得出结论。就像⼈类⼀样,⽣成式⼈⼯智能模型可以被训练使⽤⼯具来访问实时信息或建议现实世界中的⾏动。例如,⼀个模型可以利⽤数据库检索⼯具来访问特定信息,⽐如客⼾的购买历史,以便为其⽣成定制的购物建议。或者,基于⽤⼾的查询,模型可以发起各种API调⽤,以向同事发送电⼦邮件回复或代表您完成财务交易。为了做到这⼀点,模型不仅需要访问⼀套外部⼯具,还需要有计划地执⾏任何任务的能⼒,这种推理、逻辑和对外部信息的访问相结合,与⽣成式⼈⼯智能模型相关联,激发了...

由谷歌发布了《谷歌-2025年Agents与基础应用白皮书》这篇报告。以下是对该报告的部分摘录,完整内容请获取原文查看。⼈类擅⻓于混乱的模式识别任务。然⽽,他们经常依赖⼯具 - 如书籍、⾕歌搜索或计算器 - 来补 充他们的先前知识,然后得出结论。就像⼈类⼀样,⽣成式⼈⼯智能模型可以被训练使⽤⼯具 来访问实时信息或建议现实世界中的⾏动。

1.什么是代理?

以其最基本的形式⽽⾔,⽣成式⼈⼯智能代理可以被定义为⼀种应⽤,它通过观察世界并利⽤⼿ 头的⼯具采取⾏动来尝试实现⼀个⽬标。代理是⾃治的,可以独⽴于⼈类⼲预,尤其是在提供适 当的⽬标或⽬标以供实现时。代理也可以积极主动地努⼒实现他们的⽬标。即使在没有来⾃⼈类 的明确指令集的情况下,代理也可以推理出下⼀步该做什么来实现其最终⽬标。尽管⼈⼯智能中 代理的概念⾮常普遍⽽强⼤,但本⽩⽪书着重于⽣成式⼈⼯智能模型在出版时能够构建的特定类 型的代理。 为了理解代理的内部运作,让我们⾸先介绍驱动代理⾏为、动作和决策的基础组件。这些组件 的组合可以被描述为⼀种认知架构,通过这些组件的混合和匹配可以实现许多这样的架构。

模型

在代理范围内,模型指的是将被⽤作代理过程中央决策者的语⾔模型(LM)。代理使⽤的模型 可以是⼀个或多个规模任意⼤⼩(⼩型/⼤型)的LM,能够遵循基于指令的推理和逻辑框架,例 如ReAct、Chain-of-Thought或Tree-of-Thoughts。模型可以是通⽤型、多模式的,或者根据 特定代理架构的需求进⾏微调。为了获得最佳的⽣产结果,您应该利⽤最适合您期望的最终应⽤ 程序的模型,并且最好是已经训练过与您计划在认知架构中使⽤的⼯具相关的数据特征。值得注 意的是,模型通常不会根据代理的特定配置设置(即⼯具选择、编排/推理设置)进⾏训练。然⽽ ,通过为模型提供展⽰代理能⼒的⽰例,包括代理在各种情境中使⽤特定⼯具或推理步骤的实例 ,可以进⼀步完善模型以适应代理的任务。

工具

尽管基础模型在⽣成⽂本和图像⽅⾯令⼈印象深刻,但由于⽆法与外部世界进⾏交互,因此受到 限制。⼯具弥合了这⼀差距,赋予代理⼈与外部数据和服务交互的能⼒,同时解锁了除基础模型 本⾝之外更⼴泛的⾏动范围。⼯具可以采取各种形式,具有不同的复杂度,但通常与常⻅的Web API⽅法(如GET,POST,PATCH和DELETE)相⼀致。例如,⼀个⼯具可以更新数据库中的 客⼾信息或获取天⽓数据以影响代理向⽤⼾提供的旅⾏建议。有了⼯具,代理可以访问和处理现 实世界的信息。这使它们能够⽀持更专业的系统,如检索增强⽣成(RAG),这显著扩展了代理 的能⼒,超出了基础模型本⾝可以实现的范围。我们将在下⾯更详细地讨论⼯具,但最重要的是 要了解⼯具弥合了代理的内部能⼒与外部世界之间的差距,从⽽打开了更⼴泛的可能性。

编排层

编排层描述了⼀个循环过程,规定了代理如何接收信息,进⾏⼀些内部推理,并利⽤该推理指 导其下⼀步⾏动或决策。⼀般情况下,这个循环将继续,直到代理达到其⽬标或⼀个停⽌点。 编排层的复杂性可以根据代理和任务的不同⽽⼤不相同。有些循环可能只是简单的计算和决策 规则,⽽其他循环可能包含链接逻辑、涉及其他机器学习算法或实现其他概率推理技术。我们 将在认知架构部分更详细地讨论代理编排层的详细实施。

2.工具:连接外部世界的关键

虽然语⾔模型擅⻓处理信息,但缺乏直接感知和影响现实世界的能⼒。这限制了它们在需要与外 部系统或数据进⾏交互的情况下的有⽤性。这意味着,在某种意义上,语⾔模型只是根据从训练 数据中学到的知识⽽已。但⽆论我们向模型提供多少数据,它们仍然缺乏与外部世界交互的基本 能⼒。那么我们如何赋予我们的模型与外部系统实时、上下⽂感知的交互能⼒呢?功能、扩展、 数据存储和插件都是提供这⼀关键能⼒给模型的⽅式。

虽然它们有很多不同名称,但⼯具是连接我们基础模型和外部世界之间的纽带。这种与外部系 统和数据的连接使得我们的代理能够执⾏更多种类的任务,并且更加准确可靠。例如,⼯具可 以使代理调整智能家居设置,更新⽇历,从数据库中获取⽤⼾信息,或根据特定指令发送电⼦ 邮件。 截⽌本出版⽇期,Google 模型能够与三种主要⼯具类型进⾏交互:扩展、功能和数据存储。通 过为代理配备⼯具,我们释放了它们理解世界并对其采取⾏动的巨⼤潜⼒,为许多新应⽤和可能 性打开了⼤⻔。

扩展

理解扩展的最简单⽅式是将其视为以标准化⽅式桥接API和代理的⽅式,允许代理⽆缝执⾏API, ⽽不考虑其基础实现。假设您构建了⼀个旨在帮助⽤⼾预订航班的代理。您知道您希望使⽤Goog le Flights API获取航班信息,但您不确定如何让您的代理调⽤此API端点。

⼀种⽅法是实现⾃定义代码,该代码将接收的⽤⼾查询,解析查询以获取相关信息,然后进⾏AP I调⽤。例如,在航班预订⽤例中,⽤⼾可能会说“我想要从奥斯汀到苏黎世订⼀张⻜机票。” 在这种情况下,我们的⾃定义代码解决⽅案需要从⽤⼾查询中提取“奥斯汀”和“苏黎世”作为 相关实体,然后再尝试进⾏API调⽤。但是,如果⽤⼾说“我想要去苏黎世订⼀张⻜机票”⽽没 有提供出发城市怎么办?缺少必要数据会导致API调⽤失败,需要实现更多代码来捕获这类边缘 和特殊情况。这种⽅法不具备可扩展性,很容易在超出实现的⾃定义代码范围的任何情况下出现 故障。

更具韧性的⽅法是使⽤扩展。扩展通过以下⽅式弥合了代理和API之间的差距: 1 。通过⽰例教导代理如何使⽤API端点。 2 。教导代理成功调⽤API端点所需的参数或参数是什么。

扩展可以独⽴制作,但应作为代理配置的⼀部分提供。代理在运⾏时使⽤模型和⽰例来决定哪个 扩展,如果有合适于解决⽤⼾查询的,这凸显了扩展的⼀个关键优势,即内置⽰例类型,允许代 理动态选择最适合任务的扩展。

就像软件开发⼈员在解决⽤⼾问题时决定使⽤哪些 API 端点⼀样。如果⽤⼾想要订机票,开发 ⼈员可能会使⽤ Google Flights API。如果⽤⼾想知道最近的咖啡店距离他们的位置有多远, 开发⼈员可能会使⽤ Google Maps API。Agent / model stack 也是这样使⽤⼀组已知扩展来 决定哪个最适合⽤⼾的查询。如果想看到扩展的操作,可以尝试在 Gemini 应⽤程序上测试它 们,⽅法是转到设置 > 扩展,然后启⽤您想测试的任何扩展。例如,您可以启⽤ Google Fligh ts 扩展,然后问 Gemini “显⽰下周五从奥斯汀到苏黎世的航班。”

函数

在软件⼯程领域,函数被定义为完成特定任务的⾃包含代码模块,并可以根据需要重复使⽤ 。当软件开发⼈员编写程序时,他们通常会创建许多函数来执⾏各种任务。 他们还会定义何时调⽤function_a与function_b的逻辑,以及预期的输⼊和输出。 在代理的世界⾥,函数的⼯作⽅式与软件开发⼈员类似,但我们可以⽤⼀个模型来代替软件开 发⼈员。模型可以采⽤⼀组已知的函数,并根据函数的规范决定何时使⽤每个函数以及函数需 要什么参数。函数与扩展在⼀些⽅⾯有所不同,尤其是: 1 模型输出函数及其参数,但不进⾏实时API调⽤。 2 函数在客⼾端执⾏,⽽扩展在代理端执⾏。

在软件⼯程领域,函数被定义为完成特定任务的⾃包含代码模块,并可以根据需要重复使⽤ 。当软件开发⼈员编写程序时,他们通常会创建许多函数来执⾏各种任务。 他们还会定义何时调⽤function_a与function_b的逻辑,以及预期的输⼊和输出。 在代理的世界⾥,函数的⼯作⽅式与软件开发⼈员类似,但我们可以⽤⼀个模型来代替软件开 发⼈员。模型可以采⽤⼀组已知的函数,并根据函数的规范决定何时使⽤每个函数以及函数需 要什么参数。函数与扩展在⼀些⽅⾯有所不同,尤其是: 1 模型输出函数及其参数,但不进⾏实时API调⽤。 2 函数在客⼾端执⾏,⽽扩展在代理端执⾏。

3.通过有针对性的学习提升模型性能

有效使⽤模型的关键在于其在⽣成输出时选择正确⼯具的能⼒,特别是在⽣产规模中使⽤⼯具 时。虽然⼀般培训有助于模型培养这种技能,但真实场景通常需要超出训练数据的知识。可以 将这看作是基本烹饪技能和掌握特定烹饪技艺之间的区别。两者都需要基本烹饪知识,但后者 需要有针对性的学习以获得更加微妙的结果。

为了让模型获得这种特定知识,存在⼏种⽅法: 上下⽂学习:这种⽅法在推断时为通⽤模型提供提⽰、⼯具和少量⽰例,使其能够‘即兴学 习’如何以及何时使⽤这些⼯具来完成特定任务。ReAct 框架是⾃然语⾔处理中这种⽅法的 ⼀个例⼦。 • 基于检索的上下⽂学习:这种技术通过从外部内存中检索最相关的信息、⼯具和相关⽰例动 态填充模型提⽰。⼀个例⼦是 Vertex AI 扩展中的‘⽰例存储’或之前提到的基于 RAG 结 构的数据存储。 • 基于微调的学习:这种⽅法涉及在推断之前使⽤更⼤的特定⽰例数据集对模型进⾏训练。这有 助于模型在收到任何⽤⼾查询之前理解何时以及如何应⽤特定⼯具。 • 为了为每种有针对性学习⽅法提供更多⻅解,让我们重新审视⼀下我们的烹饪类⽐。

想象⼀位厨师收到了⼀个具体的⻝谱(提⽰)、⼀些关键的⻝材(相关⼯具)和⼀些⽰例菜 肴(少量样本⽰例)从客⼾那⾥。基于这些有限的信息和厨师对烹饪的⼀般知识,他们将需 要在‘即兴’中准备与⻝谱和客⼾偏好最接近的菜肴。这就是上下⽂学习。 • 现在让我们想象⼀下我们的厨师在⼀个备有丰富⻝材的厨房⾥(外部数据存储),⾥⾯装满各 种⻝材和⻝谱书(⽰例和⼯具)。厨师现在能够动态地从⻝材库中选择⻝材和⻝谱,并更好地 与客⼾的⻝谱和偏好相匹配。这使厨师能够利⽤现有知识和新知识创造出更具⻅解和精致的菜 肴。这是基于检索的上下⽂学习。

据集上进⾏预训练)。这使得厨师能够更深⼊地理解未来看不⻅的客⼾⻝谱。这种⽅法⾮常 适合让厨师擅⻓特定的烹饪(知识领域)。这是基于微调的学习。 这些⽅法各有独特的优势和劣势,涉及速度、成本和延迟等⽅⾯。然⽽,通过将这些技术结合在 ⼀个代理框架中,我们可以利⽤各种优势同时减少其弱点,从⽽实现更健壮和适应性更强的解决 ⽅案。

编辑:999感冒灵
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至