【Agent到底是什么?Agent与LLM的关系 一篇文章告诉你】
不知道你有没有过这种困扰身边的人都在学习Agent同时也在劝你学习Agent但是没有人告诉过你Agent到底是什么它能解决什么问题怎样才能学习它这篇文章帮你解决这个问题。一. Agent是什么1.1 LLM和Agent1.1.1 LLM是什么想要知道Agent是什么就需要先了解LLMLarge Language Model 大预言模型LLM就相当于一个超级大脑通过海量的文本数据学习掌握了各种知识。我们日常用的ChatGPTDeepseek的底层都是LLM。1.1.2 LLM的弊端LLM的优点是非常聪明但是弊端就是不能进行具体的操作就像一个只有大脑的人类只能进行思考而不能通过思考进行具体的动作。弊端一只会说不会做比如你让一个LLM帮你购买一张火车票它会把买火车票的所有步骤都详细的告诉你但是不能自动的打开12306真的去帮你购买。换句话说LLM的能力被限制在对话框里面了而不能跟外界进行互动。弊端二没有记忆这个很好理解就是LLM一次只能记住一次对话的内容当我们新开了一个对话LLM就不知道你是干什么的了。比如你跟豆包说【我叫XXX】在本次对话它知道你叫XXX但是当你开了一个新对话它就不知道你叫XXX了。弊端三不会使用工具我们之前说过LLM就相当与一个只有大脑的人类它只能思考不能使用工具。比如你问【今天上海的天气怎么样】它不会像你一样去调用天气APP从而知道而是从它自己训练数据里面的旧数据进行猜测。但是这些数据是有截止日期的如果你问的问题它里面没有那么就会导致 幻觉 出现LLM就会瞎说。弊端四不会进行规划让LLM完成一个复杂的任务【帮我写一份同类型商品报告】它不会像人一样先去收集同类型的商品信息进行比较。而是直接生成一大段话就是说LLM不会一步步的去执行而是你问一句它答一句。1.1.3 Agent是怎么改进LLM的弊端的上面讲解完了LLM的弊端你可能已经在想可不可以让LLM又能【说】又能【做】这就是Agent要解决的问题。Agent智能体简单的说Agent是在LLM循环中自主使用工具的系统如果说LLM是一个只有大脑的人类那么Agent就是一个功能健全的人类比如你说【给我订一张长春飞往北京的飞机票】LLM会把所有的步骤告诉你而Agent会真正的在携程App去购买。解决弊端一 Agent引入了工具调用的能力可以调用搜索引擎、数据库、API、代码执行器等各种外部工具来真正执行操作。解决弊端二Agent配备了记忆系统包括记住当前任务上下文的短期记忆和存储在外部数据库中、可以跨对话保留的长期记忆。解决弊端三推出了 MCP 等标准化协议来统一工具接入方式。解决弊端四Agent 具备了任务拆解和规划能力能把一个大目标分解成多个小步骤然后逐步执行。1.1.4Agent的组成Agent包含四个模块第一个模块大脑也就是LLM负责理解意图推理判断决定下一步行动第二个模块规划模块负责把复杂任务进行拆解进行规划第三个模块记忆模块负责储存和检索信息让Agent在任务中连贯第四个模块工具模块与外界交互1.1.5Agent和Workflow的区别可能会有人会把Agent和Workflow混淆因为确实比较像都是一步一步的执行。但是它们的设计理念是完全不同的举例假设用户要进行退款操作Workflow是这样的- 第一步接收申请 - 第二步调用 LLM 提取关键信息 - 第三步查数据库获取订单详情 - 第四步调用 LLM 判断是否符合退款政策 - 第五步执行退款或生成拒绝邮件第六步发送通知。它是完全写死的步骤。但是Agent不同它是在收到这个任务之后自己决定下一步应该去干什么。比如它收到「处理这个退款申请」的任务后自己来决定怎么做先看看申请写了什么然后觉得需要查一下订单信息发现情况有点特殊就去搜索退款政策文档推理判断后决定执行退款最后给客户发邮件通知。Workflow 是指 LLM 和工具通过预定义的代码路径进行编排的系统而 Agent 是指 LLM 动态主导自身流程与工具调用的系统由 LLM 自主决定如何完成任务。