作者:互联网 时间: 2026-07-29 08:43:13
1. Agent 的本质公式
能够自主完成任务的系统就是 Agent,其核心逻辑可概括为:
大模型 (大脑)、工具 (双手) 与执行循环 (思考-行动-观察-再思考) 共同构成 Agent。
2. 缺一不可的四大核心组件
以下四个组件紧密协作,共同支撑 Agent 运作:
| 组件 | 角色 | 核心功能及细节 |
|---|---|---|
| 大模型 (LLM) | 大脑 | 推理中心:用户意图由它理解,当前状态由它分析,下一步动作也由它决定。判断该查什么、怎样解读结果等所有“思考”,均发生在这里。 |
| 工具 (Tools) | 双手 | 执行接口:搜索、数据库读写、API 调用等能力,让系统能够与外部世界交互。操作并非由大模型直接完成:它生成调用工具的指令,随后接收工具返回的结果。 |
| 记忆 (Memory) | 记事本 | 上下文管理:• 长期记忆:跨会话信息存入外部数据库,待需要时检索并注入。• 短期记忆:当前会话中的工具调用结果与对话历史被存入(Context Window),多步骤任务由此保持连贯。 |
| 执行循环 (Loop) | 节拍器 | 驱动引擎:普通大模型采用一次性问答(One-shot),Agent 则以“思考→行动→观察→再思考”为一轮,并不断进入下一轮;根本差异就在这里。 |
两种范式:Plan and Execute 与 ReAct。
1. ReAct 模式(边想边做)
全称 Reasoning + Acting 的这一范式,目前应用最为主流。
工作流:
关键机制:
适用场景:任务目标模糊、需要随机应变,且步骤较少(3步以内)。
局限性(长任务困境) :
2. 先规划、后执行的 Plan and Execute 模式
这种模式是为解决 ReAct 的长任务难题而出现的。
核心逻辑:
类比:
适用场景:目标明确、需要全局把控,而且步骤多(5步以上)的复杂任务。
3. 范式对比及选型决策表
| 维度 | ReAct | Plan and Execute |
|---|---|---|
| 决策时机 | 实时决策(每走一步再看一步) | 事前决策(进行全局规划) |
| 全局视野 | 弱(只关注当前步骤) | 强(预先掌握全貌) |
| 灵活性 | 高(可随时调整路径) | 较低(调整依赖计划) |
| Token 消耗 | 步数越多,后期成本越高 | 消耗集中在规划阶段,执行阶段则较为可控 |
| 最佳实践 | 以 Plan and Execute 构建外层框架,再用 ReAct 执行内层子任务。 |
初学者最容易混淆这一概念,而两者的核心差别在于控制权归属。
Workflow(工作流) :
Agent(智能体) :
架构建议:两者不是互斥关系。最稳健的生产架构通常是 “Workflow 做骨架,Agent 做血肉” 。即用 Workflow 控制主流程,只在需要复杂决策的环节插入 Agent。
幻觉传导
工具调用失败
成本与速度
循环风险
本质上,Agent 的核心骨架十分简单,它就是一个 While True 循环:
def run_agent(user_input):# 1. 初始化消息列表(包含System Prompt和用户输入)messages = [system_prompt, user_input]while True:# 2. 调用大模型,让它思考下一步response = llm.chat(messages)# 3. 判断是否为最终答案if response.is_final_answer:return response.content# 任务完成,退出循环# 4. 执行工具tool_result = execute_tool(response.tool_name, response.arguments)# 5. 将工具结果追加到消息列表(实现记忆/结果回流)messages.append({"role": "tool", "content": tool_result})# 6. 继续循环,让模型基于新结果再思考
总结:Agent 的核心在于利用大模型的推理能力,在“思考”与“行动”之间形成闭环,从而将 AI 从“聊天机器人”升级为“能够自主完成复杂任务的数字员工”。