您的位置:首页 > 手游攻略 > Day01 | Agent究竟是什么?

Day01 | Agent究竟是什么?

作者:互联网  时间: 2026-07-29 08:43:13  

一、 核心定义和四大组件

1. Agent 的本质公式
能够自主完成任务的系统就是 Agent,其核心逻辑可概括为:
大模型 (大脑)、工具 (双手) 与执行循环 (思考-行动-观察-再思考) 共同构成 Agent。

Day01 | 什么是Agent?

2. 缺一不可的四大核心组件
以下四个组件紧密协作,共同支撑 Agent 运作:

组件角色核心功能及细节
大模型 (LLM)大脑推理中心:用户意图由它理解,当前状态由它分析,下一步动作也由它决定。判断该查什么、怎样解读结果等所有“思考”,均发生在这里。
工具 (Tools)双手执行接口:搜索、数据库读写、API 调用等能力,让系统能够与外部世界交互。操作并非由大模型直接完成:它生成调用工具的指令,随后接收工具返回的结果。
记忆 (Memory)记事本上下文管理:• 长期记忆:跨会话信息存入外部数据库,待需要时检索并注入。• 短期记忆:当前会话中的工具调用结果与对话历史被存入(Context Window),多步骤任务由此保持连贯。
执行循环 (Loop)节拍器驱动引擎:普通大模型采用一次性问答(One-shot),Agent 则以“思考→行动→观察→再思考”为一轮,并不断进入下一轮;根本差异就在这里。

二、 Agent 的两类主流工作范式

两种范式:Plan and Execute 与 ReAct。

1. ReAct 模式(边想边做)
全称 Reasoning + Acting 的这一范式,目前应用最为主流。

  • 工作流:

    1. Think(思考) :下一步采取什么动作,要依据当前上下文作出决定。
    2. Act(行动) :对工具发起调用。
    3. Observe(观察) :取得执行结果。
    4. Loop:回到思考阶段之前,先把结果并入上下文。
  • 关键机制:

    • 结果回流:为使大模型对历史有所“记忆”,Context Window 会接收每一步产生的结果。
    • 动态决策:发现网络问题时转向网络工具,遇到慢查询时则检查日志;也就是说,路径会随发现而变化,并不固定。
  • 适用场景:任务目标模糊、需要随机应变,且步骤较少(3步以内)。

  • 局限性(长任务困境) :

    • 迷路:大模型之所以容易遗忘最终目标,是因为步骤增加会使上下文变得过长。
    • 绕路:由于缺少全局规划,执行过程可能像走迷宫一样反复走回头路。
    • 成本高:Token 消耗会随着步骤线性增长,原因是全部历史都要在每轮循环中携带。

2. 先规划、后执行的 Plan and Execute 模式
这种模式是为解决 ReAct 的长任务难题而出现的。

  • 核心逻辑:

    1. 第一阶段:Planner(规划) 。在调用工具之前,大模型先根据拿到的任务列出完整的子任务清单。
    2. 第二阶段:Executor(执行) 。简单调用或一个小的 ReAct 循环,都可以充当清单中的单个步骤;整个清单依次得到执行。
    3. 机制:Re-planning(重新规划) 。以原计划排查慢查询、结果发现锁等待为例,意外出现后,Planner 会接收 Executor 的反馈,并据此生成新的后续计划。
  • 类比:

    • ReAct = 到路口再决定转向,如同看着导航开车。
    • Plan and Execute = 出发之前规划完整路线(转弯位置、预计到达时间均提前确定)。
  • 适用场景:目标明确、需要全局把控,而且步骤多(5步以上)的复杂任务。

3. 范式对比及选型决策表

维度ReActPlan and Execute
决策时机实时决策(每走一步再看一步)事前决策(进行全局规划)
全局视野弱(只关注当前步骤)强(预先掌握全貌)
灵活性高(可随时调整路径)较低(调整依赖计划)
Token 消耗步数越多,后期成本越高消耗集中在规划阶段,执行阶段则较为可控
最佳实践以 Plan and Execute 构建外层框架,再用 ReAct 执行内层子任务。

三、 Agent vs. Workflow(工作流)

初学者最容易混淆这一概念,而两者的核心差别在于控制权归属。

  • Workflow(工作流) :

    • 控制者:开发者(代码) 。
    • 逻辑:硬编码。先执行 A,再执行 B;如果 B 的结果为 X,则进入 C,否则进入 D。
    • 特点:执行路径固定,成本较低且可预测性强。
    • 适用:步骤清晰且重复性高的标准化流程。
  • Agent(智能体) :

    • 控制者:大模型(实时推理) 。
    • 逻辑:动态生成。模型获得目标后,自主决定执行路径。
    • 特点:路径会动态变化,每次运行的结果可能不同。
    • 适用:情况多变、需要自主判断的开放域任务。

架构建议:两者不是互斥关系。最稳健的生产架构通常是 “Workflow 做骨架,Agent 做血肉” 。即用 Workflow 控制主流程,只在需要复杂决策的环节插入 Agent。

四、 Agent 开发面临的四大挑战及应对

  1. 幻觉传导

    • 问题:如果第一步推理产生幻觉(错误判断),之后的所有步骤都会建立在错误假设之上,最终使结论彻底偏离。
    • 应对:验证工具返回的结果;对于删除数据、发通知等高风险操作,加入人工确认环节。
  2. 工具调用失败

    • 问题:权限不足、网络超时或返回格式异常等情况,都可能使 Agent 卡死。
    • 应对:工具需定义明确的错误返回格式;在 System Prompt 中预设“如果工具报错,应该如何处理”的逻辑。
  3. 成本与速度

    • 问题:每轮循环都意味着一次 LLM 调用,步骤持续增加时,Token 消耗与延迟也会随之叠加。
    • 应对:若 Workflow 足以解决,就不要改用 Agent;同时必须严格限制最大循环轮数。
  4. 循环风险

    • 问题:查完 B 后又转回查 A,而查 A 又要求先查 B,系统便会陷入死循环。
    • 应对:设置强制结束机制;要求模型每一步推理都自我审视:“现有信息是否足以得出结论?是否还有继续的必要?”

五、 用伪代码呈现 Agent 的极简逻辑

本质上,Agent 的核心骨架十分简单,它就是一个 While True 循环:

def run_agent(user_input):# 1. 初始化消息列表(包含System Prompt和用户输入)messages = [system_prompt, user_input]while True:# 2. 调用大模型,让它思考下一步response = llm.chat(messages)# 3. 判断是否为最终答案if response.is_final_answer:return response.content# 任务完成,退出循环# 4. 执行工具tool_result = execute_tool(response.tool_name, response.arguments)# 5. 将工具结果追加到消息列表(实现记忆/结果回流)messages.append({"role": "tool", "content": tool_result})# 6. 继续循环,让模型基于新结果再思考

总结:Agent 的核心在于利用大模型的推理能力,在“思考”与“行动”之间形成闭环,从而将 AI 从“聊天机器人”升级为“能够自主完成复杂任务的数字员工”。

最新游戏

更多

Copyright©2010-2019. All rights reserved | 波波三国游戏官网|[email protected]

备案编号:湘ICP备2022015115号-4