普通的大模型调用是”一问一答”:给提示词,返回文本。而 AI Agent(智能体)让模型从”会说”变成”会做”:围绕一个目标自主地规划步骤、调用工具、观察结果、修正行动,直到任务完成

什么是 Agent

一个 Agent 通常由四部分组成:

  • 大模型:负责理解、推理与决策的”大脑”
  • 规划:把大目标拆解为可执行的步骤
  • 记忆:短期记忆(当前对话上下文)与长期记忆(向量库持久化)
  • 工具:搜索、代码执行、数据库查询、API 调用等外部能力

模型本身只会生成文本,工具让它的双手伸向真实世界。

核心循环:思考-行动-观察

Agent 的运行是一个循环(ReAct 范式):

  • 思考(Reason):分析当前状态,决定下一步做什么
  • 行动(Act):调用某个工具,带上参数
  • 观察(Observe):读取工具返回结果,作为新的上下文
  • 循环以上步骤,直到认为目标达成,输出最终答案

例如”帮我查北京明天天气并写进日报”:Agent 先调天气 API,观察结果,再调文档工具写入,最后汇总回复。每一步的决策都由模型根据累积上下文做出。

工具调用:Function Calling

工程上,工具以”函数签名”(名称、描述、参数 schema)注册给模型:

  • 模型在回复中输出结构化的调用意图(函数名 + 参数)
  • 运行时执行函数,把结果回填给模型
  • 工具描述写得好不好,直接决定模型会不会用、用对用错

这与微服务里”接口文档质量决定调用方能否正确集成”是同一个道理。

规划与多智能体

复杂任务需要显式规划:

  • 任务分解:先列出子任务清单(计划),再逐项执行
  • 反思修正:执行失败时回顾原因、调整计划,而非盲目重试
  • 多智能体:多个角色分工(规划者、执行者、审查者),类似团队协作

局限与现实

Agent 目前仍有明显边界:

  • 错误会沿循环累积,一步错可能步步错
  • 长循环消耗大量 token,成本与延迟都高
  • 工具权限越大,误操作风险越大,需要沙箱与确认机制

因此落地时常见做法是:把 Agent 限制在流程清晰、工具受限的场景(客服工单、数据查询、代码修复),而非放任其自由发挥。Agent 的价值不在于”全自动”,而在于把人从重复的多步操作中解放出来。