Agent 的裸循环(思考-行动-观察)百行代码就能实现,但生产 Agent 需要的状态管理、工具编排、记忆、可观测把人劝退——于是框架应运而生。LangGraph、AutoGen、CrewAI、Dify 各占一方,选型成了新问题。本文给出一张对比地图和按场景的选型路径。

四类编排哲学

LangGraph(图状态机):把 Agent 流程建模为节点(步骤)+ 边(转移)的有向图,状态显式传递,支持循环、分支、人工介入点(interrupt)。哲学=流程即代码,可控性优先。适合:多步骤业务流(审批、多阶段数据处理)、需要确定性与可恢复性的场景。

AutoGen / AG2(多智能体对话):Agent 之间以”对话”协作(ConversationPattern),一个 Agent 的输出是另一个的输入,靠角色设定分工。哲学=协作即对话。适合:研究类、辩论式推理、代码生成+评审双人组等”多角色互评”场景。

CrewAI(角色团队):更高层抽象:定义 Role(角色)、Task(任务)、Crew(团队)与流程(顺序/层级),上手最快。哲学=组织架构隐喻。适合:内容生产流水线(调研→写作→编辑)、快速验证多角色协作想法。

Dify / Coze(低代码平台):可视化画布编排 LLM+工具+知识库,内置 RAG 与发布渠道。哲学=配置即应用。适合:业务团队自助搭建客服/问答类 Agent、不想维护代码栈的场景。

对比维度表

维度 LangGraph AutoGen CrewAI Dify/Coze
编排模型 显式图/状态机 对话驱动 角色-任务 可视化画布
控制粒度 最细(每边可控) 中 中粗 粗
学习曲线 陡 中 缓 最缓
状态/持久化 内建 checkpoint 需自建 弱 平台托管
人工介入 原生 interrupt 支持 弱 平台功能
可观测 LangSmith 生态 一般 一般 平台内置
代码掌控 全代码 全代码 全代码 平台锁定

选型路径(按场景对号)

  • 业务流程复杂、要审计与可恢复(金融/工单类)→ LangGraph:checkpoint 支持断点续跑,interrupt 支持人工审批
  • 多角色互评/研究型任务 → AutoGen:对话模式天然匹配
  • 内容流水线、快速出 MVP → CrewAI:半天搭出调研-写作-审校三人组
  • 非工程团队、问答/客服类 → Dify/Coze:免代码上线,后续复杂了再迁移
  • 深度定制、团队工程能力强 → 自研循环(122 篇的百行内核)+ 自选组件(记忆用向量库、工具用 Function Calling 协议):框架收敛的今天,自研成本比想象低,且无框架升级债

三个通用判断原则

  1. 先问要不要 Agent:固定流程能用普通 LLM 链(prompt→tool→prompt)解决的,不上 Agent 框架——自主循环意味着不可预测与成本
  2. 可控性 > 抽象层级:生产环境选能把”模型自由发挥范围”框死的框架(显式图/白名单工具),而非最聪明的
  3. 生态与退出成本:看工具集成数量、trace 能力、以及”换框架要重写多少”——编排逻辑与业务工具解耦写好,迁移才不痛

趋势观察

各框架在互相学习:LangGraph 加了多 Agent 模板,AutoGen 转向图内核(AG2/SK 融合),CrewAI 补状态管理——编排模型在收敛为”图+状态+工具协议”的共识。选型时不必赌某个框架赢,把业务工具与提示词资产框架无关化,才是对抗收敛期动荡的正确姿势。

选型一句话:流程要硬控选 LangGraph,角色要互评选 AutoGen,团队要快选 CrewAI,业务要自助选 Dify,能力要满配自研——先确认”真的需要 Agent”,再在这五者间对号入座。