怎么评估一个 Agent 好不好用:六个维度和一张可执行的评测表

2026-07-28

数据截至 2026-07,规范与各项目能力以官方文档当前版本为准。

判断一个 agent 好不好用,跑通一次演示几乎不提供任何信息量。真正有区分度的是四件事:同样的输入连跑多遍结果稳不稳、它失败的时候你能不能看出来失败在哪一步、跑完一个任务花掉多少 token、以及流程中断之后能不能从断点续上而不是从头再来。这四件事决定了它能不能进生产,而它们在一次成功的演示里全都看不见。

常见的误解是把”评估 agent”和”评测大模型”当成一回事。模型评测有现成的榜单和题库,你可以看分数排名;agent 不行。同一个模型,配不同的工具、不同的提示词结构、不同的重试策略,做出来的 agent 表现能差出很远。评的不是模型的知识能力,而是这一整套编排在你的业务流程上跑起来的可靠程度。所以别指望有一张通用榜单能替你回答”这个 agent 好不好用”,你得自己搭一套针对自己场景的评测。

一、先把”完成”定义清楚,否则后面全是主观感受

这一步最容易被跳过,也最要命。很多团队评测 agent 时的实际操作是:跑几个例子,几个人围着看输出,然后凭感觉说”还行”或者”不太行”。这种评法换个人看就换个结论,也没法用来判断改了提示词之后到底是变好还是变坏。

可行的做法是把”完成”拆成能机器判定或者能一致人工判定的条件。比如一个做数据整理的 agent,完成条件可以定义为:输出是合法 JSON、必填字段全部存在、字段类型正确、关键数值与原始数据一致。这四条都能写成断言代码,跑一遍就知道过没过。再比如一个做调研汇总的 agent,输出没法机器判定,那就固定一份评分细则(是否覆盖了指定的几个子问题、是否给出了出处、有没有出现原文里不存在的说法),让不同的人按同一份细则打分,至少保证前后两次评测口径一致。

定义完成条件的时候有个实用原则:宁可定得严一点,也别定得模糊。 模糊的标准会让你在优化过程中不断自我说服”这次好像好一点了”,而实际上什么都没变。

二、重复稳定性:同一个输入连跑十遍

单次成功和十次里成功九次,是完全不同的两种东西。agent 的执行路径里通常有多次模型调用,每一次都有随机性,一条七八步的链路上,单步 95% 的成功率乘下来就已经不到 70% 了。

具体做法很简单:挑二十到五十条覆盖不同情况的输入样本,每条重复跑五到十遍,记录通过率。你会看到三类结果:稳定通过的、稳定失败的、时好时坏的。前两类都好处理——稳定失败的说明能力或提示词有明显缺口,改起来目标清晰。真正麻烦的是第三类,它们是生产环境事故的主要来源,因为上线前的抽查很容易正好抽到通过的那次。

统计的时候建议同时记录每次执行的步数和调用次数。同一条输入这次三步跑完、下次绕了九步才跑完,即使两次都”成功”了,也说明控制流不受约束,这种 agent 在流量上来之后成本和延迟都不可预测。

三、失败可见性:出错时你能看到什么

这一条考察的其实是框架和你自己的埋点。评测方式是主动制造故障:把某个工具的返回改成报错、把外部接口的响应延迟拉长、给一条明显超出能力范围的输入,然后看你能不能在五分钟内定位到是哪一步出的问题。

如果只能看到一句”任务失败”,那这个 agent 在生产里基本没法维护。你至少需要能看到每一步的输入输出、调用了哪个工具、模型返回了什么、在哪一步开始偏离预期。

框架在这里差别不小。以多篇第三方实战对比的口径看,LangGraph 用的是有向图模型——节点是函数或模型调用,边定义控制流,状态以带类型的字典在节点间传递,这种显式结构让每一步的状态天然可追踪,这些对比也把它评为控制力最强、生产成熟度最高的一个。CrewAI 走的是角色分工路线(比如研究员到写手再到审稿),串行并行都支持,搭起来快,但链路一旦带上反馈环,同样是这些对比里提到的,调试会明显吃力。AutoGen / AG2 基于 agent 互相对话,对话模式最丰富,多方讨论达成共识这类场景是它的长处,代价是过程更发散。上述都是第三方评测的判断,各框架的具体能力以官方文档当前版本为准。

四、成本:算到单次任务,不要只看单价

很多人比较 agent 时看的是背后模型的 token 单价,这个口径会误导。真正该算的是跑完一个完整任务的总开销,因为不同编排方式的调用次数能差出好几倍。一个多 agent 互相对话的方案,光是把上下文在角色之间传来传去就会产生大量重复输入。

同样是那批第三方对比给出的排序里,LangGraph 的 token 效率相对最好,AutoGen 的开销相对最大——这个差异主要来自架构:显式图控制流只在需要时把状态传给下一个节点,而对话式协作天然要携带更多历史。这个排序来自第三方实测口径,你自己场景下的实际数字必须自己测,别照搬。

测的方法是在评测脚本里记录每次执行的输入 token、输出 token、调用次数,算出单次任务的平均成本和 P95 成本。看 P95 很重要,因为 agent 的成本分布往往是长尾的——大部分任务几步就完事,少数任务在某个环节反复重试,把总账单拉起来的就是这少数。

五、恢复能力:中断之后能不能续上

短任务感受不到这一条的价值,一旦流程跑到几分钟以上、或者中间需要人来确认,它就变成硬门槛。你要问的是:进程崩了、接口超时了、用户中途关掉页面了,重新发起时是从断点继续,还是从头再来一遍。

评测方式是人为杀掉执行过程,然后尝试恢复,看三件事:状态有没有持久化下来、恢复后是否重复执行了已完成的步骤(重复执行意味着重复付费,如果那一步有副作用比如发消息、写库,还会造成脏数据)、恢复后的结果和不中断跑完是否一致。

框架层面,第三方对比提到 LangGraph 支持持久化的长时运行工作流,并带有 checkpointing、流式输出和 human-in-the-loop 这类原语,带反馈环的循环任务上它被认为更占优;CrewAI 技术上也能做循环,但同一批对比里提到调试体验比较痛苦。具体到你要用的版本支持到什么程度,以项目官方文档为准。

六、上手与迁移成本:把三笔账一起算

这一条不是技术指标,但它经常是决定项目死活的那个变量。要算三笔账:团队学会它要多久、以后想换掉它要付出什么、它自己还会不会被持续维护。

学习曲线上,第三方对比的一致口径是 CrewAI 最平缓、LangGraph 最陡;生态规模上 LangGraph 相对最大。这两条方向相反,所以没有唯一答案:一天内要出个能演示的原型、流程基本线性,CrewAI 的门槛更低;有循环有分支、需要生产级可观测性、失败代价高,那么陡一点的学习曲线是值得付的。

第三个变量必须单独说:据多篇 2026 年的第三方对比反映,微软已把重心转向更大的 Agent Framework,AutoGen 的主要新功能开发停止,进入了维护模式——仍有 bug 修复和安全补丁,社区在寻找替代方案,也有实践者直言 2026 年不宜把它作为新项目的起点。这里要把话说准:它没有停摆,存量项目不必恐慌迁移,但如果你现在正做新项目选型,这是必须知道的一条。以上为第三方口径,项目实际状态以其官方仓库和文档说明为准。

顺带说一个容易被忽略的前提:如果你的场景只是单个 agent 调一两个工具,那么厂商提供的 Agent SDK 往往是更快的路径,你可能根本不需要多智能体框架。 评测之前先确认自己不是在给一个不需要的东西做选型,这比任何评测方法都省时间。互操作方面,CrewAI 已加入 A2A 支持;另有项目 OpenAgents 声称自己是唯一原生同时支持 MCP 与 A2A 的框架,这条为其自身说法,未经独立核实。

七、把六个维度落成一张评测表

上面六节各对应一列,凑成一张表就能直接用。建议这样填:

维度怎么测记录什么
完成定义写断言或固定评分细则通过/不通过的判定依据
重复稳定性20-50 样本 × 5-10 遍通过率、步数波动
失败可见性主动注入工具报错、超时定位到出错步骤所需时间
单次成本记录每次 token 与调用数平均成本、P95 成本
恢复能力中途杀进程再恢复是否续跑、有无重复副作用
上手迁移让新人按文档做一个小任务耗时、卡壳点、可替换性

用法上有两个建议。一是先跑基线再动手改:任何提示词或编排调整之前,先把这张表跑一遍存下来,之后每次改动重跑一遍对比,否则你分不清是真变好了还是这次运气好。二是样本集要单独维护并且允许增长:线上遇到的每一个真实失败案例都补进样本集,这套评测才会越用越准,否则很快就退化成一组永远能过的老题目。

八、这套方法的局限,得说清楚

它测不了长期效果。一个 agent 在离线评测里表现很好,上线之后用户的实际输入分布和你的样本集不一样,通过率会掉下来,这是常态。评测能帮你排除明显不合格的方案,不能保证选出来的一定跑得好。

它对开放式任务的判定依然依赖人。凡是没有唯一正确答案的输出——写文案、做分析、给建议——机器判定都只能覆盖格式和事实一致性这类外围,内容质量还得人看。有人会用另一个模型当评委,这确实能提高吞吐,但评委模型自己也有偏好和盲点,用它筛出的结果最好再做人工抽检。

样本集规模也有现实约束。几十条样本跑十遍,通过率的置信区间其实不窄,两个方案差三五个百分点很可能只是噪声。别拿这种差距当决策依据,要么把差距做大,要么加样本量。

小结

评估 agent 的重点不在于它能不能成功一次,而在于它失败时是什么样子。先把”完成”定义成能一致判定的条件,再去测重复稳定性、失败可见性、单次任务成本、中断恢复能力和上手迁移成本这五项。框架层面的差异会直接影响这些指标——控制力和可观测性强的框架,在中间三项上通常更省事,代价是学习曲线更陡。选型之前先确认自己确实需要多智能体编排,很多场景一个 agent 加一两个工具就够了。最后记住这套方法的边界:它能帮你淘汰掉明显不行的方案,但离线评测过关不等于上线之后稳,真实流量进来后仍然要持续收集失败案例回补样本集。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。