什么活值得交给 Agent,什么活交了反而更慢

2026-08-25

先说清楚这篇里的「慢」指什么。它不是秒表意义上的慢,是返工带来的往返:一件活交出去,结果方向不对、依据不牢、产物对不上,你得把它拽回来重做一遍甚至几遍。这种往返一旦频繁,交出去这件事本身就是负收益。

我手上有两条已经在跑的 Agent 线,形态差得很远。把它们摆在一起看,能倒推出一条我自己在用的判据。

两条线里,人站的位置完全不同

第一条是那个写公众号文章的 Agent,一次做一篇。收到一个文章链接或者一个主题,它分析素材、给出备选写作方向、写提纲、核验资料、写正文、生成封面,最后把成果保存到本地。这条链路上人有三个常规介入点:选哪个方向、确认提纲和主要观点、审核最终正文与封面并决定是否公开发布。它的交付终点是「文章和封面已生成并保存」,不是「已经进了草稿箱」——公众号草稿箱写入那条链路我还没接通。

第二条是站群内容量产那条流水线,一次做一批。开工前我要写两份文档:一份规格,写清楚这一批的范围、事实源、去重规则、分布;一份写作规范,写清楚红线、每种词形的段落结构、自检项。然后每一篇配一个实现者 Agent 和一个独立评审 Agent,两个互不通气,评审员拿不到实现者的推理过程,只拿到落盘的文件和那份规范。收工后我验收。

把差别摆成一张表更直观:

一次一篇那条一次一批那条
单位一次一篇一次一批
人的位置在流程中间,方向、提纲、终审三道闸门在流程两端,开工前定规格与事实源,收工后验收
Agent 数量一个岗位,多轮对话每篇一个实现者,加一个独立评审
质量保障人工逐篇确认规格加评审加脚本三层,人工只抽查

这张表最要紧的一行是「人的位置」。批量化之后人工确认必然退出中间环节——你不可能对一批里的每一篇都逐段点头。质量保障因此从「人看」换成了「规格写死 + 独立评审 + 脚本客观体检」。这个替换成不成立,是第二条线全部经验的核心。

闸门为什么落在那三个点上

第一条线的流程图里,我用不同颜色显式标出来的人工节点有九个,其中只有三个在正常路径上:方向、提纲、终审。其余六个都是异常闸门,只在特定失败分支上触发,正常跑的时候根本不出现。

这三个常规闸门的共同点是,它们都卡在一次信息量收敛之后。方向定错,后面全废;提纲定错,正文全废。也就是说,闸门设在返工成本发生跳变的位置,而不是均匀撒在流程里。

同一条线上还有一处切得更细的地方:审核通过之后,同步到草稿区不需要再问,但公开发布必须再要一次人工确认。「同步草稿」和「公开发布」被拆成了两个权限等级。这也是同一条规律——撤得回来的动作和撤不回来的动作,返工代价根本不在一个量级。

第二条线上,这些判断没有消失,只是被挪到了开工之前。比如对照类文章的结构在规范里就被写死:必须给出决策路径而不是罗列参数,没依据的维度直接写「这一点没有依据,不比」,不排名、不裁决优劣。再比如「不写易变数字」这条红线,规范里给的不是一张禁写清单,而是一个执行者当场能自己问的问题:这个数字下个月可能变吗?

判断前置成文字,人才走得开。判断前置不了,人就只能站在中间。

一条我自己在用的决策路径

从上面两条线倒推,我判断一件活值不值得交出去,按这个顺序问:

**第一问:这活是一次做一件,还是一次做一批?**一次做一件,且做的次数不多,那么写规格、写规范、配评审这套前置成本摊不掉,人留在中间反而利落。一次做一批,前置成本能摊到整批上,才轮到后面几问。

**第二问:这活的返工代价在哪一步跳变?**找出那个「这一步错了后面全废」的节点。找不到,说明这活是平的,交出去风险不大;找得到,那个点就是闸门候选位置。

**第三问:那个跳变点上的判断,你能不能提前写成文字?**能写成文字,就把它写进规格,人可以退到两端;写不出来,只能「看了才知道」,那这个点必须留人。硬把它交出去,你会在这一步反复拉扯,这就是交了反而更慢的典型形态。

**第四问:产物能不能被独立回查?**这一问后面单独说。

还有一个更靠前的动作,我把它当成入场券:**你能不能先写出一张岗位卡。**我起第二个岗位的时候(起因很朴素,我自己听播客、看视频想顺手记笔记),做的第一件事不是去接工具,而是先写岗位卡。到现在它也只有这一份岗位卡,工作流卡片还没产出,我还在拆工序的阶段。

岗位卡要写的东西是固定的几段:岗位名称、一句话岗位定义、输入、处理动作、输出、成功标准、人工兜底、本期不做。其中「一句话岗位定义」得是单句,把触发条件、处理范围、交付终点压在一句话里。如果这几段你写不出来——尤其是「输出」和「成功标准」写不具体——那不是 Agent 的问题,是这活本身还没想清楚。这时候交出去,只会把你没想清楚的部分变成来回返工。

还有一个细节值得抄:成功标准我是写成「做对了 / 做错了」两组对照,不是单向的目标列表。做错了那一组里有一条挺特别——未经确认就直接公开发布,这条被算作失败,和内容质量不达标并列。流程违规本身就是失败,这一点在写卡的时候不写进去,跑起来是不会自己长出来的。

两条线唯一完全对上的地方:验收

前面几问里的第四问,两条线给出的答案一模一样,这也是我最想单独拎出来的一处。

那条一次一篇的线上,草稿链路虽然还没接通,成功判据倒是先写死了:拿到接口返回的标识之后,还要再次去查询草稿列表,查到了才算成功。说明书里明文写着一句话——禁止把「接口已提交」误报为「草稿已创建」。

那条一次一批的线上,我踩的是另一个形状的同一个坑:编排层的汇总两个方向都会骗人。它报「零完成」,磁盘上其实已经落盘了若干篇;它报「已完成」,实际写作失败根本没落盘。处置办法只有一个,验收一律回磁盘上数文件,不看汇总。

一个是单个外部动作的验收,一个是整批任务的验收,规律是同一条:汇总层的状态不是事实,产物才是事实。

所以第四问的意思是,这活干完之后,你有没有一个独立于执行者的办法去确认它真的干成了。有,才值得交;没有,那你交出去的是活,收回来的是一句「我做完了」,这句话本身没有任何验收价值。

顺带说一句边界:可回查不等于可自动判定。脚本能查字数、死链、格式、孤儿页,查不出事实错误。客观体检和事实级复核是两件事,谁也顶不了谁。所以哪怕第四问答「能」,人工抽查那一层也拿不掉。

这几个维度我没有依据,不比

写到这里得把话说死,免得这篇被当成一份「哪种模式更好」的评测。

**质量高低,我不比。**一次一篇那条线,我对它的评价是主观的「基本满意」;一次一批那条线,质量是靠规范加独立评审加脚本三层兜的。这两个是完全不同口径的东西,一个是我的观感,一个是流程的输出,放在一起排序没有意义。

**快慢和成本,我不比。**这两条线的耗时与成本数据我不对外,也没打算拿它们当判据。这篇里说的「慢」自始至终指返工往返,不指时长。

**哪种模式更适合你,我没有依据。**我的样本就是我自己这两条线,一条已经跑通除草稿写入外的完整链路,一条在多批内容上跑过。第二个岗位甚至还停在拆工序阶段。样本量决定了我只能给判断顺序,给不了结论。

如果非要压成一句:**一次做一件、判断写不成文字、返工代价高的活,人留在流程中间;一次做一批、判断能前置成规格、产物能被独立回查的活,人退到流程两端。**中间那些两头不靠的,先别急着交,先去写岗位卡。

这篇的判据来自我自己带 Agent 干活的实践,样本有限。它更像一份可以拿去验证的假设,而不是一份可以照抄的规范。

延伸阅读

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。