Agent 的核实结果要分等级记录,不是核过和没核过两档

2026-08-25

我这条流水线上有一类活是逐条核实事实:一批条目,每条要确认几项基本信息,确认完在记录里打个标记。最早那个标记只有两种值——核过,没核过。

这是我自己带 Agent 干活时踩出来的一件事,不是从哪里读来的方法。下面写的是我这一摊的实际情况。

想把最不牢靠的那部分挑出来,结果挑不出来

问题是在我准备返工的时候冒出来的。当时想做的事很简单:把证据最弱的那批条目挑出来,重新核一遍。

挑不出来。

因为记录里只有两个桶。我亲眼在官方页面上读到的那条,和执行的人绕了一圈从别处比对出来的那条,在记录里长得一模一样,都是「已核实」。要想区分,只能一条一条重新走一遍核实流程——那就等于前面那一轮的记录白留了。它记下了结论,没记下结论是怎么来的,而返工需要的恰恰是后者。

一个标记如果不能支持你对它做筛选,它就只是个安慰。当时我意识到的就是这件事。

发现它的不是检查,是我自己犯的一次错

这一段我后来反复提醒自己别跳过,因为发现方式比问题本身更值钱。

那批条目里有一项信息缺着。我当时没查,凭印象给了个值——说白了是照着看起来合理的样子拼出来的。这个错后来被单独写进了流程记录,写明性质是主导者的流程错误,是我自己的问题,不是执行者的。

记完那条我立刻反应过来一件事:**如果连派活的人都会凭印象填,那前面那些标着「已核实」的,凭什么就一定是真看到的?**我在标记上没有留下任何能把二者分开的痕迹。执行者交回来的和我自己顺手填的,落进记录里是同一个字符。

于是回头翻。翻出来两类不一样的东西。

一类是这样的:某个产品的官方站点直连访问被挡住了,请求根本到不了页面。执行的人换了条路,找到公开的登记信息,挑几项能互相印证的字段比对了一遍,确认下来。这个结论我认为是站得住的,我也没有推翻它。但它跟「在官方页面上直接读到」显然不是一回事,可当时的记录里,它就是「已核实」。

另一类更难受:有一条把某个产品的授权性质写反了,写成了开源,实际是闭源——更正的依据就摆在官方站点上,有软著和商业模块的说明,是能直接看到的东西。这条根本没查到位。而在只有两个值的记录格式里,我没有任何办法从标记上把它跟真查过的那些分开——标记本身不承载这个信息。

真正让我看见问题的,不是抽查,不是评审,是我自己犯了同一类错并且把它记了下来。这条经验我后来一直在用:**当你发现自己走了捷径,先别急着改掉那一处,先去想这条捷径别人有没有可能也走过、你的记录能不能把它显出来。**在我这儿是显不出来的,因为我当初那个字段是照着「每一条都规规矩矩查过」设计的。

二值标记丢掉的那一维是「怎么知道的」

核过/没核过,记的是结论的有无。可核实这个动作,结果本来就不是二值的。

在我这摊活里,实际会出现的至少是三种情形:官方渠道上直接读到;官方渠道够不着、靠可交叉印证的公开信息拼出来;找了没找到或者没条件找。三者的可信度不一样,被推翻的概率不一样,返工的成本也不一样——第一种基本不用回头,第二种要留着以后有机会再直连确认,第三种必须一路带着「没核到」这个标记往下走,不能在中途被当成已知。压成一位之后,这些差别全没了,而且是不可逆地没了——原始过程没留下来,事后再想还原也还原不出。

还有一层是派给 Agent 才特别明显的:人交回一条结论,我至少还能顺口问一句「你在哪儿看到的」,对方支支吾吾我能听出来。Agent 交回来的是一段格式工整的文字,语气通常都是笃定的,我没有任何旁证可以判断它到底是打开了页面,还是照着它认为合理的样子写了一段。所以「来源那一栏」在这条流水线上不是锦上添花,它是我唯一能拿到的验证抓手——一旦这一栏被压掉,我手里就只剩下一句自我声明。

更麻烦的是下游看到这个标记之后的反应。标记一旦变成「已核实」,下一道工序就不再怀疑它,直接拿去用。我在写代码那一侧见过同一个毛病的另一种长相:命令退出码是 0,人就认为事情办成了。那边我给自己定的纪律是回查目标状态,不看命令的成功输出。事实核验这边的「已核实」是同一种东西——**它是一个成功标记,不是一份证据。**看到成功标记就停止怀疑,这是我在两条线上分别踩到的同一个坑。

改成三档,再加一份「明知没核到」的清单

改法本身不复杂:

**第一档,直接核实。**在官方渠道上直接读到。这一档可以直接用。

**第二档,第三方交叉核实。**官方渠道够不着,靠能互相印证的公开信息得出。记录里要写清是哪一路信息、比对了哪几项。前面那条被挡在门外的,最后就是如实标成这一档,明确写「非直接核实」,没有笼统记成已核。这一档能用,但它带着一个待办:以后有条件了要回去补直连确认。

**第三档,未核实。**找了没找到,或者暂时没条件找。

第三档的处理是整套改动里最关键的:**未核实的条目不是删掉,是显式列出来,并且明确禁止下游推测补齐。**留白比标错更危险,因为下一个人——不管是人还是 Agent——会顺手把它填上,填的时候用的多半是「按常理应该是这样」。而按常理推出来的东西,一旦写进去就跟真核过的没有区别了,这又绕回了二值记录的老问题。写上「未核实,不许推测」,等于把这个空位锁死,谁都不能悄悄填。

还有一件事不在等级表里,但属于同一次改动:我自己那次凭印象填值的流程错误,留在了记录里,没有删。规格能不能被执行的人当真,靠的不是它写得多严,是它连立规矩的人自己犯的错也照记。一份只记别人错处的规格,执行者是能看出来的。

能带走的一句

派出去的每一项核实任务,验收标准不是「核完了没有」,是「你是怎么知道的」。

具体到判断上,我现在用的问法是:**这个标记,能不能支持我在三个月后对它做筛选?**能,说明它记了来源;不能,说明它只记了一次自我声明。凡是要往下游传的判断,都得带上来源那一栏;带不上的,就老实标成没有,并且写明不许猜。

这套东西的成本几乎为零——多一个字段而已。但它决定了这批记录是一份可以增量修的资产,还是一堆只能推倒重来的结论。

这篇写的是我自己那套流程里的一次实际情况,不是通行做法。你的场景、工具和团队规模不同,结论未必适用,判断方式可能比结论更值得拿走。

延伸阅读

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。