Agent 上岗
本专题共 54 篇,按「定岗位 → 拆工序 → 写大脑 → 接手脚 → 跑闭环 → 交付复用 → 协作移交」七个阶段展开。 它不讲某个工具怎么用,也不讲成本怎么控——那是站内另外几个专题的事; 它只回答一个问题:怎么把 Agent 干的活,变成一份能交付、能验收、能移交给别人的工作。
把 Agent 当成一个要上岗的员工来带:这个专题讲什么
我手上有三条在跑的 Agent 线,这篇给出贯穿全专题的一条判据——验收要回查目标状态,而不是看调用有没有报错——并交代七个阶段各讲什么、哪些是我真做过的、哪些至今没做通。
总览:这件事值不值得做
把 Agent 当员工带,第一个要回答的不是怎么带,而是哪些活值得交出去。这一组用两条实践线的实际差别倒推判据:一条是一次做一篇、人卡在流程中间三道闸门;一条是一次做一批、人退到流程两端。人该站在中间还是两端,取决于单次产出的返工代价和批量规模。
第一步 · 定岗位
岗位卡是这套做法的起点,也是唯一一份写给人看而不是写给 Agent 看的文档。这一组逐段拆它:一句话定义怎么把触发、范围、交付终点压进一句;成功标准为什么要写成「做对了」和「做错了」两组;「本期不做」为什么必须单独成段;人工兜底和人工闸门为什么不是一回事。最后两篇讲第二个岗位——它目前只写了岗位卡,还没拆工序,这篇就诚实地写到这一步为止。
给 Agent 写岗位卡:六个必须写清的段落
一份岗位卡该按什么顺序写、每一段回答什么问题、漏掉会出什么事。读完能拿到一份可以照着填的段落清单和当场自检的问法。本文不讲判断依据怎么写,那是工作流卡片的事。
给 Agent 写一句话岗位定义:把触发、范围、交付终点压进一句
岗位卡第二段那句话怎么写才不落空——用触发、处理范围、交付终点三个成分自查,并解释为什么这句写的是目标态而不是现状。不覆盖工序拆分和权限分级。
Agent 的成功标准要写成两组:做对了和做错了
岗位卡里的成功标准如果只写成一串目标,就验不出「事办成了但过程错了」这一类失败。这篇给出把成功标准拆成「做对了」和「做错了」两组的三个自检问法,以及我自己那份岗位卡里对应的段落长什么样。不覆盖指标怎么定阈值,也不覆盖上线之后的效果归因。
给 Agent 写「本期不做」:为什么这一段必须单独列
岗位卡里最容易被合并掉的就是「本期不做」。这篇给出三个当场能用的判据,说明哪些约束必须单独列成一段、怎么落到卡上的具体条目;不覆盖岗位卡其它段落的写法。
Agent 的人工兜底和人工闸门不是一回事
岗位卡里「人工兜底」那一段常常被写成一张十来条的大清单。这篇给出一条决策路径,帮你把手上的每一条分到「常规必经」还是「异常触发」那一栏,以及混写之后最容易发生什么。本文不讨论闸门具体该卡在哪一步。
第二个 Agent 岗位从哪开始:先写岗位卡还是先接工具
我开第二个 Agent 岗位时又一次从写岗位卡开始、而不是先接工具,这篇复盘我为什么停在「拆工序」这一步没往下走,以及我给自己定的开工条件。不覆盖这个岗位怎么实现——它还不存在。
什么时候该把一个 Agent 拆成两个岗位
手上已经跑通一个 Agent,又冒出一个相邻的新需求,是加个分支还是新开一个岗位?这篇给出我自己在用的两条判据——输入形态和成功标准——以及怎么落到岗位卡上;不覆盖多个岗位之间怎么协作调度。
第二步 · 拆工序
这一阶最抽象,也最容易写成空话,所以每篇都压在具体的东西上:十二个判断点为什么要成对写「怎么判」和「为什么这么判」;工序边界该切在哪三类位置;人工闸门该卡在返工成本跳变的地方;失败之后退回哪一步反过来决定了工序怎么切。还有一篇讲同一个 Agent 的几份文档颗粒度不必强行对齐——那不是写漏了,是有意的。
Agent 的判断点要成对写:怎么判,和为什么这么判
只写规则,Agent 遇到规则没覆盖的情况就会僵住或者乱来。这篇讲我给每条判断补一栏「判断依据」的做法、一个检验依据写没写到位的土办法,以及它在什么情况下会失效。不覆盖提示词的具体组织方式。
Agent 工序的边界该切在哪:三类位置
把一个 Agent 的活儿拆成工序时,每一刀落在哪里?本文给出我自己在用的三类切分位置和当场可自问的三个问题,并说明它们在什么情况下不成立。不展开失败回退边的逐条推导。
给 Agent 设人工闸门:该卡在返工成本跳变的位置
我给一个写作 Agent 画完流程图,把人工节点上色之后才发现闸门不是均匀分布的,而是密集地卡在几个特定位置。这篇是我事后反推出来的规律,以及为什么发布权要单独拆一道闸。不覆盖闸门的具体交互实现。
Agent 失败之后退回哪一步:回退目标决定了工序怎么切
拆 Agent 工序时不知道该在哪里下刀,可以反过来从失败回退目标推。本文给出一句当场能问的判据,逐条讲我那条内容流水线上四条回退边为什么各退到那一步,以及这条判据在什么情况下给不出答案。本文不覆盖工序内部怎么写提示词。
用删除测试压 Agent 写的提纲:删掉之后读者会失去什么
提纲阶段最难的不是挑错,是没法回答「这条要不要」。这篇给出我在自己那条内容流水线上用的替代问法——删掉之后读者会失去什么,以及配套那条防误删的限定。不覆盖正文写法与事实核验。
Agent 核验资料:哪些必须查证,哪些可以直接删掉
给写作 Agent 的资料核验定一条当场能用的分流判据——按「是否影响核心结论或读者决策」分流,并给出查证、删除、换角度三种处置;不覆盖检索工具与搜索词怎么选。
给 Agent 分权:同步草稿和公开发布必须拆成两级
给 Agent 授权时,「哪些动作它自己做、哪些必须回来问我」不该按重要程度划,而该按可逆性划。这篇给出我在一条内容流水线上用的分级判据和它的三处边界,不覆盖闸门该设在流程哪一步的推导。
同一个 Agent 的三份文档,颗粒度不必对齐
我给那个写公众号文章的 Agent 写了岗位卡、工作流卡片和 Profile 三份文档,步骤数对不上。这篇复盘我怎么发现的、为什么不去对齐,以及三份文档各自该管什么。不覆盖怎么从零写第一份岗位卡。
第三步 · 写大脑
规则永远覆盖不全,所以这一阶的核心不是写更多规则,而是让判据本身能被执行。「这个数字下个月可能会变吗」比「不许写易变数字」有用,「把主语去掉文章还成立吗」比「内容要具体」有用——它们都把一个主观评判换成了一个当场能做的动作。这一组还包括语气该怎么分区处理、选题的三个硬门槛,以及一条明确写出代价的成本取舍。
Agent 的 Profile 该分成哪几节
岗位卡写完之后 Agent 还是不知道下一步干什么,这篇给出我实际在用的 Profile 十节结构、每节的职责,以及判断一段话该放岗位卡还是放 Profile 的归位问法;不覆盖提示词写法与模型选择。
把 Agent 的输出结构写死:每种词形各有固定段落
一批一批地生产内容时,最先塌的不是文笔而是骨架。这篇讲我怎么把每种词形的段落顺序写进任务书,以及那些标了「不许省」的段落为什么要单独点名。不覆盖选题、事实核验和内链回填。
把主语去掉,Agent 写的东西还成立吗
批量交上来的稿子看着都没错,但彼此能互换——本文给一条当场能做的自检动作:把主语删掉看文章塌不塌,以及它为什么比「内容要具体」有效。不覆盖事实是否正确的核对。
给 Agent 的判据要能当场执行,不能只给标准
规格里写「要准确、要中立」没用,因为执行者站在正文某一句前面判断不了这一句算不算。这篇讲我把标准改写成可当场执行的问句和动作的做法,以及哪些标准我至今找不到对应判据。不讲规则该配什么依据。
Agent 写的东西:哪些段落可以口语化,哪些必须严谨
给 Agent 下「写得口语一点」或「写得严谨一点」都会把整篇拉向一端,本文给出我在写作判断卡里用的分区判据——开场、过渡、解释、个人观点可以松,事实、风险、承诺必须紧,以及它在哪些场景下不适用。本文不讲选题、不讲排版。
让 Agent 判断选题值不值得做:三个硬门槛
我在写作 Agent 的工序里给「选题是否值得写」这一步定了三个当场能判的硬门槛,这篇讲三条门槛各挡掉什么、不合格之后往哪退、以及想加第四条时怎么自问;不覆盖选题怎么找、也不覆盖内容分发。
用固定红线扫描,不要求 Agent 每次去查最新规则
我给那个写公众号文章的 Agent 定的风险判断口径是一份固定红线清单,而不是每篇现查最新渠道规则。这篇讲我怎么判断哪些规则适合固定下来、这条取舍的代价是什么、以及什么情况下它不成立。不覆盖具体平台的规则内容。
给 Agent 定目标:内部目标和对外承诺是两套口径
我给一个写公众号文章的 Agent 写岗位卡时,成功标准里放了流量方向的目标,后来在对外说明书里又写下「不承诺结果」。这篇复盘这两处口径为什么可以并存、我后来怎么把它们分开管,不覆盖具体指标怎么定。
第四步 · 接手脚
给 Agent 接工具时,该问的不是「它有没有能力做」,而是「这个动作对共享状态有没有副作用」。这一组讲能力清单该按什么维度列、哪些权限不该给、关键外部能力为什么要预留降级路径,以及一条容易被忽略的原则:审查者的权限不应该大于被审查者。最后一篇讲自用 Agent 走向可移交时,第一个卡住人的总是硬编码路径。
Agent 的能力清单该怎么列
一个已经能干活的 Agent,它的能力清单该按哪几个维度分栏、每一格该写到什么程度,才能在出故障和交接时真正派上用场。本文只讲清单怎么列,不讲工具怎么选、也不讲怎么把某个能力接进来。
哪些权限不该给 Agent:按副作用划分,不按能力划分
多个 Agent 同时干活时,权限该怎么分?这篇给一条当场能用的判据——不看谁有能力做,只看动作会不会碰共享状态,以及判出来之后的两种处置。不覆盖单个 Agent 该配哪些工具。
Agent 的关键外部能力要预留降级路径
我带的那个写公众号文章的 Agent 读不到原文,换一条路后读到了。这篇讲我怎么判断一次降级是合法的、什么时候必须停下来交给人;不讲怎么搭抓取工具链。
排查 Agent 接不上消息:身份授权和消息通道是两件事
我那条写作流水线在人工确认那一步静默停住过一次,提纲没到我手上。这篇复盘当时是怎么发现的、为什么身份和授权检查全绿也说明不了消息走通了,以及闸门那一处后来改成了什么。不覆盖任何平台接口的具体接法。
给评审 Agent 划权限:审查者不应该大于被审查者
给流水线加独立评审 Agent 之后,评审员能干什么、不能干什么需要单独设计。这篇给出我判断权限边界的三个问法,和我在评审员任务书里实际写死的那几条约束;不覆盖脚本层质量门的设计。
自用 Agent 走向可移交:硬编码路径是第一批要拆的
复盘我自己那条内容流水线上的一件事:成果目录曾写死成本机绝对路径,自用时一次都没出过问题,直到准备让别人也能跑才浮出来。本文只讲这一项——它是怎么被发现的、为什么改、以及为什么它总是第一个卡住人;不覆盖可移交要拆的其它部分。
第五步 · 跑闭环
全专题分量最重的一阶,因为踩过的坑几乎都在这里。开头那篇是整个专题的主论点:三条互不相干的线上踩到了同一个形状的失败——接口返回成功但草稿没进去、编排报完成但磁盘上没文件、退出码是 0 但什么都没构建。结论只有一句:交给 Agent 的每个外部动作,验收标准必须是「回查目标状态」,不能是「调用没报错」。往后是这条主论点的各个侧面:静默失败的五种形态、不报错也不超时的失败怎么发现、质量门的误报为什么比漏报更危险、以及承认单个 Agent 的成功率明显低于 1 这个前提。
Agent 调用没报错,不等于这件事办成了
我在三条互不相干的线上踩到了同一个形状的坑:脚本说已上线、编排说已完成、接口返回成功,实际上事情都没办成。这篇讲我是怎么发现的、为什么会这样,以及后来我给每个外部动作补的那道回查。不覆盖具体的重试与幂等实现。
Agent 干活里的静默失败:退出码 0 是怎么骗过所有人的
复盘我这条流水线上五类「没报错但事情没办成」的工程失败——它们长得不一样,骗人的方式却是同一种。读完能拿到我给自己定的四条回查纪律,以及一个反直觉的判断。本文不覆盖内容写作侧的失败模式,也不给通用架构建议。
文件落盘不等于子代理写完了
我在自己那条批量写作流水线上,把「文件出现了」当成子代理写完的信号,结果提交进去的是半成品。这篇复盘怎么发现的、为什么会这样、改成了什么。不覆盖版本管理工具本身的用法,也不覆盖单篇人工精修的场景。
Agent 质量门的误报比漏报更危险
我这条内容流水线上,一道机械质量门首轮报出的问题全部是误报,同一道门先后修了至少三次修的都是误报。这篇讲我当时是怎么发现的、判据为什么要写窄,以及为什么误报的代价不是多花时间。不覆盖具体脚本实现和事实级核验怎么做。
Agent 的验收样本要按失败分支覆盖,不是按成功次数累计
我给自己那个写公众号文章的 Agent 补验收样本时,发现样例全是同一条顺利路径的副本。这篇写我当时是怎么发现的、把待补场景按什么维度重列的,以及一条未必适用于你的判断。不覆盖测试框架与自动化用例的写法。
Agent 不报错也不超时的失败,要怎么才能发现
我这条流水线上几次事故都属于「没报错、没超时、也没有任何红字」的那一类,本文复盘它们各自是被什么动作发现的、为什么天生没有信号,以及我把哪几处改成了回查目标状态。不覆盖监控告警系统的搭建。
Agent 产物的自检要看内容特征,不是看文件名
我这条流水线上的封面文件名叫 .png,文件头却是 JPEG,本地一路不报错。这篇复盘它是怎么被发现的、为什么会这样、我把校验挪到了哪一步,以及从中带走的那条判据。本文不覆盖其它类型的静默失败,只扳「名实不符」这一类。
承认单个 Agent 的成功率明显低于 1
批量派活时,如果默认每个子代理都会把活干完,整条流水线的验收就会建立在假设上。这篇给出我判断「哪一步的成功是我假设的」的问法,以及我在编排里加的几处补偿动作;不覆盖模型选型和提示词写法。
Agent 老出错:什么时候该改流程,什么时候该改提示词
派出去的活交回来不对,改提示词还是改工序?给两个当场能自己跑的判据——失败能不能重现、是不是压在同一步,并说明三种判据失效的情况。不覆盖模型选型和参数调优。
验证 Agent 产物的手段自己失效了怎么办
我这条产线上撞到过四类「检查返回通过、但检查本身已经不成立」的情况,这篇复盘它们是怎么暴露的、我把口径改成了什么。不覆盖如何写检查脚本,也不覆盖内容质量本身的判断。
第六步 · 交付与复用
交付物不该只有终稿——每个确认节点的输入与输出都该单独落盘,否则闸门处的决定只留在对话里,对话散了就找不回来。这一组还包括几条从实际返工里长出来的规矩:产物命名要按峰值频次而不是平均频次设计;给 Agent 的任务书要当代码来维护,每次翻车都回写进规格;核实结果要分成直接核实、第三方交叉核实、未核实三档记录,未核实的要显式列出并禁止下游推测。
Agent 的交付物不该只有终稿
我给自己那个写公众号文章的 Agent 定的交付形态不是一篇终稿,而是一个编号目录,把每个人工确认节点的输入与输出都单独落盘。这篇复盘为什么会变成这样、以及我实际改动过的是哪一处。本文不覆盖如何做内容质量评估。
Agent 产物的命名要按峰值频次设计,不是按平均频次
我给一条内容流水线的产物目录改过一次命名规则,起因是同一天出的几个目录彼此认不出来。这篇讲我当时是怎么发现的、为什么日期粒度会失效、改成了什么,以及我从中带走的那条判断。不覆盖具体的目录结构设计方案。
给 Agent 的任务书要当代码来维护
我给子代理写的一份内容规格被改了好几轮,每一轮都对应一次真实翻车。这篇复盘我怎么判断「是代理没干好」还是「是规格没写到」,以及规格该怎么改;不覆盖提示词写法本身。
Agent 的核实结果要分等级记录,不是核过和没核过两档
我在自己的流水线上把事实核验的记录从「核过/没核过」两档改成三档的一次复盘:怎么发现二值标记会把两种可信度完全不同的结论压成一样,改成什么,以及能带走的判据。不覆盖具体核验工具的选型,也不涉及自动化核验的实现。
没核实的要显式列出来,并禁止 Agent 推测
我这条内容流水线上,事实卡里空着的那几项被下游自己填满了。这篇写我是怎么发现的、留白为什么必然被填、以及我把"未核实"改成显式清单之后落下的三条写法。不覆盖核实等级本身怎么划分。
把通用约束抽成简报,每次给 Agent 派活只描述差异
我这条内容流水线的派活提示曾经长到自己都挑不动,后来按「下一批还用得上吗」把约束拆成三层,单次任务书只留差异。写的是分层的判据,不覆盖「翻车之后怎么回写规格」那一步。
Agent 产线的校验脚本:覆盖范围本身要写进清单
我这条内容产线上,新建聚合页漏登记了一处,而校验脚本全绿——复盘「脚本通过」怎么被我误当成了「全部检查过」,以及把脚本覆盖范围写进清单这个改法。本文不覆盖脚本的具体实现,也不讨论该用哪种校验工具。
第七步 · 协作与移交
多个 Agent 一起干活时,最关键的一条是实现者和评审员必须分开——评审员不知道实现者的推理过程,只拿到产物和规格。更进一步:评审员必须有权质疑标准本身,而不只是核对产物是否符合标准。这一组还讲有副作用的动作为什么要收归单点串行、并发的边界为什么不是「任务是否独立」而是「碰不碰同一份共享状态」。收尾一篇写从自用到可移交要拆掉哪些东西——只写到可移交为止,可收钱那一步还没走到。
实现者和评审员必须是两个 Agent
批量交付时把「写」和「审」拆成两个互不通气的 Agent,本文给出当场可判的四个问题、落到编排里的具体写法,以及这条判据不适用的场景;不覆盖单篇创作和人工逐篇确认的场景。
Agent 批量生产:把核实从生产里拆出来单独做
复盘我这条批量写作流水线上的一次调整:为什么我不再让每个子代理自己去核事实,而是先把硬事实固化成一张卡再开工。只讲事实来源怎么组织,不讲编排代码怎么写,也不讲怎么变现。
评审 Agent 必须有权质疑事实卡本身
我在自己的内容流水线上给评审 Agent 加了一个「对事实卡提异议」的返回字段,随后它连续查出我写的卡有问题。这篇讲这个权限口子为什么必须开、发现过程是什么、以及它改变了我对审查者职责的理解;不讲事实卡本身怎么写。
多 Agent 协作:有副作用的动作要收归单点串行
我这条产线上把子代理并行起来之后遇到的一次构建崩溃,以及后来定下的分工——子代理只写各自的内容文件,构建与提交由主导者独占串行。本文只写这一次的经过与改法,不展开怎么给动作分级。
多个 Agent 会话并发在同一个仓库会互相踩踏
我在同一个内容仓库里同时开多个会话带子代理干活,撞出过两类踩踏:构建崩在别人的半成品文件上,共享的构建输出目录互相覆盖导致扫描结果失真。这篇写这两次是怎么被发现的、我把分工改成了什么、以及从中带走的那条并发边界判据。不覆盖多机分布式与团队协作的分支策略。
自用 Agent 走向可移交:要拆掉哪些东西
我把自己那个写公众号文章的 Agent 从「只有我能跑」改到「换个人也能跑」时,实际拆掉的三类东西:写死的本机路径、只在我脑子里的判断、只有我知道的验收标准。本文只写到「可移交」,不涉及接单、报价与对客户交付。
想把 Agent 从「能跑」带到「能交付」?
站内有成体系的 AI Agent 学习路线,从单个 Agent 的机制一路到多 Agent 协作与工程落地。