拆除测试:把模型厂商拿掉,你还剩什么
站内 L9 阶梯有一篇讲独立开发者长期定位的课,那篇处理的威胁来自别的开发者:AI 编程工具把动手门槛踩平,同质化的对手一下子变多,「会写代码」本身在贬值。这篇处理的是另一个方向的威胁——它来自你脚底下那家模型厂商。两者的应对方式不通用:对手变多要靠差异化和分发,厂商压过来要看你手上有没有一样东西是它拿不走的。
一、把「拿掉」这个动作做实
有一种在公开讨论里反复出现的自检问法(B3.1#1):把模型厂商整个拿掉,你手上还剩什么?如果答案是「一个界面加一段系统提示词」,那就没有资产。
这句话本身不难懂。难的是绝大多数人在心里含糊地回一句「我还有用户啊」,然后就过去了。要让它产生结论,得把「拿掉」做成一个具体的清点动作,一层一层拆,每一层都必须给出「在」或「不在」,不许答「算是有一点」。
按本站的做法,拆成四层,从最靠近厂商的一层开始:
- 调用封装层——鉴权、重试、流式输出、把返回内容渲染成好看的卡片。厂商没了,这层的价值直接归零,因为它服务的对象就是那个接口。
- 提示词与编排层——你的系统提示词、多步骤的串联、各种兜底与格式约束。厂商没了,这层的形式还在(你还留着那些文本),但效果不在。
- 你自己的数据层——用户在你这里积累的、随使用越滚越厚、并且厂商那边根本看不到的东西。厂商没了,这层原封不动地留在你手上。
- 关系与交付层——你在客户业务流程里占的位置、对方为你改过的操作习惯、你和他签的东西、你能触达他的路径。厂商没了,这层也在。
拆的时候有一个容易自欺的地方:第 2 层最像资产,因为它是你花最多时间打磨的。可以用另一个流传很广的问法当作交叉验证(B3.1#2)——把你的核心提示词原样粘进一个通用对话框,让一个懂技术的用户去试,他能不能拿到差不多的产出。如果能,那这层就该记「不在」,无论你在上面花了多少个晚上。
清点完,把留下来的第 3、4 层写在纸上,这张纸就是拆除测试的结果。它通常比人们预想的短很多。
二、拆完只剩前两层,问题不止是「没护城河」
如果清点结果是第 3、4 层都空着,麻烦是双份的。
第一份是大家都知道的:你的产品是可复制的,谁都能在一个周末搭出形似的东西。
第二份少有人算:你的成本结构也是租来的。 传统低价软件普遍敢做免费层和长试用期,因为毛利高,养一个不付钱的用户成本可控,他哪天自己想通了就升级。AI 产品是每一次调用都在花钱,于是被迫在很早的位置就推转化,甚至出现按日的用量墙——这在传统软件里几乎不会出现(B2.2#1)。也就是说,拆除测试里被判「不在」的那两层,恰恰是你每个月在真金白银往里填的那两层:你替厂商垫付调用,收回来的是差价,而定价权的上限在别人手里。
本站的判断是:这两份麻烦要一起看。只看第一份,容易得出「先做大用户量再说」的结论;把第二份放进来会发现,在没有第 3、4 层的情况下,用户量越大,你替别人垫付的越多。
三、什么算「拿得走的东西」
关于护城河的来源,公开讨论里有一个反复出现的说法认为,能长期成立的大致收敛到三处,而且单靠一处都很脆弱,叠上两处才算门槛(B3.2):
- 自有数据:随使用累积、模型厂商那边拿不到的数据
- 工作流锁定:成为某项业务的「系统记录方」,迁移成本高
- 分销纵深:切进一个横向玩家不值得覆盖的细分场景
这三条本站没有追到一手出处,所以不拿它当论断依据,只当作对照表用——它刚好对上第 3 层和第 4 层。你在纸上写下的每一条,都可以往这三格里放;放不进去的,多半是你自己觉得有价值、但客户换掉你时不会犹豫的东西。
判据可以定得很硬。对纸上的每一条问三句,三句都过才算数:
- 它是随时间变厚的,还是做完就定在那儿了?定在那儿的是功能,不是资产。
- 一个从今天开始做同类产品的人,需要多久才能积到同样的厚度?答案以天为单位的,划掉。
- 客户离开你的时候,这条东西是留在他那儿还是留在你这儿?留在他那儿的(比如他导出就能带走的全部内容),不计入。
四、这不是一次性判断
拆除测试还有第三种问法(B3.1#3):如果模型厂商下一个版本把这个能力做成默认功能,你的客户会不会退订。模型升级的节奏该怎么盯,那是另一篇的题目,这里只用它的一个属性——它把拆除测试从一次性动作变成了周期性动作。
这个属性不是为 AI 现编的。a16z 2017 年 2 月那篇讲 PMF 的文章里,第 8 条列的迷思之一就是「PMF 总是一个离散的、大爆炸式的事件」(A5.1);同一篇转述过 Ben Horowitz 的观点:PMF 是迭代的、连续的,如果停止适应就会丢掉,因为市场和竞争者一直在变(A5.4)。这段话在 2017 年就白纸黑字写着了,本站要做的只是把它落到 AI 这一侧的具体动力上:对你来说,「竞争者在变」里有一个特殊成员,就是你自己依赖的那个供应商。
所以拆除测试的正确用法不是做一次得个结论,而是定一个固定间隔重做,每次把纸上的条目和上一次对比。条目变多说明你在积累;条目原地不动而营收在涨,那是市场在拉你,不是你在建东西——按上面那条 2017 年的论点,这种状态是会翻转的。
五、同为 AI 产品,差距大到不能用技术属性解释
有一份统计到 2025 年 9 月的软件留存报告,把 AI 原生这一组按价格档拆开看,高档的净收入留存(NRR)是 85%,与 B2B SaaS 的 NRR 82% 基本持平;而低档那一头低得多(B1.2)。这个领域的数字变得很快,这里只代表那个时点。
引用它必须带上两条限制(B1.0):一是该报告只统计已达到 25 万美元年经常性收入的公司,还在找 PMF 的独立开发者根本不在样本里;二是它按什么分的档,本站没有确认——只能读成「报告分出的高中低三档里,高档的留存明显更好」,不能读成「你把价格标高,留存就会变好」。
在这两条限制之内,本站的判断是:留存差的根源未必在「AI 这项技术」本身。 如果是技术属性决定的,同一批 AI 产品内部不该差成这样,更可能与承诺水平和定价姿态有关。这和拆除测试指向同一件事——厂商拿不走的那部分,往往就是你对客户做出承诺、并且真的兜住了的那部分。第 1、2 层做不出承诺,因为它们随时可以被同样的接口复现;第 3、4 层才承载得起。
六、把这张纸换成下个季度的工时
清点本身不产生变化,分配才产生。拿着那张纸做三件事:
- 把纸上的条目数记下来,标上日期。 这是你唯一需要长期跟踪的护城河指标,比任何自我评估的分数都实在。
- 对着第三节的三句判据划掉不合格的条目,剩下几条就是几条。剩零条不代表产品不该做,代表你现在卖的是便利,而便利的定价权不在你手上。
- 下个季度的工时里,切出一块固定比例,只投给能让第 3 层或第 4 层变厚的事。 比例多少由你定,但它必须是先划出来、再排功能,否则永远排不上——让第 3、4 层变厚的活儿通常没有即时反馈,在任何一次排期里都会输给「这个功能用户催了三次」。
如果只做一件,做第 2 件:把「我有护城河吗」这个模糊的焦虑,换成一个能数出来的条目数。数出来是零,也比想不清楚强——至少你知道接下来那块工时该往哪儿放。
延伸阅读
本篇提到的站内课程,可以直接接着往下读:
名词不熟可以先看术语页:PMF(产品市场契合)