薄包装的三个自检问法:你的 PMF 靠不靠得住

2026-08-25

产品有人用,有人付钱,续费也没崩。按站内那条阶梯的说法,这种状态已经够格开始加大投入了。但如果产品的核心能力来自你调的那个模型,在”够不够格”之前还卡着另一个问题:这套指标的有效期,是不是攥在别人手里。

站内 L9 有一篇讲独立开发者长期定位的课,也谈护城河,防的是横向那一层——AI 编程工具把开发门槛踩平,同行暴增,“会写代码”贬值。这篇只处理纵向的那一层:威胁来自你脚下的模型厂商。两种威胁的判据完全不同,横向看的是你和同行之间的差异,纵向看的是把上游抽掉之后你手上还剩什么。同一条阶梯上还有几篇反复拿”到了 PMF 再放量”当决策开关用,这篇补的是这个开关在薄包装形态下要多问的一层。

一、三个问法测的是三个不同的时间点

公开讨论里反复出现的自检问法有三条(B3.1)。它们是方法不是研究结论,也不归属于某个具体的人:

  1. 拆除测试:假设上游那家模型公司从世界上消失了,你的产品里还有多少东西能独立留下来?清点下来只剩一层交互界面和几段调好的提示词,按这条判据就等于没有资产。
  2. 80% 测试:把你的核心提示逻辑交给一个懂技术的用户,让他在通用对话框里自己跑,他能不能复现出你 80% 的产出?能,你做的这一层就是包装。
  3. 默认功能测试:设想上游在下一个版本里把你这项能力做成了自带的、不额外收费的功能,你现有的客户还有没有理由继续付这笔订阅。

这三条常被当成同一句话的三种说法,一口气念完,点头,然后该干嘛干嘛。本站的判断是不该这么用。按 B3.1 里这三条各自的问法看,它们问的根本不是同一件事,而是三个不同时点上的事:

  • 拆除测试问的是现在。 此刻你手上有没有非借来的东西。
  • 80% 测试问的是横向。 在同一个时刻,你的用户有没有一条绕开你的路。
  • 默认功能测试问的是未来。 上游往前走一步之后,你占的那个位置还在不在。

三个时点互相不能替代,本站的判断是它们的答案完全可能互相矛盾。设想一种组合:拆除测试过关,手上确实攒着一批模型厂商拿不到的数据,但这批数据还没被用进用户每天真正要的那个结果里,于是 80% 测试照样过不了。反过来的组合同样成立:拆开看什么资产都没有,可产品嵌在客户每天必走的一道流程里,就算上游把同样的能力做进了默认版本,客户也未必愿意把流程搬走。这两种组合下该补的东西完全不同,混在一起判就会两个都判错。

所以这三条要一条一条单独跑,各记各的答案。混着念完只会得到一个模糊的”应该还行”,那个印象值不了什么。

二、怎么真的跑一遍

三条问法的难处不在理解,在于自己给自己打分时手会抖。

拆除测试:写一张拆除清单,而不是想一想

把产品拆成四栏,逐项往里填,每填一项就问一次”上游没了,这项还在不在”:

这一项是上游拿掉之后
提示词、编排逻辑、输出格式通常不在——它们的价值依附于那个模型
随使用累积、且只有你这里有的数据
你替用户固化下来的操作流程与状态
你占住的那个分发位置与客户关系

填完之后看第一栏之外还剩几行有内容。全空,那就是 B3.1 说的”一个界面加一段系统提示词”。

这张表有一个容易作弊的地方:手会不自觉地把”我调了三个月的提示词”填进第二栏,理由是它凝结了大量领域知识。它确实凝结了,但提示词是可以被读出来、被复述、被人肉逆推的,它不满足”只有你这里有”。判断依据只有一条——这东西能不能被一个聪明人看着你的产品在一周内重建出来。能,它就不该记在资产那一栏。

80% 测试:别自己测,也别找错人

自己去通用对话框里试,结果一定是”差远了”,因为你知道自己产品所有的边角处理,而对照组是你临时敲的一段话。这个测法没有信息量。

可执行的版本是找人替你测,而且要找对人:从付费用户里挑技术能力最强的那一位,把你愿意公开的那部分核心提示逻辑给他,让他自己去通用工具里跑一次他上周真实做过的那件事。

挑人时避开一类样本。ChartMogul 那份报告描述过一个现象:实验性质的 AI 产品使用者最终会离开,关键特征是转向下一个热门产品,报告本身没有给这类人下正式定义(B1.3)。本站由这条现象往下推一步:这类用户什么都愿意试,也什么都不留下,对通用工具的容忍度自然更高,拿他们做对照会把你的产品测得比实际更没用。找那位已经连续付了几个周期、并且会主动跟你提改进意见的。

测完之后问他的那句话,比测试结果本身更重要。别问”差多少”,问:

差的那一部分,值不值你现在付的这笔钱?

问”差多少”,你会收到一段客气的技术点评。问”值不值这笔钱”,你会收到一个价格锚定过的判断,而这正是 80% 测试真正想量的东西——不是你比通用工具好多少,是那点好处够不够撑住你的定价。

默认功能测试:不要去预测模型,去问客户

这条最容易跑歪,因为它的字面表述在诱着你去猜上游下一版会做什么。那是猜不准的,也不必猜。把它改写成一道摆到客户面前的假设题就行:

假如你现在用的这个大模型产品,下个版本自带了我们这个功能,你会怎么处理我们这边的订阅?

追一句:

如果你会留下来,是因为哪一件具体的事换过去太麻烦?

第一问给你一个态度,第二问给你一份迁移成本清单,后者才是可用的东西。客户如果说得出”我们三个部门的模板都在你们这儿""历史记录查不了会出事""对接的那个内部系统重接一次要排期”,这些就是你实际握着的东西。客户如果只能说”你们做得更好用一点”,那这条测试没过——好用是可以被一次版本更新抹平的。

B3.1 那条判据讲的是模型升级抹掉你的功能这件事。站内另有篇目专讲漂移本身怎么监测、怎么触发重估,那是升级发生之后的事;这一条是在升级发生之前,先把自己的暴露面量出来,两者不重叠。

三、三个答案怎么读

跑完之后手上有三个”过/不过”。本站按 B3.1 这三条各自问的时点,给一份判读清单:

  1. 三条全不过。 你现在的指标可能全是真的——用户是真用、钱是真收——但这个 PMF 的续期权在别人手上。此时最不该做的事是加大获客投入,因为你在给一个到期时间未知的东西预付租金。
  2. 只有拆除测试过。 你有资产,但资产还没接进用户当下感知到的那个结果里。这是最可惜的一种,通常离”能过”只差把那批数据真正用进核心链路。
  3. 只有默认功能测试过。 客户不走是因为迁不动,不是因为你更好。这是真实的门槛,但它随时间衰减——只要迁移成本降下来,或者对方换了个负责人,这道门就松了。
  4. 只有 80% 测试过。 你的产出确实是通用工具给不了的,但拆开看没有沉淀,客户也不觉得迁移麻烦。这种领先靠的是手艺,能守多久取决于这门手艺多难被复现。
  5. 过两条以上。 到这里问题就不再是”靠不靠得住”,而是把已经成立的那两处继续加深。

这份清单的用法不是给自己评级,是决定下一笔时间和钱往哪投。第 1 种和第 5 种对应的动作完全相反,而它们在增长面板上可能长得一模一样。

四、没过,不等于你现在没有 PMF

三条全不过,很容易顺手推出一个过头的结论:那我这个大概不算真的 PMF。这一步推得太远了。

a16z 2017 年那篇《12 Things About Product-Market Fit》里把几个迷思列了出来,其中一条是”PMF 是一个离散的、大爆炸式的事件”——这是迷思;文中转述 Ben Horowitz 的观点,PMF 是迭代的、连续的,而且如果停止适应就会丢掉;配套的论点是市场和竞争者持续变化,因此需要持续适应才能保住(A5.4)。同一篇的第 8 条还列着另外两个迷思:PMF 不是一次性事件,也不总是显而易见(A5.1#8)。

按这段推下去,薄包装的问题就不是”有没有 PMF”,而是这个 PMF 的保质期由谁决定。用户真在用、真在付钱,契合就是成立的,只不过它的存续依赖一个你控制不了的条件。这跟”没有 PMF”是两回事,处理方式也不一样:没有 PMF 该回去改产品或换市场,保质期不在自己手上该做的是趁契合还成立的时候把资产往下扎。

这也解释了一件反直觉的事——为什么三条测试可以在指标全线飘红的时候全部不过。2007 年那篇列”没到 PMF”的症状一共六条(A2.3):客户没从产品里拿到足够的价值、口碑传播很慢、使用量涨得不快、媒体报道反应平淡、销售周期拖得很长、交易频繁地谈崩。

拿这六条对照自己之前,得先做一次换算。按 A2.5,这组症状描述的是融过资、有销售团队、有服务器扩容压力的公司,用在一个人的产品上必须先声明这一点。本站的判断是,六条里”销售周期拖得很长""交易频繁地谈崩”这两条对自助注册、在线付费的个人产品根本不成立——你没有那种形态的销售动作,它们不出现说明不了任何问题,不能记成”我这条过了”。“客户没拿到足够价值""媒体报道反应平淡”这两条则要看具体产品,薄包装占不占得上,不能一概而论。

真正能拿来对照的是口碑和使用量这两条,而薄包装在这两条上往往表现得相当好:口碑传得很快,使用量涨得很猛,因为它踩的是上游能力刚放出来那一波的空档。也就是说,2007 年那份清单在薄包装身上失灵的是口碑与使用量这一段——它不响,不代表你脚下那块地是你的。这三条测试要补的正是它给不出的那部分。

五、没过的那条,往哪补

公开讨论里护城河的来源普遍收敛到三处,并且都强调单靠一处很脆弱,叠两处才算门槛(B3.2):随使用而累积、模型厂商拿不到的自有数据;成为某项业务的系统记录方、迁移成本高的工作流锁定;切进一个横向玩家不值得覆盖的细分场景,也就是分销纵深

这三处和上面三条测试不是并列关系。本站按 B3.1 与 B3.2 各自的着力点,把它们对上:

  • 自有数据主要救拆除测试。 它直接改变”上游拿掉之后还剩什么”这个答案。但它救不了默认功能测试——数据是你的,不代表客户离不开你。
  • 工作流锁定主要救默认功能测试。 客户不退订的理由从”你更好”变成”搬不动”。它同样救不了 80% 测试,一个新用户不在你的流程里,照样可以拿通用工具解决问题。
  • 分销纵深主要救 80% 测试。 用户压根不会想到去通用对话框,因为他是在自己那个场景里遇到你的,你出现在他解决问题的路径上,而不是他搜索工具的列表里。

“叠两处才算门槛”这句话,落到这个对应关系上就有了具体含义:单补一处,只有一条测试会翻过来,另外两条原样不动。你要先看清自己是哪一条没过,再选补哪一处,而不是听说数据是护城河就一头扎进去攒数据。

六、什么时候重跑

这三条不是一次性检查,因为它们量的是你和上游的相对位置,而这个位置只要有一边动了就会变。本站建议的重跑时机有三个,都是事件触发不是日历触发:

  1. 上游放出一个大版本之后。 不用等确认自己是不是受影响,直接把默认功能测试那两个问句发给几个客户。
  2. 你准备加大一笔投入之前。 无论是投放、招人还是延长服务器合同,跑一遍拆除测试。第 1 种判读结果下加大投入,是本站认为最贵的一种错误。
  3. 每次你的定价往上调之前。 80% 测试量的就是溢价的依据,涨价而这条没过,等于把用户往通用工具那边推。

今天能做的那件事很小:把上面第二节那张四栏拆除清单填一遍,再挑一位老付费用户,把默认功能测试那两句问句原样发过去。一个下午能收完,收回来的答案会比任何一份行业报告更贴近你自己的处境。

延伸阅读

本篇提到的站内课程,可以直接接着往下读:

名词不熟可以先看术语页:PMF(产品市场契合)

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。