PMF 分数过了 40%,留存还是不行
问卷跑出来的分数过了 2018 年那篇复盘里转述的 40% 线。打开后台一看,上个月来过的那批人没剩下多少。
这两个数摆在一起,第一反应是「用户嘴上说的不算数」。这篇要说的是另一个方向,而这个方向是本站的判断,依据是第二节 A2.3、A2.4 那十二条判据的构成:与其先怀疑用户诚不诚实,不如先承认这两个数从一开始就没在量同一件事,而且它们的分母未必是同一批人。
站内 L9 阶梯有两篇课把 PMF 当成决策开关在用。一篇讲分发比产品重要、时间该怎么分配,一篇讲该不该做投放,结论都是「到了 PMF 再放量」,但两篇都没说你怎么知道到了没有。这篇补的就是那一层里最别扭的一种情况:问卷说到了,留存说没到。同一条阶梯上还有一篇专讲留存优先于获客的课,讲漏桶模型、首次价值时间、新用户前七天怎么激活——那篇讲留存为什么重要、怎么提。这篇不重复那些,只处理一件那篇没有覆盖的事:当问卷分数和留存数据给出相反结论时,先信哪个、按什么顺序拆。
一、提出这套问法的人自己也在写这个题
Sean Ellis 在 2024 年 12 月 19 日于自己的 Substack 上发过一篇,标题就叫「高 PMF 分数但低留存」。可见的摘要里记了一个创始人的案例:问卷中 55% 的用户回答没有这个产品会非常失望,高过他自己推荐的那条线,公司仍然面临低留存(A3.3)。
那篇的正文在付费墙后面,本站没有取到,所以他给的原因清单和修正建议这里一个字都不会转述。下面所有的排查顺序都是本站自己的推演,依据标在每一节。
这件事的用处不在他给了什么答案,在于它确认了一点:分数过线而留存不行,是一个被提出这套问法的人本人单独拿出来写过一篇的组合,不是你的产品特别奇怪。所以排查方向应该是「这两个口径为什么会打架」,而不是「我是不是被骗了」。
二、问卷量的是态度,留存量的是行为
那套问卷的主问题是「如果以后再也不能用这个产品了,你会是什么感觉」,三个选项是非常失望、有点失望、不失望;回答「非常失望」的比例达到 40% 视为达标——这个说法最常被引用的转述来自 2018 年那篇 Superhuman 复盘,2009 年那篇原始博文本站没有取到(A3.1、A3.2)。
这是一个假设句。它请一个现在还在用的人,去想象一件没有发生的事,然后报告感受。
留存不问感受。它只记录一件已经发生的事:这个人上个月来了,这个月还来不来。一个是态度的横截面,一个是行为的时间序列。它们能对得上是好事,对不上并不构成悖论。
有个对照可以看得更清楚。2007 年那篇最早系统讲 PMF 的文章列了两组可观察症状。没到的一组是:客户没从产品里拿到足够价值、口碑传播很慢、使用量涨得不快、媒体反应平淡、销售周期拖得很长、交易频繁谈崩(A2.3)。到了的一组是:客户买的速度快过你能生产的速度、使用量涨得快过你能加服务器的速度、钱不断进来、在拼命招销售和客服、媒体主动找上门(A2.4)。
十二条里,没有一条是「用户说他喜欢」。那个年代给出的判据全部落在行为面上。问卷是后来为了回答「怎么知道到了没有」才补出来的测量手段,它从来不是定义本身。所以当问卷和行为打架时,行为那一侧的优先级更高——这是本站的判断,依据就是 A2.3 和 A2.4 这十二条的构成。
三、先查分母,别先怀疑用户
分数高而留存低时,本站的判断是先查分母、不先查用户:问卷的分母可能被悄悄收窄过,而留存的分母没有。收窄有三种方式:
其一,弹出时机替你筛掉了要走的人。 如果问卷是在用户完成注册后第三次使用、或者用满七天时触发的,那些用一次就再没回来的人根本不在分母里。你量到的是「已经留下来的人有多喜欢」,那当然会高。而留存的分母是全体注册用户。两个分母差得越远,分数和留存背离得越厉害。
其二,回收量太小,比例本身不稳。 有说法认为,这套问卷的有效回答最少要约 30 份,到 100 份以上时信心才明显更高(A3.2,这是二手说法,本站未见一手出处)。回收二三十份时,几个人的差别就能让比例跳好几档。
其三,你把某一批人的分数当成了全体的分数。 通过某一个渠道进来的人、或者内测期就在的那批老用户,回答意愿本来就比其他人高。他们在回收样本里的占比,通常远高于在注册总量里的占比。
对应三个可以照抄去核对的问句:
- 这份问卷是在用户第几次使用、第几天之后弹出来的?
- 从注册到收到问卷,中间流失掉的人算不算在分母里?
- 回答「非常失望」的那些人,注册时间和来源渠道是怎么分布的?
三个问题里只要有一个答不上来,这一轮的分数就不能拿来跟留存做对比,先把口径补齐再说。
四、把「非常失望」那批人单独拉一条留存曲线
分母查清之后的第一个动作,是把回答「非常失望」的那些账号单独圈出来,给他们算一条自己的留存曲线,再跟整体的那条放在一起看。
这个动作的框架依据是 A4.2 的第一步:把回答「非常失望」的人单独拎出来做分段,而不是盯着那个被平均掉的总分。筛选画像时要用他们自己在配套题里的措辞,不要用你的行业黑话(A4.3)。具体怎么读,是本站的推演:
| 「非常失望」那批人的留存 | 整体留存 | 读法 |
|---|---|---|
| 明显好于整体 | 差 | 核心价值成立,问题在获客口径——你把大量不属于这批人的用户拉了进来 |
| 跟整体差不多,都差 | 差 | 问卷分数是分母造出来的假象,回到第三节重查口径 |
| 好于整体,但绝对值也不高 | 差 | 价值成立但交付不稳,卡点在使用路径上,不在选题上 |
| 明显好于整体 | 好 | 这两个口径没有打架,问题不在这一层 |
第一行和第二行指向的动作完全相反。第一行该收窄投放、把获客对准那批人的画像;第二行该停下所有放大动作,先把问卷重发一遍。凭一个总分是分不出这两种情况的,必须拆开看。
配套的三道题在这一步能直接派上用场(A4.4):问他们觉得哪类人最受益、从产品里拿到的主要收益是什么、要怎么改才能更好。第二题的回答最值得对着留存数据看——你以为的核心价值,和他们实际拿到的收益,经常不是同一个。如果这批人说的收益是一个用一两次就够了的收益,那留存低就不是背离,是产品形态本来如此。
五、还有一种可能:你手上的留存口径本身在低估
a16z 在 2026 年 3 月 9 日发布的第 6 版消费级 AI 应用榜单里,明确承认自己的排名「越来越低估了人们用得最多的那些 AI 产品」(原话 undercount the AI products people use most,a16z 第 6 版,数据截至 2026 年 1 月,B4)。它举的例子是一个每天泡在 Claude Code 里八小时的开发者,属于重度用户,但在网页流量数据里几乎体现不出来。
一家把排 AI 应用榜做成招牌的机构,手里拿着两套商业流量数据,仍然要写下这句话。换到个人产品上(这是本站的外推判断):如果你的产品是嵌在别人工作流里被调用的——命令行、编辑器插件、接口、定时任务——那么「打开网页」「登录后台」这类动作会系统性地漏掉最重度的那批人。你算出来的次月留存于是偏低,而问卷里那些天天在用的人照样回答「非常失望」。
这一步的动作很具体:把你现在用的留存定义原样写在纸上,然后问一句——你能想到的最重度那个用户,他这个月触发过这个定义吗。如果答案是「不一定」,先修定义,再谈数字。
六、AI 产品上还有一条特有的背离来源
ChartMogul 那份软件留存报告里记了一个现象:有一类使用者会把实验性质的 AI 产品用一阵,然后转向下一个热门产品(B1.3)。
从这个现象再往前推一步,是本站的推演,不是那份报告写下的结论——报告只讲了这批人会走,没讲他们走之前会怎么回答问卷:这批人的问卷答案未必难看,因为他们用的那段时间里如果确实觉得好用,被拿走也确实会失望;但他们的行为轨迹从一开始就不指向长期留存。所以这一类背离不是问卷出了错,是问卷问的那个时点,恰好是他们还没走的时点。
这也不是一个静止的局面。同一份报告里,AI 原生产品的中位总收入留存从 2025 年 1 月的 27% 升到了 2025 年 9 月的 40%,样本是已过 25 万美元年度经常性收入的公司。这个数字变化很快,九个月就动了一大截,一种可能的解释是尝鲜的人陆续离场、基本盘沉淀下来(B1.4)。拿任何一个时点的快照当结论,都不合适。另外这里的 40% 和第二节问卷那条 40% 线毫无关系:一个是一批公司在 2025 年 9 月的中位收入留存,一个是问卷里选「非常失望」的人占全部回答者的比例,两个数值恰好撞在一起而已,不能互相印证,也不能拿一个去推另一个。
七、复测比单次分数有用
那套流程里有一步是循环:持续对新用户发问卷,每个季度按新的回答重建一次路线图(A4.2)。分数过线之后这一步反而更容易被跳过——数好看了,就不想再测了。
两条来自 a16z 那篇十二条要点的提醒可以放在这里。一条是创始人经常把早期的一点起色误当成真的 PMF;另一条是认出 PMF 需要定性判断,不是纯看数(A5.1 第 6 条与第 5 条)。同一篇里还写着,PMF 不是一次性事件,也不总是显而易见,而且是会丢的(A5.4)。一个过了线的分数,最多说明测的那一刻、那批人身上成立。
所以复测的价值不在绝对值,在方向。连续两三次的分数配上同期的留存曲线,才能分辨出你上一轮改动到底动了什么。单次分数是个点,画不出方向。
八、这一轮具体做什么
按顺序走,前一步没做完不要跳到后一步:
- 把问卷的触发时机、回收份数、回答者的注册时间与来源分布这四项写下来。写不出来的,这一轮的分数作废,重发。
- 把回答「非常失望」的账号 ID 导出来,单独算一条留存曲线,跟整体的那条画在同一张图上。
- 对照第四节那张表定位属于哪一行,按那一行给的方向定下一步动作,不要同时做两行的事。
- 把当前的留存定义写下来,拿你最重度的那个用户去对一遍,看他会不会被这个定义漏掉。
- 把这一轮的分数、回收份数、日期记在一处固定的地方,下一轮改动做完之后按同样口径再测一次,只比方向。
延伸阅读
本篇提到的站内课程,可以直接接着往下读:
名词不熟可以先看术语页:PMF(产品市场契合)