留存正在改善:判断 PMF 别拿一张快照当结论

2026-08-25

「AI 产品的留存只有 40%」这句话被转来转去的时候,几乎从不带时点。同一份报告、同一个指标,2025 年 1 月的值是 27%。

一、2025 年的九个月里,27% 到 40%

ChartMogul 的《The SaaS Retention Report: The AI churn wave》给了 AI 原生这一组中位 GRR(总收入留存)的两个时点(B1.4):

时点AI 原生中位 GRR
2025 年 1 月27%
2025 年 9 月40%

两个前提得先摆在前面。第一,这份报告只统计已达到 25 万美元年经常性收入的公司(B1.0)——你如果正在找 PMF,大概率不在这个样本里,这组数描述的是已经活下来的公司之间的差异。第二,2025 年 9 月之后的值这份报告没有,而这个领域变得很快,等你读到这篇时它多半又不是 40% 了。

把这两个前提都扣掉,还剩一件很硬的事实:这个指标在 2025 年内的这九个月里朝上移动了十三个百分点。只写「AI 产品留存只有 40%」的转述,是把一个正在移动的量当成了常数在用。

顺带说一句同一份报告里更少被引用的一行:按净收入留存(NRR)这把尺子看,AI 原生是 48%,B2C SaaS 是 49%,两者几乎一样(B1.1,截至 2025 年 9 月)。所谓的「留存断层」只存在于跟 B2B 的对比里。这条和上面那条趋势指向同一件事——挑一个时点、挑一个对照组,同一份报告能得出完全不同强度的结论。

这篇和站内既有课程的分工:L9 阶梯那篇讲留存优先于获客的课,讲的是留存为什么比拉新优先、怎么提、前七天怎么激活,而且它明确拒绝给行业基准值,理由是留存健康线极度依赖品类。那篇讲的是怎么提,这篇一个字不碰「怎么提」,只处理它没展开的另一件事:当你手上已经拿着一个外部数字时,怎么判断它还作不作数。两篇的落点是一致的——最终还是跟自己的上一版比。

二、引用一个数之前,先问它动多快

本站的判断(依据 B1.4 那组时间序列):一个外部数字有没有资格进你的决策,取决于三件事,缺一件就得降级使用。

  1. 它是什么时候测出来的。
  2. 从那时到现在,同类样本里这个指标动了多少。
  3. 你手上有没有更近的、同口径的数。

第 2 条是绝大多数人跳过的。跳过它的代价具体是这样:你想判断的是「我的留存算不算差」,而你用来对照的那条基准线本身在九个月里移动了十三个百分点。这个移动幅度,很可能比你自己那个数字与基准之间的差距还大。结论的置信度就这么被吃光了。

由此可以立一条粗判据,本站的默认取法是:**如果一个基准在最近一年内的可观测移动幅度,超过了你打算用它做的那个判断的容差,这个数就不能单独用来下判断。**它只能用来校准量级——知道自己是在几十这个数量级还是在个位数这个数量级,而不是用来算「我离及格线还差几个点」。

三、分母里的水分会自己蒸发

这条趋势有一个说得通的解释:早期涌进来的实验性用户陆续离场,基本盘沉淀下来,分母里的水分被挤掉了(B1.4)。同一份报告确实记录了这个现象——实验性质的 AI 产品使用者最终会离开,关键特征是转向下一个热门产品;报告只做了现象描述,没有给这批人下正式定义(B1.3)。

这条线能撑多重的结论,取决于它背后有多少家公司。这份报告一共覆盖约 3500 家软件公司,但那是 B2B SaaS 约 2700 家、B2C SaaS 约 600 家、AI 原生约 200 家加起来的总数;27% 到 40% 这条线(2025 年 1 月至 9 月)量的只是其中 AI 原生那约 200 家(B1 节头的样本构成 + B1.4)。

本站的判断顺着这里往下推一步:如果一个只覆盖约 200 家 AI 原生公司的中位数,都能因为分母里的人换了一批而在九个月里移动十三个百分点,那么你自己那条只有几百人、甚至几十人的留存曲线,用户结构的变化幅度只会更剧烈。你上个月和这个月看到的同一个百分数,背后可能是完全不同的两拨人。这一步只是相关性上的类推,不是因果:报告记录的是「中位数在动」和「尝鲜者会走」这两件事同时存在,既没有证明前者由后者造成,也没有对个人开发者的产品做过任何推断。何况那约 200 家全部越过了 25 万美元年经常性收入这道门槛(B1.0),和你不是一批人。

操作上的推论是:别问「我的留存是多少」,问「三月进来的那批人和六月进来的那批人,同样看第四周,差多少」。一个总体数字完全可能在结构翻天覆地的情况下纹丝不动——因为新涌进来的人贡献的短期活跃,正好补上了老用户流失掉的量。分组横着看,这种对冲才会显形。

四、更隐蔽的一种过期:尺子换了

数值在动,是第一种过期方式。第二种更难察觉:字段名没变,量它的尺子换了。

a16z 的《The Top 100 Gen AI Consumer Apps》第 6 版,2026-03-09 发布,榜单数据截至 2026 年 1 月(B4)。这一版把收录范围放宽了——从这一版起,只要生成式 AI 已经成为体验的核心组成部分就可以进榜,不再只收 AI 原生产品,文中点名了 CapCut、Canva、Notion 这类产品。

口径一改,跨版本的比较就断了——这半句是本站的判断,B4 记录的只是「第 6 版放宽了收录范围」这个事实,报告本身没有讨论跨版本还能不能比。但既然第 5 版的名次和第 6 版的名次不是同一把尺子量出来的,把它们接成一条趋势线就失去了依据,虽然两版的表头看上去一模一样。

同一篇里还有一条更硬的自我批评。a16z 白纸黑字承认,它的排名越来越低估了人们用得最多的那些 AI 产品(原文「undercount the AI products people use most」,a16z 第 6 版)。文中举的例子是一个每天泡在 Claude Code 里八小时的开发者——这种重度使用者在网页流量数据里几乎体现不出来。它的测量方法是网页端按 SimilarWeb 的月度独立访问量、移动端按 Sensor Tower 的月活,均截至 2026 年 1 月。

一家把「排 AI 应用榜」做成招牌产品的机构,手里拿着这两家的数据,仍然在自己最新一版里写下这句话。一个独立开发者靠注册数、靠日活来判断自己有没有到 PMF,比这个还要不牢靠。

本站的判断:外部数字的两种过期方式要分开处理。数值在动,你还能靠「取更近的数」补救;尺子换了,你只能作废重来,因为旧数据在新口径下根本没有对应物。

五、这件事本来就写在 PMF 的定义里

a16z 2017 年 2 月那篇《12 Things About Product-Market Fit》,第 8 条列的迷思之一就是「PMF 是一个离散的、大爆炸式的事件」。文中转述 Ben Horowitz 的观点:PMF 是迭代的、连续的,停止适应就会丢掉(A5.4)。同一份清单的第 6 条还写着另一件事:创始人经常把早期的一点起色误当成真的 PMF(A5.1)。

这两条摆在一起,就把「拿一张快照当结论」的两个方向都说全了。一个方向是坏快照当判决——看到行业中位数很低,认定这个品类没戏,而那个中位数正在以每季度可感知的幅度往上走。另一个方向是好快照当通行证——某个月的数字漂亮,就当 PMF 已经拿到手,然后照着「到了 PMF 再放量」的剧本去砸钱,而那个漂亮数字很可能只是某一波新用户还没走完。

「PMF 会丢」不是本站为了讲 AI 才发明的概念,2017 年就已经被白纸黑字写出来了。AI 产品只是把这件事的时间尺度压短了。

六、给每个判断加上时点和重测日

这是本站的方法,不是任何一份报告里的结论。做法就五条:

  1. **每条结论旁边记三样:数值、口径、测量时点。**三样缺一样,这条结论就不许进决策。「留存不行」这四个字单独存在时是没有信息量的。
  2. **外部数字写一个失效日期。**本站给的默认值是两个季度——超过两个季度的 AI 相关外部基准,只保留量级参考价值,不再用来算差距、算比例。这个默认值的依据就是 B1.4 那九个月十三个点。
  3. **自己的数字按进入月份分组横着看。**看的是不同批次在同一个时间点上的差,不是总体单点。
  4. **换过口径就断线。**改了统计范围、改了「算不算活跃」的定义、改了取数工具,之前的曲线全部作废重来,不许把两把尺子的数接成一条线。a16z 那次版本换口径就是活例子。
  5. **每次重测先复述上次的口径,再取数。**顺序反过来的话,人会不自觉地把口径往有利的方向挪。

配套三个可以照抄的问句,用在任何一个别人递给你的数字上:

  • 这个数是什么时候测的?
  • 从那时到现在,同类样本里这个指标动了多少?
  • 如果它按同样的速度再动一个季度,我现在要做的这个决定会不会反过来?

第三问是判据。答案如果是「会反过来」,那这个决定要么现在不该做,要么不该建立在这个数上。

七、今天能做的那一件事

判断 PMF 的最小可用产物不是一个数字,是一张带日期的记录表:三列,分别是判断内容、依据的数值与它的测量时点、重测日期。

这张表第一次记的时候看不出任何东西,第三次之后才开始有用——因为到那时你手上才有了方向,而不只有点。所以起点越早越有价值。

现在就能做的动作只有一个:把你此刻正在依据的那个数字写下来,旁边补上它是哪一天测的、按什么口径测的,再给它定一个重测日期。

延伸阅读

本篇提到的站内课程,可以直接接着往下读:

名词不熟可以先看术语页:PMF(产品市场契合)

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。