留存正在改善:判断 PMF 别拿一张快照当结论
「AI 产品的留存只有 40%」这句话被转来转去的时候,几乎从不带时点。同一份报告、同一个指标,2025 年 1 月的值是 27%。
一、2025 年的九个月里,27% 到 40%
ChartMogul 的《The SaaS Retention Report: The AI churn wave》给了 AI 原生这一组中位 GRR(总收入留存)的两个时点(B1.4):
| 时点 | AI 原生中位 GRR |
|---|---|
| 2025 年 1 月 | 27% |
| 2025 年 9 月 | 40% |
两个前提得先摆在前面。第一,这份报告只统计已达到 25 万美元年经常性收入的公司(B1.0)——你如果正在找 PMF,大概率不在这个样本里,这组数描述的是已经活下来的公司之间的差异。第二,2025 年 9 月之后的值这份报告没有,而这个领域变得很快,等你读到这篇时它多半又不是 40% 了。
把这两个前提都扣掉,还剩一件很硬的事实:这个指标在 2025 年内的这九个月里朝上移动了十三个百分点。只写「AI 产品留存只有 40%」的转述,是把一个正在移动的量当成了常数在用。
顺带说一句同一份报告里更少被引用的一行:按净收入留存(NRR)这把尺子看,AI 原生是 48%,B2C SaaS 是 49%,两者几乎一样(B1.1,截至 2025 年 9 月)。所谓的「留存断层」只存在于跟 B2B 的对比里。这条和上面那条趋势指向同一件事——挑一个时点、挑一个对照组,同一份报告能得出完全不同强度的结论。
这篇和站内既有课程的分工:L9 阶梯那篇讲留存优先于获客的课,讲的是留存为什么比拉新优先、怎么提、前七天怎么激活,而且它明确拒绝给行业基准值,理由是留存健康线极度依赖品类。那篇讲的是怎么提,这篇一个字不碰「怎么提」,只处理它没展开的另一件事:当你手上已经拿着一个外部数字时,怎么判断它还作不作数。两篇的落点是一致的——最终还是跟自己的上一版比。
二、引用一个数之前,先问它动多快
本站的判断(依据 B1.4 那组时间序列):一个外部数字有没有资格进你的决策,取决于三件事,缺一件就得降级使用。
- 它是什么时候测出来的。
- 从那时到现在,同类样本里这个指标动了多少。
- 你手上有没有更近的、同口径的数。
第 2 条是绝大多数人跳过的。跳过它的代价具体是这样:你想判断的是「我的留存算不算差」,而你用来对照的那条基准线本身在九个月里移动了十三个百分点。这个移动幅度,很可能比你自己那个数字与基准之间的差距还大。结论的置信度就这么被吃光了。
由此可以立一条粗判据,本站的默认取法是:**如果一个基准在最近一年内的可观测移动幅度,超过了你打算用它做的那个判断的容差,这个数就不能单独用来下判断。**它只能用来校准量级——知道自己是在几十这个数量级还是在个位数这个数量级,而不是用来算「我离及格线还差几个点」。
三、分母里的水分会自己蒸发
这条趋势有一个说得通的解释:早期涌进来的实验性用户陆续离场,基本盘沉淀下来,分母里的水分被挤掉了(B1.4)。同一份报告确实记录了这个现象——实验性质的 AI 产品使用者最终会离开,关键特征是转向下一个热门产品;报告只做了现象描述,没有给这批人下正式定义(B1.3)。
这条线能撑多重的结论,取决于它背后有多少家公司。这份报告一共覆盖约 3500 家软件公司,但那是 B2B SaaS 约 2700 家、B2C SaaS 约 600 家、AI 原生约 200 家加起来的总数;27% 到 40% 这条线(2025 年 1 月至 9 月)量的只是其中 AI 原生那约 200 家(B1 节头的样本构成 + B1.4)。
本站的判断顺着这里往下推一步:如果一个只覆盖约 200 家 AI 原生公司的中位数,都能因为分母里的人换了一批而在九个月里移动十三个百分点,那么你自己那条只有几百人、甚至几十人的留存曲线,用户结构的变化幅度只会更剧烈。你上个月和这个月看到的同一个百分数,背后可能是完全不同的两拨人。这一步只是相关性上的类推,不是因果:报告记录的是「中位数在动」和「尝鲜者会走」这两件事同时存在,既没有证明前者由后者造成,也没有对个人开发者的产品做过任何推断。何况那约 200 家全部越过了 25 万美元年经常性收入这道门槛(B1.0),和你不是一批人。
操作上的推论是:别问「我的留存是多少」,问「三月进来的那批人和六月进来的那批人,同样看第四周,差多少」。一个总体数字完全可能在结构翻天覆地的情况下纹丝不动——因为新涌进来的人贡献的短期活跃,正好补上了老用户流失掉的量。分组横着看,这种对冲才会显形。
四、更隐蔽的一种过期:尺子换了
数值在动,是第一种过期方式。第二种更难察觉:字段名没变,量它的尺子换了。
a16z 的《The Top 100 Gen AI Consumer Apps》第 6 版,2026-03-09 发布,榜单数据截至 2026 年 1 月(B4)。这一版把收录范围放宽了——从这一版起,只要生成式 AI 已经成为体验的核心组成部分就可以进榜,不再只收 AI 原生产品,文中点名了 CapCut、Canva、Notion 这类产品。
口径一改,跨版本的比较就断了——这半句是本站的判断,B4 记录的只是「第 6 版放宽了收录范围」这个事实,报告本身没有讨论跨版本还能不能比。但既然第 5 版的名次和第 6 版的名次不是同一把尺子量出来的,把它们接成一条趋势线就失去了依据,虽然两版的表头看上去一模一样。
同一篇里还有一条更硬的自我批评。a16z 白纸黑字承认,它的排名越来越低估了人们用得最多的那些 AI 产品(原文「undercount the AI products people use most」,a16z 第 6 版)。文中举的例子是一个每天泡在 Claude Code 里八小时的开发者——这种重度使用者在网页流量数据里几乎体现不出来。它的测量方法是网页端按 SimilarWeb 的月度独立访问量、移动端按 Sensor Tower 的月活,均截至 2026 年 1 月。
一家把「排 AI 应用榜」做成招牌产品的机构,手里拿着这两家的数据,仍然在自己最新一版里写下这句话。一个独立开发者靠注册数、靠日活来判断自己有没有到 PMF,比这个还要不牢靠。
本站的判断:外部数字的两种过期方式要分开处理。数值在动,你还能靠「取更近的数」补救;尺子换了,你只能作废重来,因为旧数据在新口径下根本没有对应物。
五、这件事本来就写在 PMF 的定义里
a16z 2017 年 2 月那篇《12 Things About Product-Market Fit》,第 8 条列的迷思之一就是「PMF 是一个离散的、大爆炸式的事件」。文中转述 Ben Horowitz 的观点:PMF 是迭代的、连续的,停止适应就会丢掉(A5.4)。同一份清单的第 6 条还写着另一件事:创始人经常把早期的一点起色误当成真的 PMF(A5.1)。
这两条摆在一起,就把「拿一张快照当结论」的两个方向都说全了。一个方向是坏快照当判决——看到行业中位数很低,认定这个品类没戏,而那个中位数正在以每季度可感知的幅度往上走。另一个方向是好快照当通行证——某个月的数字漂亮,就当 PMF 已经拿到手,然后照着「到了 PMF 再放量」的剧本去砸钱,而那个漂亮数字很可能只是某一波新用户还没走完。
「PMF 会丢」不是本站为了讲 AI 才发明的概念,2017 年就已经被白纸黑字写出来了。AI 产品只是把这件事的时间尺度压短了。
六、给每个判断加上时点和重测日
这是本站的方法,不是任何一份报告里的结论。做法就五条:
- **每条结论旁边记三样:数值、口径、测量时点。**三样缺一样,这条结论就不许进决策。「留存不行」这四个字单独存在时是没有信息量的。
- **外部数字写一个失效日期。**本站给的默认值是两个季度——超过两个季度的 AI 相关外部基准,只保留量级参考价值,不再用来算差距、算比例。这个默认值的依据就是 B1.4 那九个月十三个点。
- **自己的数字按进入月份分组横着看。**看的是不同批次在同一个时间点上的差,不是总体单点。
- **换过口径就断线。**改了统计范围、改了「算不算活跃」的定义、改了取数工具,之前的曲线全部作废重来,不许把两把尺子的数接成一条线。a16z 那次版本换口径就是活例子。
- **每次重测先复述上次的口径,再取数。**顺序反过来的话,人会不自觉地把口径往有利的方向挪。
配套三个可以照抄的问句,用在任何一个别人递给你的数字上:
- 这个数是什么时候测的?
- 从那时到现在,同类样本里这个指标动了多少?
- 如果它按同样的速度再动一个季度,我现在要做的这个决定会不会反过来?
第三问是判据。答案如果是「会反过来」,那这个决定要么现在不该做,要么不该建立在这个数上。
七、今天能做的那一件事
判断 PMF 的最小可用产物不是一个数字,是一张带日期的记录表:三列,分别是判断内容、依据的数值与它的测量时点、重测日期。
这张表第一次记的时候看不出任何东西,第三次之后才开始有用——因为到那时你手上才有了方向,而不只有点。所以起点越早越有价值。
现在就能做的动作只有一个:把你此刻正在依据的那个数字写下来,旁边补上它是哪一天测的、按什么口径测的,再给它定一个重测日期。
延伸阅读
本篇提到的站内课程,可以直接接着往下读:
名词不熟可以先看术语页:PMF(产品市场契合)