连 AI 应用榜单自己都承认量不准
a16z 有一份做成招牌的产品:《The Top 100 Gen AI Consumer Apps》。第 6 版由 Olivia Moore 撰写,2026 年 3 月 9 日发布,榜单数据截至 2026 年 1 月。排法是网页端按 SimilarWeb 的月度独立访问量、移动端按 Sensor Tower 的月活(B4)。
就在这一版里,作者写了一句在这类报告里很少见的话:这份排名越来越低估了人们用得最多的那些 AI 产品。英文原句是 “undercount the AI products people use most”(B4)。她举的例子是一个每天在 Claude Code 里泡八个小时的开发者——按谁的标准这都是重度 AI 用户,但在网页流量数据里几乎体现不出来。
这句话的分量不在于它说了什么新鲜事,而在于说它的人手里握着的正是 SimilarWeb 和 Sensor Tower 这两个商业数据源,榜单做到了第六版,然后自己在最新一版里写下「我量不准」。
一、量不准的不是数据源,是这把尺子
月度独立访问量和月活,本质上都是「有多少人来过」的口径。一个人打开看一眼就走,和一个人打开之后连续工作八小时,在这两把尺子上是同一个 1。
在多数消费级应用上,这个误差不致命,因为来的次数和用的深度大体同向——用得多的人自然打开得也多。本站的判断是:AI 产品上这层同向关系不可靠,而 B4 那个八小时的例子正是它断掉的样子。一个把工具嵌进日常工作里的人,可能一天只「来」一次,然后不走了;一个纯粹看热闹的人,反倒可能因为反复尝试而贡献更多次访问。
尺子没坏,是它量的那个东西(来访次数)和你真正想知道的那个东西(有多少人把它用起来了)在这个品类上脱钩了。
这对判断 PMF 的直接后果是:你在自己后台看到的注册数、日活、访问量,和 a16z 拿着 SimilarWeb 数据看到的是同一类量。它在行业尺度上会失准,在你几百个用户的尺度上不会因为盘子小就自动准起来。
二、榜单自己也在改「谁算 AI 产品」
同一版还有一个动作:从第 6 版起,收录范围放宽到「任何生成式 AI 已成为体验核心组成部分的消费级产品」,不再只收 AI 原生产品,文中点名了 CapCut、Canva、Notion(B4)。
本站的判断是:一个品类如果连「谁该算进榜单」都要每版重划一次边界,说明这个品类的定义本身还在移动。对着一个边界在移动的排名去找自己的位置,参照系是晃的——今年你和某一批产品被归在一起比,明年那批产品可能换了一批。
顺带一条限制条件:排名靠前也不等于赚钱。有分析指出,在更早的一版榜单上,移动端月活前 50 与月收入前 50 之间只有 40% 重叠(B4)。这条属二手转述,而且出自第 4 版而不是最新这版,榜单每版都会变,不能挂在第 6 版名下当结论用。它能说明的只有一件事:流量排名和收入排名是两张表。
三、换一份外部参照,坑还在
想绕开榜单、去找一份留存基准,会撞到另一个形状的问题。
ChartMogul 那份 AI 留存报告有一条硬门槛:只统计已经做到 25 万美元年经常性收入的公司(B1.0)。如果你正在判断自己有没有到 PMF,大概率离这个门槛还远。那组数描述的是已经活下来的公司之间的差异,不是刚起步产品的命运。
而且它在动。同一份报告里,AI 原生的中位总收入留存从 2025 年 1 月的 27% 涨到了 2025 年 9 月的 40%(B1.4),九个月。这个数还在快速变化,明年再看多半又是另一个值。(这里的 40% 是留存率,和上一节那个 40% 重叠比例毫无关系,只是数值撞了。)
两份材料,两种失准方式:一份自己承认量的维度不对,一份的样本里根本没有你。共同的结论是本站的判断——在 AI 产品这件事上,外部数字能校准你对量级的预期,不能替你做判断。
四、把观测量换掉,而不是把指标换个名字
真正要改的不是你盯哪个指标,是你数的是哪一类事件。三步,今天就能开始。
第一步,写死一条重度线。 照这个句式填空,填完抄进你记数据的那个文件的第一行:
一个真的把这个产品用起来的人,一周会用 ___ 次,每次会 ___。
两个空都必须填成后台数得出来的东西。第一个空填数字。第二个空填一个可观测的完成动作——导出了一份结果、跑完了一整轮、把产出拿去交给了别人。填「觉得有用」「体验良好」这类不算,那不是事件。填不出来,说明你还不知道自己的产品被用起来是什么样子,这件事比留存率更该先解决。
第二步,按这条线把用户切成三堆,分开算留存。 够线的、用过但不够线的、只来过一次的。这三堆的曲线通常不是同一条曲线的三段,而是三条形状不同的曲线,混在一起算等于把它们互相抵消掉。
第三步,只把第一堆的绝对人数当推进信号,不看比例。 比例会自己变好看:某个月少来了一批看热闹的人,够线比例立刻上升,而实际在用的人一个都没多。绝对人数骗不了自己。
配套的三条阈值(本站的判断,依据是 B4 的口径盲区与 B1.3 里「实验性质的使用者最终会转向下一个热门产品」这个现象):
- 连续三个月,够线那堆的绝对人数没有增长 → 无论总访问量涨了多少,一律按「没有推进」处理。
- 够线那堆在涨,但「只来过一次」那堆涨得更快 → 你目前吃的主要是一波关注,而不是产品本身在往前走。B1.3 描述的那批人正是从这一堆里出来的。
- 够线那堆在涨,且新增的人里有一部分不是这个月推广带来的 → 这是整套口径里唯一强的正信号,也是最值得往下追问「他们从哪来、为什么留」的一堆人。
五、这条线最容易在三个地方被自己糊弄过去
事后调线。 数据出来不好看,回头把「一周三次」改成「一周一次」,够线人数立刻翻上去。要改可以,但必须记下改线的日期,并且把改线之前的曲线作废重算,不能接在后面当同一条。
拿时长冒充深度。 本站的判断是,停留时长在这个品类上不适合当深度指标——B4 那个八小时的例子反过来同样成立:时长长不一定是在深度使用,可能是等待,是重试,是来回改提示词改到烦。用完成动作,不用时长。
把它简称成「活跃用户」。 你定的是一条具体的、有次数有动作的线,不是一个叫「活跃」的抽象概念。一旦在周会上被简称掉,两个月后没人说得清它原来的定义是什么,更没人发现它已经被悄悄放宽过一次。
六、和站内那两类课程的分工
站内 L9 阶梯有一篇专讲留存的课:漏桶模型、首次价值时间、次留七留怎么读、前七天激活怎么诊断。那篇讲的是留存为什么优先于获客、以及怎么把它提上去,并且明确拒绝给行业基准值。这篇不重复那套做法,只补一个 AI 特有的理由:在这个品类上,连拿着商业数据源做了六版榜单的机构都写明自己量不准(B4)。本站由此主张,你手里唯一站得住的参照系是自己的上一版数据——不是退而求其次,是眼下确实没有别的东西可比。
L9 另有两篇讲虚荣指标与可行动指标的分辨,那说的是「别拿下载量当成绩」这层通用道理。这篇要说的不是那个。访问量在这里并不虚荣——它是被整个行业当作标准口径在用的量,是各家榜单和报告的共同底座。问题不在于有人拿它自我安慰,而在于它对这个品类系统性偏低。量的东西没错,是这把尺子读不出重度使用。
七、先做哪一件
上面三步里,第二步和第三步都要等数据攒够才有意义,第一步不用等:把那个填空句填完,写在你记数据的文件最上面,标上今天的日期。
填的过程里如果卡了很久,那个卡住本身就是这篇文章能给你的最有用的结果——它说明「用起来了」在你的产品上还没有一个说得出口的定义。在这个定义出现之前,任何留存数字都只是在数人头。
延伸阅读
本篇提到的站内课程,可以直接接着往下读:
名词不熟可以先看术语页:PMF(产品市场契合)