PMF 问卷里比主问题更有用的三道配套题
跑完一轮 PMF 问卷,大多数人把那一列选择题拉出来算了个百分比,剩下三道自由填写的题存进表格,之后就没人再打开过。
本站的判断是:按 A4.4 那份题目单的结构看,被丢掉的那三道题,能支撑的动作比被算成百分比的那一道多得多。
一、那三道题原样长这样
Superhuman 在 First Round Review 上那篇 2018 年的复盘里,除了那道被反复引用的主问题之外,同一份问卷还固定问三件事(A4.4):
- 你觉得哪类人会最受益于这个产品?
- 你从这个产品里拿到的主要收益是什么?
- 我们要怎么做才能为你把它改得更好?
主问题产出一个数,这三道题产出的是文本。数可以排序、可以画成趋势图、可以直接贴进周报,所以它天然占据注意力;文本要一条条读,读完还不一定能立刻得出结论,所以它天然被推迟到「有空再说」。这个注意力分配,跟两边的实际信息量是反着的。
二、那个百分比撑不住一次决定
提出 40% 这条线的人自己,在 2024 年 12 月 19 日发过一篇讨论「PMF 分数很高但留存很低」的文章,里面记的是一个创始人的情况:问卷里 55% 的人回答没有这个产品会非常失望,高于他自己推荐的那条 40% 线,公司却仍然面临低留存(A3.3)。他给出的解释在付费墙之后,本站没有取到,所以这一节往下的读法都是本站的推演,不是他的结论。
顺带说清出处:40% 这个说法最常被引用的转述,来自 2018 年那篇 Superhuman 复盘,那是一个横向比较一批公司之后定下的经验值(A3.2),不是一条被反复验证过的统计标准。
同一时期还有一个更直接的旁证。a16z 在 2026 年 3 月 9 日发布的第 6 版消费级 AI 应用榜里(数据截至 2026 年 1 月),自己承认这份排名「越来越低估了人们用得最多的那些 AI 产品」(原文 undercount the AI products people use most,B4)。他们举的例子是一个每天泡在 Claude Code 里八小时的开发者——这种重度使用者在网页流量数据里几乎体现不出来。这些数字会随口径和时点变化。
一家把排 AI 应用榜做成招牌的机构,拿着两家数据商的口径都量不准这个品类。本站由此得出的判断是:在 AI 类产品上,凡是被压缩成单一数值的度量,都要预设它有系统性偏差;而三道配套题产出的原始文本没有被压缩过,它的失真方式是「你读漏了」,不是「口径本身错了」。前一种错误你自己能修,后一种不能。
三、第一题:要抽的是原话,不是意思
第一题问的是「你觉得哪类人会最受益于这个产品」。它在整套流程里的位置很明确:从回答「非常失望」的人里提取高期待用户,依据就是他们对这道题的回答,并且要用他们自己的措辞和关键词去构建画像,不是用你的行业黑话(A4.3)。
「用他们自己的措辞」这句常被当成一句风格建议,其实是一条操作纪律。本站的判断是,翻译动作会同时干掉两样东西:
- 可筛选性。 用户写的是一个具体处境,你把它归纳成一个品类名词之后,这个处境就没法拿去投放定向、没法拿去写落地页首屏、也没法拿去判断一个新来的注册用户算不算你的人。
- 共鸣度。 用户读到自己说过的话会认领,读到你概括出来的标签只会觉得像在说别人。
具体到操作上,本站建议按这三步读第一题(这是本站的推演,A4.3 只给了原则):
- 只读「非常失望」那一组的回答,其余两组这一题先不看。
- 逐条摘出名词短语和动词短语,原样抄,不合并同义词。
- 数重复。重复出现次数最多的那几条原话,直接进画像文案,不做润色。
还有一类回答本身就是信号:「所有人都能用」「像我这样的人」「不知道」。这类答案说明该用户没有形成关于「这东西是给谁的」的清晰认知。本站的判断是,如果「非常失望」那一组里这类空泛回答占了多数,那么高的分数也不构成一个可以放大的基础——你手上没有画像,就没有可复制的下一批人。
四、第二题:拿它去比对你自己写的那句话
第二题问的是主要收益。它最直接的用法不是拿来做归纳,是拿来做一次比对。
去把你官网首屏那句价值主张、应用商店描述的第一行、或者你逢人介绍产品时的那句开场白抄下来,然后一条条数:第二题的回答里,有多少条讲的是同一件事。
这件事对应的是价值假设——说清楚客户为什么会用你的产品,要造什么、谁需要、怎么交付(A5.3)。第二题的回答就是这条假设的验收材料。命中率低的时候,本站的判断是先别急着改产品:你在推的那个点和用户实际拿到的东西对不上,这是一个不用写代码就能改的错,而改产品是要写代码的。把顺序弄反,成本差着量级。
读这一题的时候还可以顺手做一次分类。用户描述的收益基本落在三类里(这是本站的分法):
- 省了什么——原来要花的时间、要付的钱、要过的手工步骤。
- 避免了什么——原来会出的错、会漏的事、会被追问的责任。
- 拿到了以前拿不到的东西——原来根本做不了、只能放弃的那件事。
前两类的替代品很多,用户随时可能换到另一个能省同样时间的工具上。第三类最难被替代。如果你的第二题回答几乎全落在第一类,那么分数即使不低,它描述的也是一种随时可以被更便宜的东西顶掉的关系。
五、第三题:分组之前不要读
第三题问的是「我们要怎么做才能为你把它改得更好」。这道题最容易被读成一张需求清单,然后按呼声高低排进下一轮。
那套流程本身给的读法不是这样。它的第二步明确要看「有点失望」那一组里哪些人有希望转化(A4.2)。本站的判断是,这道题的分辨力几乎全在这一组身上:
- 「非常失望」的人已经离不开你了,他们提的多半是锦上添花——某个快捷方式、某个配色、某个导出格式。做完了他们更满意,但他们本来就不会走。
- 「有点失望」的人提的才是阻碍本身。他们已经在用,只是还没到离不开的程度,中间卡着一样东西。那样东西是什么,这道题会告诉你。
把「有点失望」组的阻碍抄出来之后,本站建议再分一层:
- 缺功能——某个动作现在做不了。这类要写代码。
- 不信任——功能有,但他不敢把要紧的事交给你,怕出错、怕数据、怕你哪天关站。这类要的是可见的凭据和退路,不是新功能。
- 用不明白——功能有,他没找到或者没理解。这类要的是引导和文案。
后两类的成本远低于第一类。而路线图的配比是有说法的:一半资源强化用户已经喜欢的地方,一半资源处理阻碍,并且优先做低成本高影响的(A4.2)。第二类和第三类恰好落在「低成本」那一侧。
站内 L9 阶梯有一篇专讲迭代优先级怎么排的课程,给了影响、频率、成本三者的权衡办法。那篇讲的是已经确定要做的一堆事怎么排先后,这篇讲的是这堆事从哪来、哪些根本不该进队列。两件事不重复,顺序上是这篇在前。
六、把三道题合成一次动作
上面三节各自成立,但真正省时间的是把它们串成一遍固定动作。本站给的六步(依据是 A4.2 的四步流程,具体拆法是本站的推演):
- 按主问题的三个选项把自由文本分成三组,「不失望」那组这一轮先放下。
- 第一题只读「非常失望」组,抽原话,得到一段画像文案。
- 第二题读「非常失望」组,与你现在对外说的那句价值主张逐条比对,得到一个命中率和一份用户版的说法。
- 第三题只读「有点失望」组,抽阻碍,按缺功能/不信任/用不明白分三堆。
- 下一轮资源按一半一半分配:一半用来强化第二题里被反复提到的那个收益,一半用来清第四步里成本最低的那堆阻碍(A4.2)。
- 做完一轮之后对新用户重新发同一份问卷(A4.2 的循环测量那一步)。这一次要比的不是绝对值,是画像有没有变清楚、第二题的命中率有没有上去、第三题的阻碍堆有没有换内容。
第六步是这套东西唯一能自我校正的地方。单次的三份文本是一张快照,连着两轮才看得出你上一轮的动作有没有起作用。
七、什么时候这三份回答不能用
有三种情况下,上面这套读法会给出误导性的结论。
第一,分母里混着没用过核心功能的人。 主问题问的是「拿走会不会失望」,这个问句对手里根本没有东西可以被拿走的人不成立,三道配套题同理——没体验过的人写不出具体处境,只会写出泛泛的一句。群发给全部注册用户的问卷,最先污染的就是第一题。
第二,回答数太少。 有说法认为有效回答最少要三十份左右,到一百份以上信心才明显更高(A3.2,二手转述)。本站的判断是,这个门槛对文本题比对选择题更宽松一些——第一题只要有五六条措辞高度一致的原话,画像就已经能用了;但第三题要分成三堆之后每堆还剩东西,需要的量确实更大。
第三,答卷人里有相当比例是尝鲜者。 报告里记录过一个现象:实验性质的 AI 产品使用者最终会离开,特征是转向下一个热门产品(B1.3)。本站的判断是,这批人对第一题给出的回答会格外泛化——他们没有形成使用场景,也就说不出谁最受益。这不是他们不配合,是他们和产品的关系还没成形。识别办法是把第一题的空泛回答和使用时长对照着看。
站内 L5 阶梯有一篇专讲用户访谈提纲的课程,给了三条铁律、十道题和三类禁问,那篇讲的是当面聊的时候该问什么、怎么避免诱导;另有一篇讲问卷调研为什么常常不可信,讲的是嘴上说会用和实际掏钱之间的落差。这篇既不设计新问题,也不讨论问卷这种形式可不可信,只处理一件事:那份已经跑完的 PMF 问卷里,主问题之外的三道题该怎么读成动作。
八、今天能做的那件事
打开你已经跑过的那份问卷的导出表,把分数那一列先隐藏掉,按第六节的六步过一遍,产出三样东西:
- 一段全部由用户原话组成的画像文案;
- 一句用户版的价值陈述,以及它和你现在对外那句话的差距;
- 一张只来自「有点失望」组、并且已经分成三堆的阻碍清单。
这三样东西决定下一轮做什么,那个百分比不决定。它只决定你这周汇报时心情如何。
延伸阅读
本篇提到的站内课程,可以直接接着往下读:
名词不熟可以先看术语页:PMF(产品市场契合)