企业 AI 转型该怎么设 KPI / OKR
给 AI 转型设 KPI/OKR,核心是把指标锚定在”业务结果”上——时长省了多少、产出多了多少、错误率降了多少,而不是”用了几次 AI”。 这篇讲清一个反复被踩的坑:大多数企业的 AI 转型考核,最后都变成了一堆好看但没用的虚荣指标。本文给你一套从业务结果倒推指标、按阶段分层、可直接套用的方法。
如果你已经在用 token 做考核口径,可以先看 用 Token 当 KPI 靠谱吗(规划中) 那篇里关于”消耗量不等于产出”的讨论,这篇是它的方法论版。
为什么 AI 转型的 KPI 最容易设歪
传统 KPI 考核的是”做了什么动作”,而 AI 转型真正要的是”动作变快变好了没”。一旦你把”激活率""使用次数""提示词条数”当成目标,团队就会为了刷指标而用 AI,为用而用,产出反而没变。
更隐蔽的问题是:AI 带来的提效往往不在”新增产出”,而在”省下的时间”和”少返工”。这两块如果不专门设指标去捞,就会被忽略,最后老板觉得”花了钱没看到效果”,团队觉得”明明轻松了不少却不算数”。
所以 AI 转型 KPI 的第一原则就一句话:先想清楚这件事最终要改变哪个业务数字,再倒推指标。
锚定业务结果:三类该死盯的指标
不管什么岗位用 AI,提效最终都体现在三个方向上。设指标时优先从这三类里挑,而不是从”使用行为”里挑。
- 时长(效率):完成同一类任务的耗时。例如一份合同初审从 4 小时降到 1 小时、一篇推文从 2 小时降到 40 分钟、一次客诉首响从 30 分钟降到 5 分钟。
- 产出(产能):单位时间或单人能交付的量。例如客服日均处理工单数、运营周产出文案数、研发每迭代合入的需求数。
- 错误率 / 返工率(质量):交付物被打回、出错、需要返工的比例。这条最容易被忽略,但 AI 用得好坏的分水岭往往就在这——有人用 AI 把活干快了但错更多,那是负提效。
这三类指标的共同点是:它们本来就是业务在跑的数,AI 只是去推动它们变好。你考核的是业务结果,AI 是手段,不是目的。
三类指标之间还有一层容易被忽略的关系:时长和产出经常此消彼长,唯一能防止两者互相牺牲的,是把错误率/返工率定成”底线指标”而不是”参考指标”。具体做法是给每个场景设两条线:一条是”目标值”(比如时长降到多少),一条是”红线值”(比如返工率不能超过多少),两条线同时写进考核表。只考核时长不设红线,团队大概率会为了冲数字牺牲质量;只考核质量不设时长目标,团队又容易躺平不推进。这也是为什么前面客服 OKR 的 KR3 要专门加一句”客诉满意度不下降”——它就是那条红线。
再补一句实操细节:这三类指标该由谁来提供数据,最好在设指标前就定好,不然考核期到了才发现数据根本捞不出来。时长类优先接系统日志(工单系统的处理时长、代码仓库的合入周期),别靠人工填报,人工填报的数字水分最大;产出类看业务系统本身的统计报表;错误率/返工率则看退回记录、客诉记录、代码 review 打回次数这些”本来就存在”的数据源,只是以前没人把它和 AI 使用挂钩去看。
分阶段设指标:不同时期看不同的数
AI 转型不是一步到位,硬用”业务结果”考核早期团队,会因为还没跑通而打击士气。务实的做法是分三阶段,指标重心随阶段往后移。
| 阶段 | 目标 | 该看的指标 | 不该考核的 |
|---|---|---|---|
| 第一阶段:渗透 | 让人开始用、敢用 | 覆盖率(多少人真正用起来)、典型场景跑通数 | 别急着压效率数字 |
| 第二阶段:提效 | 把活干得更快更好 | 任务时长、返工率、人均产出 | 别再看”使用次数”这种过程量 |
| 第三阶段:重构 | 流程/组织随 AI 重设计 | 整条业务线的人效、单位成本、交付周期 | 别只盯单点工具指标 |
早期看”用没用起来”,中期看”提没提效”,后期看”业务结构变没变”。 把这三阶段的指标混在一起一刀切,是很多转型半途而废的原因。落到具体岗位时,可以参考 各部门 AI 提效清单(规划中) 把这套阶段指标拆到每个团队。
哪些是虚荣指标,要果断砍掉
下面这些指标看着热闹,但和业务结果几乎不挂钩,别拿它们当 KPI/OKR:
- 使用次数 / 调用量 / token 消耗量:用得多不等于用得好,刷得出来。
- 提示词数量 / 收藏的 prompt 数:动作量,不是产出量。
- AI 工具账号开通率:开了不用等于零。
- “AI 参与的项目数”:沾边就算,无法证明价值。
- 培训覆盖人数:学了不代表用了,更不代表有效果。
判断口诀很简单:一个指标如果可以”为了好看而刻意去刷、刷完业务却没变好”,它就是虚荣指标。 这些数可以放在过程看板里观察,但不进考核。
OKR 怎么写:目标定方向,KR 锚结果
KPI 适合稳定可量化的岗位,OKR 适合还在探索”AI 能用在哪”的团队。AI 转型早期推荐用 OKR,因为它允许”目标有野心、路径可调整”。
一个可直接套用的 OKR 示例(客服团队,提效阶段):
- O(目标):让 AI 把客服团队从”忙于重复应答”中解放出来。
- KR1:工单平均处理时长从 12 分钟降到 6 分钟。
- KR2:首次回复解决率从 60% 提到 75%。
- KR3:人均日处理工单数从 40 提到 60,且客诉满意度不下降。
注意每条 KR 都是业务结果 + 带数字 + 有质量底线(“满意度不下降”防止为了快而牺牲质量)。这就是好的 AI 转型 KR 的样子。
再看一个探索阶段的例子(内容运营团队,渗透→提效过渡期),因为这类团队的产出很难标准化,最容易把 OKR 写成一堆虚荣指标:
- O(目标):用 AI 把选题到成稿的周期砍掉一半,同时不降低发布内容的平均阅读完成率。
- KR1:单篇稿件从”选题确定”到”可发布终稿”的平均周期从 3 天降到 1.5 天。
- KR2:月度人均产出稿件数从 8 篇提到 14 篇。
- KR3:抽样稿件的平均阅读完成率维持在 55% 以上(不低于 AI 介入前 3 个月的均值)。
这组 KR 里,KR1 和 KR2 看的是效率和产能,KR3 是质量红线,三条缺一不可。很多团队只写前两条,结果半年后发现稿子确实产出多了,但阅读数据在悄悄往下掉,这就是典型的”效率提上去了,质量在还债”,而这笔账没人算,是因为 OKR 里压根没设这条线。
落地三步走
- 选场景:挑 1-2 个高频、可量化的业务场景先试,别一上来全公司铺。
- 测基线:在用 AI 之前,先把当前的时长/产出/错误率量出来——没有基线就证明不了提效。
- 设阶段指标:按渗透→提效→重构三阶段,给每个场景配 2-3 个锚定业务结果的指标,季度复盘一次再调。
这套流程的关键是第二步。绝大多数”看不到 AI 效果”的企业,都是因为根本没测过基线,提效了也无从证明。
常见问题
问:AI 转型一定要单独设 KPI 吗,融进原有考核不行吗? 答:能融进原有业务指标是最理想的——直接看那个岗位本来就在考核的时长、产出、质量有没有变好。单独设”AI 指标”反而容易跑偏成虚荣指标。只有在早期渗透阶段,可以临时加一个”覆盖率”过渡指标。
问:用 token 消耗量 / 使用次数当 KPI 到底行不行? 答:不行,这是典型虚荣指标,能刷且不代表产出。它只能当成本监控和活跃度观察项,不能进考核。详见 用 Token 当 KPI 靠谱吗(规划中)。
问:提效了,但很难量化怎么办? 答:先量化”时长”——几乎所有任务都能记录耗时,这是最容易拿到的业务结果指标。实在难量化的创意/质量类,用”返工率”或”被采纳率”代替,也比用使用次数强。
问:KPI 还是 OKR,怎么选? 答:业务稳定、产出可标准化的岗位(客服、运营、财务初审)用 KPI;还在探索 AI 用法、产出难标准化的团队(研发、设计、战略)用 OKR。转型早期整体偏向 OKR,跑稳了再把成熟场景固化成 KPI。
👉 看看 AI 时代的组织与管理 专栏,或了解 AI 时代管理者认知课。需要定制落地与陪跑,欢迎聊 企业服务。