如何核查 AI 给出的答案对不对
核查 AI 答案,就是用”它说的”去对照”可信源说的”,把流畅但可能编造的内容,逐条还原成有出处、可验证的事实。 AI 的回答天然带一层”自信滤镜”——语气笃定、措辞专业,但底层是概率生成,它会把不知道的东西”补”得跟真的一样。这就是大模型幻觉。这篇讲的不是”别信 AI”,而是给你一套能落地的核查动作,让团队既敢用、又不踩坑。
为什么必须核查:流畅 ≠ 正确
大模型的本质是预测”下一个最可能的词”,不是查数据库。所以它有两个要命的特点:
- 它不会说”我不知道”:遇到知识盲区,它倾向于编一个听起来合理的答案,而不是承认空白。
- 错误藏在细节里:整体框架往往对,但具体数字、人名、条款、引用文献、API 参数最容易出错——而这些恰恰是你最会直接照搬的部分。
想深入理解这个机制,可以先看 大模型为什么会”一本正经地胡说八道”(规划中)。核心结论是:幻觉无法靠”提醒它别瞎说”根除,只能靠核查流程兜底。
拆开看,幻觉主要来自三个技术层面的原因,理解这三点,才知道该在哪个环节重点设防:
- 训练数据有截止日期:模型知识停留在训练那一刻,你问”最新版本号”或”本月政策”,它容易把旧信息当新的答给你——这是版本号、法规条款类幻觉的主要来源。
- 它是”续写”而非”查表”:遇到门店地址、订单号、API 参数这类需要精确检索的信息,模型其实是在续写一个像真的一样的答案,并非从数据库取出——这是具体数字、专有名词类幻觉的主要来源。
- 它会顺着提问方向”讨好”:如果问题里带了错误假设(比如”某法规第38条怎么规定的”,但根本没有第38条),模型大概率会顺着编一个出来——所以提问时尽量别自己先预设答案。
五个核查动作:从轻到重
不是每个答案都要全套核查。按”出错代价”分级用力即可。
动作一:要来源
最简单也最有效的一招——逼它给出处。在提问后追加一句:
“以上每个关键结论,请标注信息来源(网址/文献/官方文档),无法确认来源的请明确说’此处不确定’。”
会出现三种情况:它给出真实可查的链接(好)、给出看似真实但点开是 404 或张冠李戴的链接(危险,幻觉重灾区)、或老实承认不确定(也好)。链接必须自己点开验证,不能因为”它给了链接”就放心。
动作二:交叉验证
同一个问题,换个问法再问一遍,或换一个模型问。 如果两次答案在关键事实上自相矛盾,说明这块它没把握。重要结论建议:
- 用不同措辞重问一次,看核心数字/结论是否稳定;
- 换另一家模型对照(避免单一模型的系统性偏见);
- 最后用搜索引擎或官方渠道做最终裁定——AI 之间互相印证不等于对,它们可能错得一样。
动作三:关键数字必查
凡是数字,默认不信。 价格、比例、年份、版本号、法规条款编号、剂量、财务数据……这些是幻觉命中率最高的地方,也是错了代价最大的地方。原则很简单:
| 内容类型 | 处理方式 |
|---|---|
| 具体数字/价格/参数 | 一律回到官方文档/原始数据源核对 |
| 法规/合同条款 | 找法条原文或专业人士确认 |
| 引用的研究/文献 | 验证文献真实存在且结论一致 |
| 操作步骤/命令 | 在测试环境先跑一遍 |
| 依赖库/框架版本号 | 直接查官方发布页或包管理器(如 pip index versions xxx、npm view xxx versions) |
举个技术团队天天会踩的坑:让 AI 帮你写一段依赖安装命令,它给出 pip install requests==2.31.5,你直接跑,结果报错——查了才发现 requests 根本没有 2.31.5 这个版本,它是把 2.31.0 和另一个库的版本号”融合”编出来的。这类错误的核查动作很简单:装之前先去 PyPI/npm 官网搜一眼版本列表,一分钟的事,能省掉排查半小时报错的时间。
动作四:让它自评
给 AI 一个”反省”的机会,常能逼出它自己的不确定。试试:
“请对上面的回答逐条标注置信度(高/中/低),并指出哪些是事实、哪些是你的推测。”
低置信度的部分,就是你该重点核查的清单。这招对长答案特别有用——能帮你快速定位”水分”在哪。
动作五:用常识和领域知识兜底
最后一道关是你自己的判断。答案是否符合基本逻辑?和你已知的事实有没有冲突?有没有明显违反常识的地方?AI 给的答案如果让你”隐隐觉得不对劲”,那种直觉值得认真对待——往往就是它在编。
一个真实场景:核查一份 AI 起草的合作报价单
光讲原则容易飘,拿一个真实场景走一遍完整流程,更有感觉。
假设你让 AI 起草一份”AI 培训服务”报价单,它写着:“参考行业均价,企业内训类课程市场报价通常在每人每天 800-1200 元区间”。要不要直接抄进正式报价单?按五个动作走一遍:
- 要来源:追问区间的信息来源,大概率它含糊其辞——这是根据常见语料”总结”出的区间,并非某份真实报告的数字。
- 交叉验证:换个问法或换一个模型再问一次。如果两次区间差异很大(比如 800-1200 变成 500-3000),说明这个数字没有可靠依据,只是”猜均价”。
- 关键数字必查:报价类数字错了直接影响合同和客户信任,必须回到真实数据源——你自己过往的成交记录、行业协会公开的定价参考、同行公开报价页面。
- 让它自评:让它标注这是事实还是推测,它通常会承认是”基于常见情况的估算”——这就是提醒你必须替换成核实过的数字。
- 用常识兜底:如果区间和你所在城市、细分领域的实际行情明显不符,你的经验判断应该压过 AI 的”通用答案”。
走完这五步,报价单里的价格应该是你核实过的数字,而不是 AI 随口给的区间——AI 帮你把框架写得漂亮,但价格必须你自己拍板。
哪些场景必须人工把关
不是所有任务都需要逐字核查,但下面这些场景绝不能让 AI 答案直接落地:
- 对外发布的内容:合同、报价、公告、客户答复——一旦出错就是公司信誉和法律责任。
- 涉及钱、法律、医疗、安全的决策:错误代价不可逆。
- 要写进代码或系统的配置/参数:尤其涉及权限、数据处理的部分,还要警惕 把敏感数据喂给 AI 的安全风险(规划中)。
- 专业领域的事实陈述:你不是专家、又无法快速验证的领域,必须找人复核。
判断口诀:错了能马上发现、代价又小的,可以放手用;错了不易察觉、或代价大的,必须人工把关。
把核查变成团队制度
个人靠自觉容易漏,团队要靠流程。给管理者几条可落地的建议:
- 明确”AI 产出物”的署名责任:谁用 AI 出的内容,谁对正确性负责,不能甩锅给”AI 说的”。
- 建立分级核查清单:按对外/对内、涉钱/不涉钱分级,规定哪类必须双人复核。
- 要求保留来源:重要结论附上核查过的出处,既防错也便于追溯。
- 培训”提问与核查”能力:这比单纯学工具更重要,关系到整个团队用 AI 的可靠性。
常见问题
问:AI 给的链接,是不是就说明答案有依据? 答:不一定。模型会编造看起来真实的链接,有的点开是 404,有的内容和它说的完全不符。链接必须自己点开看过、对得上,才算数。
问:让两个不同的 AI 互相验证,可靠吗? 答:能提高可靠性,但不能当终点。不同模型可能犯同样的错(比如都基于同一份有误的训练资料)。关键事实最终要落到官方源或权威渠道,AI 互证只是中间筛子。
问:每次用 AI 都要这么核查,效率岂不是很低? 答:按代价分级就好。头脑风暴、草稿、改写润色这类容错高的,扫一眼即可;对外、涉钱、涉法的,才上全套核查。把力气花在刀刃上,整体效率反而更高。
问:怎么让 AI 少出现幻觉? 答:给它充分的上下文和资料(让它”开卷答题”而非凭记忆)、把问题拆小拆具体、明确要求”不确定就说不确定”。但要清楚:这些只能减少、无法根除,核查流程不可省。
问:提问的时候要注意什么,能从源头减少幻觉吗? 答:能,关键是别在问题里预设一个不存在的答案。比如直接问”某某法规第几条怎么规定的”就比问”某某法规第38条怎么规定的”更安全——后者如果根本没有第38条,模型大概率会顺着你的假设编一个出来,而不是先反问你”确认一下条款编号”。把开放式问题拆成”先确认事实、再展开细节”两步问,能明显减少这类顺拐式幻觉。
👉 看看 AI 时代的组织与管理 专栏,或了解 AI 时代管理者认知课。需要定制落地与陪跑,欢迎聊 企业服务。