分享区

AI答案看起来很合理,也要核实:普通人的七步查证法

导言

生成式人工智能可以协助整理资料、解释概念、起草电邮、比较方案和提供学习方向。它的文字通常流畅、结构完整,有时还会附上日期、数据、研究名称或网址。因此,人们很容易把“读起来像真的”当成“已经证实”。然而,语言模型的主要任务是根据上下文生成合适的文字,不是自动替每一句话完成事实审计。它可能提供正确答案,也可能混合过期资料、错误细节、误解的问题,甚至生成不存在的引文或来源。

这并不表示人工智能没有用,而是我们需要用正确方式使用它。就像计算器不能替代判断输入是否正确,AI也不应成为重要事实的唯一来源。本文提供一套适合一般公众的七步查证法,帮助读者在学习、工作和日常生活中更安全地使用AI内容。

为什么这个主题重要

错误资讯的风险取决于用途。一份私人读书笔记出现小错误,影响可能有限;但如果错误内容被用于健康决定、财务安排、合约、客户沟通、考试、公司政策或公开文章,后果就可能扩大。复制和转发又非常容易,一项未经核实的说法可以迅速进入简报、社交媒体、群组消息和组织文件,最后让人误以为它已被多方确认。

OpenAI 的公开说明提醒,聊天模型可能产生不准确的定义、日期、事实、引文与参考资料,而且表达得很有信心。OpenAI 关于语言模型“幻觉”的研究进一步指出,模型在不确定时猜测,可能得到表面上完整、实际却错误的答案;承认“不知道”有时反而更可靠。

Anthropic 的研究同样把正确答案、错误答案和承认不确定区分开来,并讨论了模型为何有时拒绝猜测。Google DeepMind 的 FACTS Grounding 与 SimpleQA Verified 等评估,则关注回答能否真正依据所提供的资料,以及短篇事实回答是否准确。这些资料共同说明:流畅度、篇幅和信心都不是事实可靠性的证明。

关键概念一:什么是AI“幻觉”

所谓“幻觉”,一般指模型生成看似可信、实际不正确或没有依据的内容。常见形式包括错误日期、混淆人物、把两个事件拼在一起、夸大研究结论、虚构书名、制造不存在的网址,或把推测写成确定事实。

这个词容易让人误以为问题一定非常离奇。事实上,最难发现的错误往往只差一点:年份错了一年、百分比少了小数点、机构名称相似但不相同,或真实论文被配上错误结论。答案中的大部分内容也许正确,只夹杂一两个关键错误。因此,不能只问“整段看起来对不对”,而要把可以验证的主张逐项检查。

关键概念二:来源、引文与证据并不相同

答案列出一个来源名称,并不代表来源真的支持该说法。可靠查证至少包含三层:

  • 来源是否存在:机构、报告、网页或论文能否找到?
  • 内容是否一致:原文是否真的表达相同意思,而不是只提到相似主题?
  • 来源是否适合:它是原始研究、官方说明、专业机构资料,还是未经编辑的个人意见?

引用真实资料但曲解结论,也是一种错误。例如,一项规模很小的初步研究不能被写成适用于所有人的确定结论;一份讨论某地区的报告,也不能自动代表全球情况。

关键概念三:事实、分析和建议要分开

AI回答常把三种内容放在一起。事实是可以核对的陈述,例如某机构发布报告的日期;分析是根据事实作出的解释;建议则包含价值判断、目标和个人情况。读者应先检查事实,再评估分析是否合理,最后决定建议是否适合自己。

如果基础事实不可靠,后面的分析即使写得很好也可能失去意义。涉及医疗、投资、法律或安全的重要事项,AI内容只能作为理解问题和准备提问的辅助,不能代替合资格专业人员的个别判断。

普通人的七步查证法

第一步:先标出需要查证的句子

不是每一句话都需要相同程度的核查。“请把这段文字改得更简洁”主要是写作任务;“某项政策于哪一天生效”则是事实任务。优先标记人名、日期、金额、百分比、排名、引用、研究结论、网址和“首次”“唯一”“一定”等绝对说法。

长答案可以拆成一张简短清单,每条只保留一个主张。主张越具体,越容易查证。例如把“这项技术很环保”拆成能源使用、材料寿命、运输影响和回收条件,便能避免用一个模糊标签掩盖复杂问题。

第二步:要求AI说明不知道什么

可以追加提问:“哪些部分你不确定?”“哪些资料可能已经过期?”“请把事实、推测和建议分别列出。”这种做法不能保证答案正确,但能迫使内容结构更清楚,也方便读者决定检查重点。

不要只问“你确定吗?”模型可能再次给出同样自信的回答。更好的要求是:“如果没有足够证据,请明确写不知道,不要猜测。”承认不确定不是失败,而是负责任的资讯处理方式。

第三步:寻找原始或官方来源

若主张涉及政府数据,应找相关机构原始发布;涉及公司产品规格,应查看官方技术文件;涉及学术研究,应查论文、研究机构或专业组织的资料;涉及健康知识,可优先参考世界卫生组织、卫生部门或信誉良好的医疗机构。

搜索结果摘要、社交媒体贴文和转述文章可以帮助找到方向,但不宜成为最终证据。打开来源后,要确认标题、作者、发布日期、适用地区和上下文。

第四步:核对来源是否真的支持主张

不要因为网页包含相同关键词就停止。阅读相关段落,检查原文说的是“可能”“相关”“在特定条件下有效”,还是“已经证实”。这些词的差别很大。若AI提供直接引文,应在原文中找到完全对应的句子,并查看引文前后是否改变原意。

Google DeepMind 的“grounding”概念很适合作为日常检查标准:回答中的事实是否能够落在所提供资料上?若来源只支持一部分,就应缩小结论,而不是让文字超过证据。

第五步:用第二个独立来源交叉确认

对重要事实,最好再找一个独立且可信的来源。所谓独立,不是两篇网站文章都复制同一份新闻稿,也不是多个页面引用同一个未经核实的帖子。理想情况是不同机构通过各自资料或方法得到相容结论。

如果两个可靠来源不同,不必立刻选择自己喜欢的一个。先检查发布日期、定义、样本、地区和计算方法。很多表面矛盾来自衡量对象不同,而不是其中一方必然错误。

第六步:检查时间与适用范围

技术功能、价格、法规、机构负责人和统计数据会改变。即使来源真实,旧资料也可能不再适用。查证时应记录“截至何时”,并区分全球资料和本地资料。面向马来西亚读者的内容,还应确认单位、币种、时区和当地规定。

同样的建议未必适用于每个人。研究对象可能是成年人、某行业员工或特定国家居民。把有限范围的结果扩展到所有人,是常见的推理错误。

第七步:根据风险决定是否需要人工复核

低风险内容可以采用较轻的检查;高风险内容应有更严格流程。可使用简单的“影响×可逆性”判断:错误是否会影响健康、金钱、权益、安全或他人声誉?错误发生后是否容易纠正?影响越大、越难逆转,就越需要专业人员、负责人或原始文件复核。

公开发布前,至少应由另一位人类读者检查标题、关键数字、引文和参考链接。AI可以协助起草检查表,但不能成为自己输出的唯一审核者。

这样做的好处

第一,查证能提高内容可信度,减少更正和返工。第二,把主张拆开后,读者会更清楚哪些是事实、哪些是解释,也更容易与同事沟通。第三,要求来源和不确定性,可以帮助我们更有效地使用AI,而不是因担心错误而完全拒绝工具。第四,长期保存来源和核查记录,有助于日后更新内容。

更重要的是,查证培养的是可迁移能力。无论内容来自AI、社交媒体、广告、朋友转发或普通网页,同一套方法都适用:找出主张、追查原始依据、确认上下文、比较独立来源,再按风险决定行动。

常见误解

误解一:答案很详细,所以比较可靠。篇幅只能说明内容多,不能证明事实正确。错误答案也可以有完整表格和专业语气。

误解二:附上链接,就完成查证。链接可能失效、无关或只支持部分陈述。必须打开并阅读相关内容。

误解三:同一个问题问三次,答案相同就是真的。模型可能重复同一训练模式或同一错误。重复生成不是独立证据。

误解四:最新模型不会产生幻觉。模型持续进步,但 OpenAI、Anthropic 和 Google DeepMind 的资料都仍把事实可靠性视为需要评估与改善的问题。

误解五:AI检测工具可以判断所有文字是否由AI写成。文字来源检测和事实核查是两回事。即使能判断内容来源,也不能证明内容正确;即使无法判断是否由AI生成,内容仍然可以逐项核实。

误解六:只要注明“仅供参考”,就不必负责。免责声明不能代替合理检查。公开传播者仍应避免把未经证实的内容包装成事实。

实用提示:建立一张轻量核查表

  • 这段内容的用途和风险是什么?
  • 有哪些人名、日期、数字、引文和绝对说法?
  • 每项主张是否找到原始或官方来源?
  • 来源是否真的支持相同结论?
  • 是否有第二个独立来源交叉确认?
  • 资料日期、地区和适用对象是否正确?
  • 哪些部分仍然不确定?是否应删除或改写?
  • 发布或行动前是否需要专业人员复核?

在保存文件时,可附上来源名称、网址、查阅日期和负责核查的人。若未来数字改变,就能快速找到需要更新的位置。对团队而言,统一核查表也比单靠个人经验更稳定。

总结

使用AI的关键不是盲目信任,也不是一概怀疑,而是建立与风险相称的验证习惯。先把答案拆成可核对的主张,要求模型表达不确定性,寻找原始资料,确认来源真正支持结论,再用独立来源交叉检查。涉及健康、金钱、法律、安全和他人权益时,应让合适的专业人员参与。

AI最适合成为思考和整理资料的助手,而不是事实的最终裁判。当人们保留判断、追查证据并清楚标示不确定性,生成式人工智能才能更安全、更有价值地进入日常生活。