你让 AI 帮忙查香港《雇佣条例》关于年假的规定。它回答得极有条理:第几条、条文内容、连生效年份都有。你依着条号翻查原文——查无此条。
再试一次,它道歉,然后给出另一个条号。同样查无此条。
它不是在说谎。说谎需要先知道真相再隐瞒,而它根本不知道自己在编。这个现象叫幻觉(hallucination),是大模型与生俱来的性格。想用好 AI,第一课不是学提示词,而是搞清楚它什么时候可信、什么时候会胡说。
它不是在查资料,是在接下一个字
大模型的工作原理,一句话讲完:读入你的问题,然后一个字一个字地预测「下一个最合理的字」。它的目标由头到尾只有一个——把句子接得通顺、合理、像人话。
留意,是「合理」,不是「真实」。
它像一位读过极多书、但从不带书出门的讲者:你问什么,他都凭记忆与语感即席回答。大部分时候,他读过的书足够多,答得又快又准;但遇到记忆模糊的地方,他不会停下来,而是凭语感把空白补完——补得流畅自然,语气与讲真话时一模一样。
香港人应该熟悉这个场景:问一位老街坊「那间茶餐厅在哪里」,他多半不会说「不记得」,而是很有把握地告诉你「洗衣街转角」——因为在他的经验里,茶餐厅开在转角,合理。他不是骗你,他是用「合理」代替了「记得」。
幻觉就是这回事:模型用合理填补了真实的空缺,而它自己分不出两者。
还有一个要命的细节:训练过程长期奖励「给出答案」多于「承认不知道」。近年的模型在主动说「不确定」方面有明显改善,但这个倾向没有根治——你逼得越紧,它越倾向编一个给你。
六类问题最高危
幻觉不是随机出现的,它有明确的高发区。以下六类问题,AI 给的答案一律先当「待查证」:
| 高危类型 | 例子 |
|---|---|
| 具体数字与日期 | 价格、统计数字、事件日期 |
| 条文与引文 | 法例条号、书的页码、名人语录 |
| 链接与出处 | 它给的 URL 可以整条编出来 |
| 本地与小众信息 | 某间店的营业时间、政府程序细节 |
| 近期事件 | 模型有训练截止日,之后的事它一概不知 |
| 被逼必须作答的问题 | 「你一定要给我一个答案」 |
规律一句话讲完:越具体、越冷门、越新,越容易中招。反过来,讲原理、写文案、整理你提供的资料,它极少出事。
六个防法
一、要求附来源,并且真的去查
请列出每一点的来源。没有把握的,直接标明「未能确认」。
注意:要求来源,不等于来源是真的——它连来源都能编。这一招真正的作用是缩小查证范围:它自己标了「未能确认」的部分,通常正是幻觉高发处。
二、把「可以不知道」写进问题
不确定就直说「不知道」,不要猜。答「不知道」不会被扣分。
简单一句,效果立竿见影。等于告诉那位即席演讲的讲者:今天允许留空,不必硬撑。
三、高危信息换一个模式问
多数 AI 产品都有联网搜索功能。涉及近期事件、价格、时效信息,先开联网再问——让它去查,而不是让它背。未开联网时,它对「今天」一无所知。
四、贴原文,不考记忆
要它分析《雇佣条例》,就把条例原文贴给它再问。AI 读你提供的资料,可靠程度远高于凭训练记忆作答——前者是开卷考试,后者是即席演讲。合约、报告、条款,一律先贴原文。
五、多模型交叉验证
同一条重要问题,分别问两个不同公司的模型。两者答案一致,多半可信;答案有出入,就是明确的查证信号。两位互不相识的讲者,在同一处讲错同一个细节,机率低得多。
六、反向拷问
得到答案之后,追加一句:
你刚才的回答里,哪一句最有可能出错?为什么?
模型审视自己的输出时,经常能标出信心最弱的部分——那正是你该优先查证的地方。
三个常见误区
1. 以为它会上网。 未开联网功能时,它全凭训练记忆作答,对近期发生的一切一无所知。
2. 以为语气肯定等于答案正确。 幻觉的语气与正确答案一模一样——「一本正经」正是幻觉的本体特征,不是可信的信号。
3. 以为追问能问出真相。 你一质疑,它经常改口——但改口可能只是迁就你,不代表新答案更正确。判准永远是原文与出处,不是它的态度。
懂它的性格,就是懂分寸
幻觉不是等待修复的故障,是「预测下一个字」这种技术的天性。指望它消失不现实;摸清它的脾气之后,你自然知道什么事可以放心交给它、什么答案要先过一道查证。用 AI 用得好的人,与其说懂技术,不如说懂分寸。
下次它一本正经地给你一个条号,你可以微笑,然后打开原文。
*本文资料截至发稿日(2026 年 7 月 20 日),仅供一般参考,不构成任何建议;第三方产品之功能、价格与政策,以其官方最新公布为准;Essevin 服务详情以官网与 console 实际显示为准。