幻觉

生成式系统可能输出看似可信、实际与证据冲突或缺乏支持的内容;判断时要分清错误、无依据和未知。

返回概念图谱 →

理解与应用

幻觉通常指生成式系统给出了貌似合理、实际不可靠的内容。它可能编造不存在的条款,也可能把真实条款安到错误对象上。评估时需要进一步说清标准:回答是否忠于给定资料,与回答是否符合现实,是两种不同检查;一份过时资料即使被准确复述,也未必能支持今天的结论。

假设报销制度写着“审批通过后安排付款”,助手却回答“审批通过后两天到账”。新增的“两天”没有文档依据。如果记录明确写着五个工作日,回答就与资料冲突;如果资料完全没写时限,只能说当前证据不足,还不能据此断定现实中从未出现过两天到账。这几种情况不宜统统归为同一种错误。

检索可以把相关条款带进上下文,减少凭空补全的需要,但它也可能取到旧版本、相似名称的文件,或只取到缺少脚注的半段内容。引用同样需要检查对应关系:一个有效链接不能替“到账时间”这个具体判断提供自动担保。精确数字、订单状态和执行结果更适合由相应工具核实。

改善系统时,可以把回答拆成关键主张,记录每项是有支持、与证据冲突,还是暂未找到证据。这样才能知道需要改进的是检索、版本筛选,还是模型对原文的解释。对缺口明确说明比补写一个听起来合理的数字更可靠,但也不必因一项未知而拒绝整个问题,已有证据支持的部分仍然可以回答。

关系速览
大语言模型(LLM)面临风险 →幻觉

生成模型可能给出无证据的断言,因此其回答需要独立事实检查。

LLM 作为评审者面临风险 →幻觉

评审模型也会产生无依据判断,需用锚定标准和人工抽检约束。

看一个具体过程:把同一回答中的三类判断拆开

同一句话可以同时含有正确、冲突和无依据的部分。把它拆开后,修正方向就清楚了;第三项也不应因为查不到就被宣布为绝不可能。

以下为教学示意,未连接真实业务系统。

过程示意

已知记录:R-204 已审批通过;付款尚未完成;记录未写预计到账日期。
待检查回答:R-204 已通过审批,款项已经到账,下周还能收到补贴。

示意结果

“已通过审批”:记录支持。
“款项已经到账”:与“付款尚未完成”冲突。
“下周还能收到补贴”:当前记录没有依据。

常见误区

  • 模型表现得很有把握,不代表它拥有支持该结论的证据。
  • 查不到与查到相反证据不同,前者通常需要保留未知。
  • 检索到真实文件后仍可能答错版本、对象或条款的适用范围。

前置与延伸

建议先读

相关概念

参考与版本

Apollo 原创讲解与教学示例。参考资料用于核对技术定义;核验日不代表资料的发布日期。