幻觉
生成式系统可能输出看似可信、实际与证据冲突或缺乏支持的内容;判断时要分清错误、无依据和未知。
理解与应用
幻觉通常指生成式系统给出了貌似合理、实际不可靠的内容。它可能编造不存在的条款,也可能把真实条款安到错误对象上。评估时需要进一步说清标准:回答是否忠于给定资料,与回答是否符合现实,是两种不同检查;一份过时资料即使被准确复述,也未必能支持今天的结论。
假设报销制度写着“审批通过后安排付款”,助手却回答“审批通过后两天到账”。新增的“两天”没有文档依据。如果记录明确写着五个工作日,回答就与资料冲突;如果资料完全没写时限,只能说当前证据不足,还不能据此断定现实中从未出现过两天到账。这几种情况不宜统统归为同一种错误。
检索可以把相关条款带进上下文,减少凭空补全的需要,但它也可能取到旧版本、相似名称的文件,或只取到缺少脚注的半段内容。引用同样需要检查对应关系:一个有效链接不能替“到账时间”这个具体判断提供自动担保。精确数字、订单状态和执行结果更适合由相应工具核实。
改善系统时,可以把回答拆成关键主张,记录每项是有支持、与证据冲突,还是暂未找到证据。这样才能知道需要改进的是检索、版本筛选,还是模型对原文的解释。对缺口明确说明比补写一个听起来合理的数字更可靠,但也不必因一项未知而拒绝整个问题,已有证据支持的部分仍然可以回答。
看一个具体过程:把同一回答中的三类判断拆开
同一句话可以同时含有正确、冲突和无依据的部分。把它拆开后,修正方向就清楚了;第三项也不应因为查不到就被宣布为绝不可能。
以下为教学示意,未连接真实业务系统。
过程示意
已知记录:R-204 已审批通过;付款尚未完成;记录未写预计到账日期。 待检查回答:R-204 已通过审批,款项已经到账,下周还能收到补贴。
示意结果
“已通过审批”:记录支持。 “款项已经到账”:与“付款尚未完成”冲突。 “下周还能收到补贴”:当前记录没有依据。
常见误区
- 模型表现得很有把握,不代表它拥有支持该结论的证据。
- 查不到与查到相反证据不同,前者通常需要保留未知。
- 检索到真实文件后仍可能答错版本、对象或条款的适用范围。
前置与延伸
建议先读
相关概念
参考与版本
Apollo 原创讲解与教学示例。参考资料用于核对技术定义;核验日不代表资料的发布日期。
- On Faithfulness and Factuality in Abstractive Summarization ↗
核对来源忠实性与事实性的区分;不能把摘要任务结论当作所有模型的固定错误率。 · 核验:2026-10-10