HyDE 假设文档检索

HyDE 先生成一段可能回答问题的文字,用它去寻找真实文档;生成的文字是检索线索,不能成为答案证据。

返回概念图谱 →

理解与应用

HyDE 是一种面向密集检索的方法:先让语言模型根据问题生成一段假设文档,再把这段文字编码成向量,用它检索真实语料中的相近文档。它尝试解决短问题与长资料表达不一致的困难。用户只问“冬天手机为什么掉电快”,而技术文档可能主要讨论低温、电池内阻和可用容量,两者字面上并不很接近。

生成的假设文档可以把短问题展开成更像资料的表述,例如讨论低温环境下电池性能变化。检索器随后寻找具有相近表示的真实文章。即使这段生成文字包含错误细节,也只能作为搜索的出发点;最终解释必须回到取回的原文。保存原问题、假设文本和真实命中文档,能分清错误发生在查询扩展、检索,还是答案组织阶段。

这条额外路径并非总有收益。如果问题包含精确型号或少见术语,生成器可能把它改写成常见但不同的对象,带着检索器偏离目标。实践中可以保留直接检索的候选,再合并、重排真实资料,并用同一套问题比较召回、噪声和延迟。假设文章写得通顺,只说明生成顺利,不说明找到了正确证据;它还增加了生成和编码的成本。

关系速览
查询扩展包含 →HyDE 假设文档检索

在以生成内容扩展检索表示的方法中,HyDE 是一种具体方案;其假设文档不能直接作为答案证据。

看一个具体过程:用假设文档连接短问题与技术资料

这是 HyDE 的信息流示意,没有运行嵌入检索。生成文字为原创的示范查询材料;即使命中内容与其相似,仍需阅读原文确认,而不能把相似度当作事实验证。

以下为教学示意,未连接真实业务系统。

过程示意

原问题:冬天手机为什么掉电快?
生成的检索用文字:低温可能改变电池的内阻与可用容量,设备在相同负载下可能更早触及工作电压下限。
检索过程:对这段假设文字编码,在真实资料库中寻找近邻。
阅读过程:打开命中的电池技术资料,核对实际支持的机制与适用条件。

示意结果

最终答案引用真实资料中的解释。
假设文档留在检索记录中,不作为引用来源,也不单独证明任何机制。

常见误区

  • 假设文档是生成出来的检索输入,给它附上“资料”标签不会使它成为证据。
  • 型号、日期和罕见实体在改写中可能变化,原查询不能因此被悄悄替换。
  • 词重叠实验或一次成功检索,不能证明 HyDE 在整个资料库中优于直接检索。

前置与延伸

建议先读

相关概念

参考与版本

Apollo 原创讲解与教学示例。参考资料用于核对技术定义;核验日不代表资料的发布日期。