HyDE 假设文档检索
HyDE 先生成一段可能回答问题的文字,用它去寻找真实文档;生成的文字是检索线索,不能成为答案证据。
理解与应用
HyDE 是一种面向密集检索的方法:先让语言模型根据问题生成一段假设文档,再把这段文字编码成向量,用它检索真实语料中的相近文档。它尝试解决短问题与长资料表达不一致的困难。用户只问“冬天手机为什么掉电快”,而技术文档可能主要讨论低温、电池内阻和可用容量,两者字面上并不很接近。
生成的假设文档可以把短问题展开成更像资料的表述,例如讨论低温环境下电池性能变化。检索器随后寻找具有相近表示的真实文章。即使这段生成文字包含错误细节,也只能作为搜索的出发点;最终解释必须回到取回的原文。保存原问题、假设文本和真实命中文档,能分清错误发生在查询扩展、检索,还是答案组织阶段。
这条额外路径并非总有收益。如果问题包含精确型号或少见术语,生成器可能把它改写成常见但不同的对象,带着检索器偏离目标。实践中可以保留直接检索的候选,再合并、重排真实资料,并用同一套问题比较召回、噪声和延迟。假设文章写得通顺,只说明生成顺利,不说明找到了正确证据;它还增加了生成和编码的成本。
看一个具体过程:用假设文档连接短问题与技术资料
这是 HyDE 的信息流示意,没有运行嵌入检索。生成文字为原创的示范查询材料;即使命中内容与其相似,仍需阅读原文确认,而不能把相似度当作事实验证。
以下为教学示意,未连接真实业务系统。
过程示意
原问题:冬天手机为什么掉电快? 生成的检索用文字:低温可能改变电池的内阻与可用容量,设备在相同负载下可能更早触及工作电压下限。 检索过程:对这段假设文字编码,在真实资料库中寻找近邻。 阅读过程:打开命中的电池技术资料,核对实际支持的机制与适用条件。
示意结果
最终答案引用真实资料中的解释。 假设文档留在检索记录中,不作为引用来源,也不单独证明任何机制。
常见误区
- 假设文档是生成出来的检索输入,给它附上“资料”标签不会使它成为证据。
- 型号、日期和罕见实体在改写中可能变化,原查询不能因此被悄悄替换。
- 词重叠实验或一次成功检索,不能证明 HyDE 在整个资料库中优于直接检索。
前置与延伸
建议先读
相关概念
参考与版本
Apollo 原创讲解与教学示例。参考资料用于核对技术定义;核验日不代表资料的发布日期。
- Precise Zero-Shot Dense Retrieval without Relevance Labels ↗
核对 HyDE 的假设文档、编码、真实语料检索三个环节;假设文档可能包含虚构信息。 · 核验:2026-10-10