先搜索,再选择性读取

建议用时:25 分钟(含练习)

学习目标

能够用文件名、关键词、链接与语义扩展定位相关材料,并控制读取范围。

本节产出

一份可复现的检索记录

核心知识:检索是逐步缩小问题范围

让 AI 使用资料,不等于让它一次读取整个资料库。先搜索、再选择性读取,可以减少无关内容,也让你解释为什么采用某些证据。检索不是只输入一个词等待答案,而是根据命中情况逐步修正查询,并保留选择与排除理由。

开始前先写清要回答的问题、时间范围、资料类型和允许读取的区域。例如“解释检索如何帮助构建上下文”与“比较本月三个检索产品的价格”需要不同来源。前者以概念与研究文档为主,后者需要当前官方价格信息,不能仅依靠旧笔记。

研究问题转成关键词与同义词,先看命中清单,再读相关片段和上下文,最终形成可复现的证据集合

图中的筛选是逐步增加阅读深度:

  • 文件名和标题:帮助定位。
  • 命中片段:帮助判断相关性。
  • 完整段落:帮助理解条件。
  • 原始来源:帮助核实事实。

只读搜索摘要容易丢失限制,直接读全部内容又容易淹没重点。

案例:查找“上下文与检索”的材料

假设你有一组公开练习笔记,文件名不统一,有的用中文,有的用英文缩写。只搜索“上下文”可能漏掉 context,只搜索 RAG 又可能找到大量不相关产品介绍。因此先建立查询扩展表。

查询方向示例词解决的问题
核心概念上下文、context找定义与基础说明
相关机制检索、retrieval、RAG找资料选择过程
常见限制截断、噪音、过期找失败与边界
任务场景问答、研究、引用找可使用的案例
版本与时间文档日期、更新记录判断是否适用

这些词是本案例的起点,不是固定万能查询。看到某篇高相关资料使用新的术语时,可以把它加入下一轮检索;发现一个词持续命中无关主题时,可以增加范围限制或排除条件。

先看清单,再读正文

可以先用编辑器或 Obsidian 搜索查看标题与片段,再打开少量高相关笔记。熟悉命令行的人也可以在已经授权的练习目录中使用只读搜索工具。无论界面如何,流程都应保留查询词、范围、命中文件和选择理由。

读取命中段落时,向前后扩展一点上下文,确认代词指什么、结论是否有条件、引用是否来自另一篇资料。若笔记只是二手摘录,应继续回到原始公开页面核对。搜索工具找到的是文本匹配或相关性线索,不是事实正确性的证明。

没找到不等于不存在

搜索无结果可能来自词形不同、文件未被索引、扫描 PDF 无可搜索文本、资料在其他允许目录,或内容确实不存在。先检查这些可能,再决定是否扩大范围或补充公开研究。不要把一次查询失败写成“资料库没有任何相关内容”。

扩大范围也应有目的。一个研究任务不需要顺便读取无关财务、私人聊天或账号资料。若发现命中包含敏感信息,优先寻找公开替代材料或只保留必要的脱敏事实,不把原文整段送入外部服务。

什么时候停止搜索

可以用问题覆盖率判断:关键概念有定义、核心主张有证据、主要冲突有说明、实际例子能够复现。新增结果连续只重复已有信息时,可以暂时停止,并记录检索截止范围。对于仍没有证据的问题,保留未知,不靠增加不相关资料制造“研究充分”的印象。

动手练习

  1. 为案例写五组扩展词,并说明每组用途。
  2. 从十份虚构笔记中选择三份深入阅读,记录另外两份的排除理由。
  3. 模拟一次无结果查询,提出两种修正方式,并写出停止条件。

参考答案与推演

完成检查

  • 查询围绕具体问题,包含合理的同义词扩展。
  • 选择与排除理由可以由他人理解。
  • 关键片段读过上下文,并核对原始来源。
  • 搜索范围受控,停止条件与未知项明确。

参考与来源

先搜索,再选择性读取

3 道题 · 及格分 60 分

开始测验