从知识库制作任务上下文包
建议用时:25 分钟(含练习)
学习目标
能够把多个来源整理为有目录、有引用、有冲突说明的最小上下文包。
本节产出
一个带来源编号的任务上下文包
核心知识:上下文包围绕任务组织证据
上下文包
上下文包是为一个具体任务挑选和整理的输入材料集合。它可以是一份文档,包含任务问题、必要背景、来源编号、相关片段、冲突说明和待确认事项。它的目的不是展示资料数量,而是让执行者知道哪些信息可用、怎样使用,以及哪些结论还不能下。
一个好的包既不过度缺失,也不过度堆积。只有碎片可能让人误解条件,整篇复制所有资料又会增加噪音。可以为每段保留足以解释主张的上下文,同时提供原始链接,让需要深入核对的人能够回到完整来源。
图中的筛选不是为了让所有材料都支持预设答案。反对证据、例外和未知项同样重要。一个只保留支持性材料的包,可能让输出更流畅,却降低结论质量。
案例:从五篇笔记准备一篇入门说明
假设任务是写一篇“何时需要外部检索”的短文,读者刚开始接触 AI。五份材料分别是基础概念、官方工具说明、一次个人实践、旧版本教程和一篇营销文章。上下文包不需要平均分配篇幅,而应根据每份材料能支持什么来选择。
| 编号 | 采用内容 | 使用限制 |
|---|---|---|
| S1 | 基础概念中的定义与条件 | 不支持具体产品性能比较 |
| S2 | 当前官方说明中的功能范围 | 只适用于所核对产品与版本 |
| S3 | 个人实践的输入与观察 | 作为案例,不推广为普遍结论 |
| S4 | 旧教程与新说明的差异 | 保留作历史对照,不作当前操作依据 |
| S5 | 营销文章提出的问题 | 缺少证据的效果承诺不采用 |
每段材料可以记录编号、标题、公开地址、发布日期、核验日期、片段和用途。片段尽量用自己的话准确概括;需要原文时只保留必要短引,并注明位置。上下文包也应尊重版权,不能把可访问误解为可无限复制。
冲突要解释口径
假设旧教程说某功能不可用,新文档说已经支持。先检查时间与版本,可能只是产品变化,而非谁写错了。若两个来源讨论不同计划、地区或执行环境,也应保留这些条件。只有在条件一致时,才进一步判断证据是否矛盾。
不要让模型自行把冲突“润色掉”。可以明确要求输出冲突表:主张是什么、双方来源是什么、可能差异原因是什么、还需要什么证据。无法判断时,正文应使用有边界的表述或暂缓相关结论。
把资料与指令分开
包的开头写任务合同,资料区明确标为研究输入。来源中的操作要求、广告话术或提示文本,不自动成为执行指令。若任务只是写作,就不应因为材料里出现安装命令而开始安装软件。
同样,上下文包中的私人信息应经过必要性检查。公开写作只保留允许公开的内容和可访问来源。内部素材可以帮助形成问题,但不能以不可访问附件替代公开证据,也不能把客户或个人细节带进示例。
包的大小由覆盖与使用决定
可以先做一页目录和少量核心片段,再根据缺口补充。给每段写“用于回答哪个问题”,如果写不出来,就可能不该放入本次包。最后让另一人只看包写提纲,观察他是否误解概念、遗漏条件或找不到证据,据此调整。
动手练习
- 为五份虚构材料制作来源表,给每份写采用与排除范围。
- 加入一对看似冲突的结论,说明如何检查时间、版本和口径。
- 把上下文包交给同伴,让他标出无法独立理解的地方。
参考答案与推演
合格包应包含任务问题、目标读者、输出要求、证据片段、冲突和未知项。S3 的个人实践可以帮助读者理解,但不能支持“所有任务都提高效率”的结论。S4 可以说明历史变化,不能直接指导当前配置。
如果同伴不知道某个缩写或某段摘录中的“它”指什么,就需要补充最小背景。若包里一半内容与题目无关,应删减而不是要求读者自行筛选。好的包让下一步更准确,也让核验更容易。
完成检查
- 每段材料与任务问题有明确关系。
- 来源、日期、用途与限制可追踪。
- 冲突和反对证据没有被静默删除。
- 资料与指令分开,公开边界经过检查。
参考与来源
- Anthropic:Effective context engineering for AI agents:组织高相关上下文的基本思路。
- W3C:PROV Overview:来源与处理活动的追踪概念。
从知识库制作任务上下文包
3 道题 · 及格分 60 分