外观
第三章 认知搜索理论
一份失灵的 Prompt 手册
一家公司的 AI 应用小组做了一件看起来很正确的事。
他们把一段时间里所有被验证有效的提问方式整理成一份《Prompt 手册》:怎么让 AI 扮演角色,怎么分步推理,怎么列失败模式,怎么做头脑风暴……一共收录了几十条,全公司推广。
推广开之后,反馈两极分化。有人说效果立竿见影,有人说完全没用。同一条“列失败模式”技巧,两个团队的评价截然相反:一个团队在新功能评审中用它找到了遗漏的依赖,另一个团队在目标尚未明确时使用,觉得它“纯粹浪费时间”。两边都认真执行了。
负责人很困惑:技巧都是验证过的,执行也都到位,为什么效果像掷骰子?
换个角度看,同一个方法可能在一个项目上屡试不爽,换个项目就失去效果;同一个人也可能昨天还能驾驭 AI,今天面对新问题却无从下手。
为什么同一套被验证过的方法,换个场景就时灵时不灵?
手册失灵的四个信号
先把这类"不稳定"背后反复出现的现象放在一起看。
技巧可能用错位置
仔细复盘那些失效案例,会发现一个规律:技巧大多有效,只是常常用错了地方。
方案的方向从一开始就错了,加深推理只会把错误论证得更充分;提问目标模糊,换十个角色也只会得到十种模糊答案。技巧之间似乎各有分工:有的影响方向,有的影响深度,有的影响起点,但这份分工从未被明确画出来。
背景资料会改变搜索状态
两个工程师用同一个模型,修同一个系统的故障。一个把报错信息直接丢过去;另一个先粘贴了系统架构说明和自己的初步判断,再给报错。
后者的答案质量稳定地更好。架构知识本来就在模型的知识里,那份文档没有教给 AI 新知识,却改变了这次搜索的状态。这种状态可以被外部塑造。
长期项目需要持续维护
很多超过三个月的 AI 协作项目里,团队会自发地开始维护一些东西:规范文档、决策记录、术语表、阶段总结。没有人教他们这么做,但不维护这些的项目,AI 的表现会逐渐漂移——上个月定下的原则,这个月被悄悄违反;前后两次回答,互相矛盾。
这些东西很少出现在每一次具体的提问里,但它们显然在持续地起作用。
有经验的人能预判表现
有经验的使用者,在按下回车之前,大致能预判这次回答的质量,以及如果质量不行、问题大概出在哪;新手只能事后碰运气。
这种差别一般被归为"手感"。手感难以直接传递,但手册其实是在尝试传递它,只是没有成功。这或许说明,高手脑中存在一个关于"一次交互由什么构成"的隐性模型,只是尚未被说清楚。
从失灵定位结构
这些现象指向同一件事:一次 AI 交互不是一个点,而是一个有内部结构的系统。
把前两章的结论拼起来,这个系统的轮廓已经隐约可见。第一章看到:输入设定了搜索的初始条件。第二章看到:回答是初始条件出发的一条搜索轨迹。合起来,一次回答就是这个系统的一次运行。
从"结构"这个视角看,这些现象可以这样解释。
技巧为什么时灵时不灵?如果交互是一个系统,每个技巧作用的只是其中某个部分。瓶颈在这一部分时,技巧才会生效;瓶颈在别处,技巧自然无效。由此可以推出:系统确实存在可区分的部分,否则技巧的效果无法解释。
背景资料为什么有用?它说明除了这一次输入的内容之外,还有一层更持久的东西在塑造搜索。资料不是在这次交互中临时生效的,它改变的是搜索赖以开始的那个状态。
长期项目为什么需要维护?那层持久的东西不是静态的——它会被每一次搜索的经验不断更新。维护得好,它越来越贴合项目;不维护,它就在一次次搜索中失真。
高手为什么能预判?因为系统的结构是稳定的、可学习的。他见过的每一次交互,都在校准他脑中那张结构图。
问题也就从"为什么技巧不稳定",转向了另一个问题:
这张结构图,到底长什么样?
三种工程视角的缺口
在给出这张图之前,先看现有的三个工程视角各自遗漏了什么。
Prompt 工程视角
提示词工程(Prompt Engineering)把交互看成"写好一句话"的艺术。它积累了大量有效的技巧,这是它真实的贡献;但它的视野只有输入这一个点。它回答不了:技巧为什么失效?长期项目维护的那些文档算什么?一个只看得见输入的视角,注定画不出整张图。
上下文工程视角
上下文工程(Context Engineering)进了一步:它意识到问题不只是那句话,还有那句话背后的所有信息。但它把一切归结为"往上下文里放对资料"——目标、约束、背景、记忆、规范,被装进同一个袋子。它回答不了:为什么这份资料改变了结果,而那份没有?为什么有的信息需要长期维护,有的用过即弃?不区分作用的种类,就无法解释作用的差别。
Agent 与 Workflow 视角
还有一种视角直接跳到了编排:把复杂任务拆给多个 Agent,用 Workflow 串起来。编排确实是趋势,但它回答的是一个更后面的问题。如果一次调用的内部结构都还没有说清楚,那么编排一百次调用,也只是把不理解的东西复制了一百份。
这些视角并非错误,它们各自描述了系统的一部分,但还没有把一次搜索和长期搜索放进同一个框架。本书第四篇会再讨论它们在框架中的位置。
四层框架正式成形
前两章和上面的分析已经提供了足够的材料。先给出本书的正式定义:
认知搜索(Cognitive Search):AI 在认知空间中,根据当前搜索配置,不断探索、筛选和组合知识,最终形成回答的过程。
这个定义中的各个部分都来自前文。认知空间是模型先验与当前可获得的知识、经验和模式构成的可能性背景;搜索配置是持续塑造未来搜索、并可被维护的控制规格及组织结构;探索、筛选和组合是搜索的实际动作;回答则是搜索形成的结果。
一次认知搜索至少要回答四个问题:从哪里开始?为了什么?能去哪些地方?具体怎么走?它们对应一次搜索的四个组成部分:
- 搜索初始化(Search Initialization):搜索开始之前,AI 已经拥有的认知状态——先验、偏置、角色、被预热的背景。
- 搜索目标(Search Objective):这次搜索为了什么,以及什么答案算最好。
- 搜索空间(Search Space):这次搜索实际可以探索的可能性范围。
- 搜索运行(Search Runtime):搜索如何一步步真正执行。
第二章用过的两个词,现在也可以给出正式说法。搜索进行到某一时刻,基于当前输入、工具结果和中间结论形成的暂时工作状态,称为搜索状态(Search State);我们对这些状态变化和输出序列所做的过程抽象,称为搜索轨迹(Search Trajectory)。
这里的“当前输入”就是一次搜索的 Context:它不只包括搜索配置按任务裁剪后的内容,也包括当前任务、外部证据、工具结果和交互历史。Context 中保留的上一轮判断或行动,可能继续影响本轮搜索状态;这是一种当前搜索中的历史影响,不等于搜索配置已经发生了更新。
需要对齐两个章节中的说法:第一章的"初始条件",指搜索初始化完成、搜索即将开始时的状态,也是搜索状态的起点。第一章的三个变量是四层尚未拆开时的合并说法;拆开后,起点与方向落在搜索空间层,"范围"将在第六章进一步细化,而"AI 在开口之前已经拥有了什么"属于搜索初始化。
最后,把多次搜索连起来。那层贯穿始终、被长期维护的东西,称为搜索配置(Search Configuration):持续影响未来搜索的一组控制规格及组织结构——目标、规则、约束、评价标准、产品定位、设计原则、历史决策,以及被固化或引用的 Memory、Workflow、Agent 职责,都可以纳入其中。而经验不断沉淀为配置、配置不断塑造未来搜索的循环,称为搜索演化(Search Evolution)。
由此可以得到理论的基本骨架:一次搜索有四层,多次搜索由搜索配置贯通,配置又在搜索演化中更新。
一次搜索与长期搜索
先看一次搜索。四个组成部分通常按初始化、目标、空间、运行的顺序启动,构成四层搜索模型;反馈也可能让目标、空间和运行方式重新调整:
| 层 | 回答的问题 |
|---|---|
| 搜索初始化 | AI 从什么状态开始搜索? |
| 搜索目标 | AI 为什么搜索?什么答案算最好? |
| 搜索空间 | AI 可以搜索哪些可能性? |
| 搜索运行 | AI 如何完成搜索? |
四层共同影响一次回答的质量。回答失败时,通常可以先定位到其中一层;哪些情况落在四层之外,后面的理论边界会再说明。
再看长期。搜索配置站在每一次搜索的背后,塑造它的初始化、目标与空间;每一次搜索的结果又反过来成为经验的来源:
一次搜索产生结果,结果被提炼为经验,经验更新搜索配置,新配置再塑造未来搜索。项目因此不只是回答的堆积,也会形成持续更新的系统。
三张结构图
认知空间、搜索空间与搜索轨迹的关系如下:
四层搜索模型如下:
长期项目的演化闭环如下:
三张图放在一起,可以看到两条关系:一次回答由四层搜索构成;多次搜索由搜索配置贯通,并在搜索演化中更新。
这套理论如何接受检验
这里还需要回答一个质疑:把 AI 的活动叫"搜索",会不会只是换了个词?
这个质疑值得认真对待。换说法是不需要证据的——任何现象都可以被重新描述。把"AI 给出了回答"改叫"AI 完成了一次搜索",如果到此为止,那么前面三章就只是一场词汇练习,什么都没解释。
换词和解释的区别,在于解释必须多做一件事:把整体拆成结构,让结构的不同部分可以被分别检验、分别调整、分别出错。可以用三道检验来判断这套理论属于哪一种。
可拆解。认知搜索被拆成四层,每层都有不同的失效方式:初始化空白,目标缺失,空间锁死,运行失控。本章开头的手册失灵,正说明不同技巧可能在不同层面失效。
可预测。改变初始条件,轨迹就可能改变;瓶颈所在的层,也会影响技巧是否有效。例如目标层缺位时,方向层的技巧再强也无法补上成功标准。这些判断可以先预测,再验证。
可操作。回答失败时,可以按初始化、目标、空间、运行逐层检查。仅仅换一个词无法提供这样的定位,结构才可以。
但仅有三道检验还不够。一套诚实的理论,还必须说清楚自己做不到什么。这套理论有三条明确的自我限制。
它不承诺结果正确。更好的搜索不等于更正确的答案:评价函数可能设错,环境反馈也可能被误读。理论能改善搜索过程,但不能替代现实检验。
它有明确的失效区。当所需知识不在认知空间里,任何配置都无能为力。此时应补充材料或更换工具。工具本身的缺陷也不属于认知搜索问题;理论能做的是帮助识别边界。
它写好了自己的失效条款。理论边界文档明确规定:如果 Prompt、Context、Memory、Workflow、Agent 无法被统一解释为搜索控制,理论失败;如果改变搜索控制参数无法改变 AI 的行为,理论失效。这些条件使理论承担了可被检验的风险。
因此,"搜索"是否构成解释,要看它能否在具体项目中帮助定位和修复问题。下次回答令人失望时,可以按四层排查;如果理论能指出问题所在并指导修复,它就不只是换词。
先找理论可能失效的地方
检验不能只挑容易成功的任务。至少有几种结果,应该被当作反例记录下来:Context 加得更多,回答却因为冲突和噪声变差;Workflow 增加了等待和维护成本,却没有降低错误;Agent 拆分后职责边界更模糊,协作反而变慢;目标已经明确,模型仍因缺少领域知识而持续出错;配置积累后出现过期规则,导致重复性偏差。
这些现象不必立刻归咎于使用者“配置得不够好”。它们可能说明参数并非当前瓶颈,或者说明搜索演化需要加入成本、冲突和下线条件。理论的作用不是保证每次调整都有效,而是让失败也能留下可比较的记录。
反例一:资料更全,回答却更散
一个产品团队准备评审“新用户首次使用流程”。他们先把产品说明、三个月的用户访谈、旧版本的埋点报告、客服聊天记录和几份竞品分析一起放进 Context,希望 AI 不漏掉任何线索。第一次回答确实覆盖得很广,却把已经废弃的注册流程和当前版本混在一起,建议之间互相冲突。评审者花了很长时间确认 AI 引用的是哪一份资料,反而没得到可执行的判断。
团队没有继续追加资料,而是把问题拆开检查。他们保留当前版本的流程图、最近一个月的流失数据和本季度的留存目标,明确标注旧资料只用于对照;同时把“先指出证据冲突,再给建议”加入运行要求。第二次回答少了许多背景,却更容易核对,遗漏的问题也能被具体指出。
这次失败没有推翻 Context 的作用。它说明 Context 的价值取决于相关性、时效性和组织方式;“带得更多”只扩大了输入,不必然扩大有效搜索空间。
反例二:Agent 拆得更细,协作却更慢
一个小团队想把竞品分析交给三个 Agent:资料搜集、用户洞察和结论撰写。三者同时启动,分别提交了一份看似完整的结果。问题出在交接:资料搜集没有记录来源的时间范围,用户洞察把推测当成访谈事实,撰写 Agent 只能把三份材料重新比对。团队增加了一个“验证 Agent”后,重复检查更多了,等待时间也变长,最终仍需要人重新确认哪些内容可以采用。
复盘时他们发现,真正没有被验证的是任务结构,而不是执行单元数量。团队先让一个执行单元完成“列出证据、标注不确定性、提出待验证问题”的完整流程,连续跑了几轮,确认交接标准稳定后,才把资料搜集和验证拆开。拆分后的收益来自职责边界和交接格式变清楚,而不是 Agent 数量增加。
Agent 仍然有工程价值,但职责分化需要前提:如果运行结构尚未验证,拆分可能只是把模糊传递变成多次交接。
把技巧归位
这套框架首先要能解释本章开头的"手册失灵"。做法是把每条技巧放到它所属的层里:
| 常见做法 | 作用位置 |
|---|---|
| 角色设定、Few-shot 示例、先介绍背景再提问 | 搜索初始化 |
| 明确任务目标、给出评价标准、说明"怎样算好" | 搜索目标 |
| 第一性原理、扮演反方、头脑风暴、列失败模式 | 搜索空间(起点、方向、广度) |
| 思维链、分步执行、自我反思、调用工具核对 | 搜索运行 |
| 项目规范、决策记录、术语表、Memory | 搜索配置 |
分类完成后,每个技巧都有明确的作用层,也就能解释它为何只在特定瓶颈下有效。"列失败模式"对一个团队有效,是因为他们需要检查方案方向;在另一个团队失效,可能是因为瓶颈在目标层,没人说清楚"怎样算好"。
这也解释了为什么有经验的使用者不依赖手册:他们先判断瓶颈所在的层,再选择对应操作。
重做那本手册
回到开头的案例。手册推广失败后,负责人没有继续补充技巧,而是用四层框架重新盘点手册。
结果很能说明问题。手册里绝大多数技巧都落在搜索空间一层:换方向、列方案、穷举失败模式;搜索运行也有一批:分步推理、自我反思、调用工具核对;搜索目标几乎没有条目,没有一条教人先说清“怎样算好”;搜索初始化也没有涉及如何让 AI 先知道项目是什么。而大量失效反馈恰恰来自这两层——提问没有说清成功标准,或者 AI 缺少项目背景。手册在这些场景里很难发挥作用,因为它没有提供对应层的工具。
小组随后补了两块内容。一块是目标层的"成功标准模板",每类任务先写清"什么结果算好";另一块是初始化层的"项目背景卡",用一页纸说明产品定位、关键约束和术语。除此之外,他们开始维护一份持续更新的决策记录,作为第一份搜索配置。
随后,团队成员遇到问题时,先判断瓶颈在哪一层,再选择对应操作。手册内容没有大改,只是从技巧汇编变成了按层归位的工具箱。
技巧和模型都没有变,变化在于他们看见了技巧背后的结构。
边界与术语
这套框架中有几组概念容易混淆。
"认知搜索,是不是就是 RAG 那套检索?"
不是一回事。RAG 属于信息检索(Information Retrieval):在文档库里按相关性取回资料,交给模型参考。认知搜索发生在 AI 的认知空间里,是对知识、经验与模式的探索、筛选和组合。本书不讨论信息检索的实现细节;RAG 取回的资料会作为证据输入,改变一次搜索的可用空间和状态,但不等同于认知搜索本身。
"认知空间和搜索空间,是一个东西吗?"
不是。认知空间主要指模型先验与当前可获得的知识、经验和模式;在模型、工具和输入条件固定时,可以作为稳定的分析背景。搜索空间是某一次搜索中实际可及的范围,由初始化、目标、约束、工具和反馈共同划定。第二章说的"大量未被走过的区域",指的是当前搜索尚未触及的可能性。
"搜索配置和 Context,有什么区别?"
这是全书最容易混的一对概念,值得说慢一点。搜索配置是长期稳定存在的控制参数集合:产品定位、设计原则、编码规范、历史决策、Memory。Context 是一次搜索中模型当前可以接收和利用的任务信息、指令、证据、交互历史、工具结果及其组织方式。搜索配置按任务裁剪后的表达,只是 Context 的一部分。同一份配置可以生成不同的 Context;当前对话和工具结果也会进入 Context,但不会自动成为搜索配置。
所以,准确的说法不是“上下文越来越重要”,而是:长期项目需要维护搜索配置,同时要把每次搜索真正需要的信息组织进 Context。
"四层模型,是不是把简单的事情复杂化了?"
随手问一个问题,确实用不上它。四层模型的价值在于诊断和预测:当结果不好时,它告诉你该检查哪一层;当新技巧出现时,它告诉你技巧改变了系统的哪一部分。它是一张检修图,只在需要检修的时候展开——但长期项目里,需要检修的时候远比你想象的多。
本章总结
本章从一个真实的困惑开始:被验证过的方法,为什么换个场景就时灵时不灵?
我们看到,技巧失效因为它不对症,资料有用因为它塑造了搜索的状态,长期项目自发维护着某些持续起作用的东西,高手能预判因为他们脑中有隐性模型。这四个现象共同指向:一次 AI 交互是一个有内部结构的系统。
前两章留下的线索,在本章正式收束为认知搜索理论:
AI 在认知空间中,根据当前搜索配置,不断探索、筛选和组合知识,最终形成回答的过程。
一次认知搜索由搜索初始化、搜索目标、搜索空间和搜索运行四层构成;搜索状态和搜索轨迹描述单次过程,多次搜索则由搜索配置贯通,并在搜索演化中更新。
本章给出的是搜索系统的整体构造:一次搜索的四层,以及多次搜索之间由搜索配置和搜索演化形成的关系。下一章从搜索初始化开始,检查 AI 在开口之前已经拥有的状态。
章节信息
- 所属篇目:第一篇 · 重新认识 AI
- 本章回答的核心问题:它改变了搜索系统哪一部分?——给出搜索系统的完整构造:一次搜索的四层模型,以及贯通多次搜索的搜索配置与搜索演化