Skip to content

第五章 搜索目标

为什么 AI 容易给出"正确的废话"

这样的回答并不少见。

你问 AI:"这个功能要不要做?"它给出一份周全的分析:做,有三个好处;不做,有两个风险;还有两个折中方案。最后总结:"具体是否需要,建议结合实际情况权衡。"

每一步都对。每一条都有道理。读完之后,你比读之前更不知道怎么决定了。

有人把这种回答称为"正确的废话":它无法被反驳,也无法被使用。

换一种问法,在问题后补上一句背景:

"这个功能要不要做?我们团队只有四个人,目标是三个月内验证用户是否愿意为它付费。"

回答随之改变。它给出明确倾向,砍掉两个"有意思但不紧急"的方向,还指出验证付费意愿有更便宜的替代路径。回答有了立场、取舍和行动方向。

补充的那句话没有增加任何事实:功能还是那个功能,AI 的知识还是那些知识。

补上的究竟是什么?

搜索需要知道"什么算好"

第四章拆开了四层模型的第一层:搜索从什么状态出发。本章讨论第二层,追问搜索为了什么而进行。

先看"正确的废话"是怎么产生的。一次搜索要产出回答,就必然需要某个标准,在无数条可能路径中选出"最好"的一条。

你不给标准,它也不会空缺,只会落回一个默认值:"一个稳妥的、放到任何场景都挑不出错的回答。"

而"放到任何场景都挑不出错",恰恰意味着不属于任何场景。于是搜索的轨迹自动收敛到各种立场的中间地带:好处也列出,风险也列出,结论留给你。面面俱到与毫无立场,是同一种搜索的一体两面。

那句背景改变了什么?"四个人、三个月、验证付费意愿"替换了默认标准。它同时带来资源限制和验证目标:团队只有四个人,要在三个月内确认用户是否愿意付费。此时,"最好"有了具体含义——资源消耗要小,验证速度要快,不确定性要优先排除。

标准一变,同一片搜索空间里,被判定为"好"的路径立刻换了位置。

这正是第二层要处理的事情:搜索目标(Search Objective),决定这次搜索为什么进行,以及什么答案算最好。

它由三个部件构成:目标、评价函数、成功标准。这里的"目标"指搜索的意图本身,是这一层的一个部件;"搜索目标"则是整层的名称。

目标:最终取舍需要由人确认

"写一份新能源汽车市场的分析"——这是任务。"我们要决定明年是否进入这个市场"——这是目标。同一个任务,挂在不同的目标上,就是两次完全不同的搜索:为了"是否进入",分析必须服务于取舍,重点在风险与门槛;为了"给新同事做行业培训",同样的主题,重点变成了结构与全貌。

任务描述动作,目标描述意图。

这是人机协作的一条分界线:搜索系统可以提出目标候选、代理指标和权衡方案,却不应自行决定最终价值取舍。目标回答"为什么搜索",例如为了商业价值、用户价值、风险控制或探索可能。这些判断需要由人或明确的负责主体确认。把目标说清楚,是人的职责。

四层模型有一个常见的启动顺序:初始化决定搜索从哪里出发,目标决定朝哪个价值方向搜索,空间和运行在此基础上展开。但运行中的反馈可能暴露目标偏差,促使人重新确认目标,而不是只把它执行到底。

空间再大,只是在错误方向上看得更全;运行再充分,只是更快地到达错误的答案。目标定错了,执行得越好,偏离越远。

反过来,目标定得准,也会影响整次搜索。知识可能已经在模型体内,但没有方向,搜索未必会走到相关区域。设定目标,正是把这段距离补上;这也是目标被单独列为一层的原因。

评价函数:什么答案算最好

目标定了方向,还需要一把尺子来衡量路径的优劣。这把尺子称为评价函数(Evaluation Function):决定什么答案算最好。

让 AI 设计一个数据同步方案:

  • 评价函数是"可维护":它会给出结构朴素、边界清晰、新人三天能接手的方案;
  • 评价函数是"性能":它会容忍复杂度,换取出吞吐量;
  • 评价函数是"最快上线":它会直接建议你先用现成的第三方服务,把自研推到二期。

同一个问题,三把尺子会量出三种答案。不存在脱离评价函数的"好方案";只有指定了尺子,"好"才有具体含义。

评价函数不一定明说,但始终在起作用。你不指定,它就使用默认值;"请综合分析一下"听起来面面俱到,实际上把尺子交了出去。

成功标准:搜索什么时候算完成

搜索到哪里算完?

没有完成标准,搜索容易走向两个极端。它可能过早停下,把第一条看似合理的路径当成答案;也可能迟迟不停,分析一层叠一层,回答越来越长,始终没有结论。第一章所说的迎合,常常属于前一种情况。

成功标准(Success Criteria)就是给搜索设定的完成线:什么条件满足,这次搜索就可以交付。对比一下两种问法:

问法1:"分析一下这个方案。"

问法2:"从可行性和成本两个角度评估这个方案,给出明确结论:做、不做、还是补充信息后再定;如果现有信息不足以下结论,列出还缺哪些信息。"

前者的搜索是开放式的,走到哪里算哪里;后者规定了完成形态:必须有明确结论,信息不足时要指出缺口。第二种问法没有限制深度,只定义了"完成"。成功标准约束的不是想多少,而是什么时候算想完。

它还有一个作用:为搜索提供"报告失败"的出口。没有成功标准时,"信息不足,无法下结论"容易被视为坏回答,搜索反而可能编一个结论交差;有了明确标准,指出缺口本身就是合格的完成。

目标层的完整结构

三个部件合起来,第二层的全貌如下:

三者相互衔接:目标决定朝哪个价值方向搜索,评价函数决定如何比较路径,成功标准决定什么时候交付结果。

诊断一次"正确但无用"的回答,可以检查:目标是否说清,评价函数是否明确,完成形态是否定义。三个位置中,往往至少有一个是空的。

把做法放回目标层

目标层的常见做法对照如下:

常见做法所属部件机制
"我们的目标是三个月内验证付费意愿"目标为搜索设定价值方向
"从可维护性角度评估,而不是性能"评价函数显式指定比较路径的尺子
"评价时先看风险,再看收益"评价函数调整评价函数内部的优先级
"给出三个方案,并明确推荐一个"成功标准规定完成的形态,禁止开放式列举
"如果信息不足以下结论,列出还缺什么"成功标准给"报告失败"一个合法出口
"请综合、全面、客观地分析"——反模式:把评价函数交还给默认值

目标如何改变取舍

一个产品团队每个季度用 AI 辅助需求优先级评估,结果年复一年地令人失望。AI 把二十几个需求分析得头头是道,最后的结论是"每个需求都有其价值"。团队负责人苦笑:我要的不是分析报告,是取舍。

问题出在目标层完全缺席。目标没有给出,本季度究竟要留存还是拉新;评价函数没有给出,需求按什么标准比较;成功标准没有给出,输出到什么程度算完成。AI 手里的尺子只剩默认值,于是每个需求都"有价值"。

第二个季度,他们在提问前补了三行设定:

本季度目标:提升次月留存,拉新不在本季度考虑范围内;

评价函数:预估对留存的影响 ÷ 开发成本,影响相当时,优先改动风险小的;

完成形态:输出排序后的前五名,并明确指出哪五个需求本季度明确不做,说明放弃理由。

输出完全不同了:清单有了顺序,也列出"明确不做"的需求和理由。团队没有照单全收,其中两个判断在会上被数据推翻。

被推翻本身就是价值。没有目标和尺子,AI 给出什么就只能接受什么;有了明确标准,每个结论都可以判断、争论和修正。评估会议从"挨个讨论二十几个需求"变成"争论前五名的排序",两小时结束时,还形成了书面的取舍记录。

边界问题

"目标就是 Prompt 里的那句任务描述"

任务描述说明做什么,目标说明为什么、什么算好。"写一份市场分析"是任务,"用于决定是否进入这个市场"是目标。只给任务不给目标,等于告诉搜索怎么走,却不告诉它朝哪儿走。

"需求写得很具体,目标还需要单说吗"

"做个主题设置。"这个需求,听起来已经很清楚了。

AI 开始干活:定义黑白主题,字体、字号、行高提供自定义设置,再把用户偏好存下来。做起来也确实很顺利。

但这个需求却持续优化了六轮,在第六轮开发者突然说了一句:"我们是字多的场景,在当前的主题下看久了眼睛还是累。"

这时候再回头看,前面几轮都没有做错。只是大家一直在解决"主题怎么做",却没有真正说清楚"为什么需要主题"。

如果当时的问题是"阅读时间长了容易累",方案可能从一开始就不一样。黑白主题、字号、行高只是可能的手段,暖纸主题也许很早就会出现。

这类需求有一个很容易忽略的地方:它看起来越具体,越容易让人以为目标已经明确。

再看到"做一个主题设置"这样的需求,可以先问一句:

它到底想解决什么问题?

"定了评价标准,会限制 AI 的发挥"

不指定评价函数,评价并不会消失,只会落回"稳妥、谁都不得罪"的默认值。显式的尺子不会让搜索变窄,只会让"好"有章可循。

"成功标准会让思考变浅"

成功标准定义的是完成的形态,不是思考的深度。"给出明确结论"不要求想得少,它要求想完之后必须有个交代。真正让思考变浅的,是没有标准时的过早停。

"目标和上一章的角色初始化,有什么区别"

角色回答"以什么姿态搜索",目标回答"为什么搜索、什么算好"。两者经常一起出现,但层级不同:角色是初始状态的一部分,服务于目标。"你是严苛的评审"设定姿态,"本次评审以拦截线上风险为最高标准"设定目标:前者帮搜索进入状态,后者告诉搜索什么算好。

本章总结

本章从一个高频的挫败感开始:AI 的回答面面俱到,却毫无用处。走完目标层再遇到它,处理方式已经不同:不再和 AI 争论回答好不好,而是回头检查目标层的三个部件。

本章改变的是四层模型的第二层——搜索目标。初始状态决定搜索能跑出什么,目标决定什么结果算好。接下来的问题是:这次搜索究竟能去哪些地方、有哪些路可以走?这是搜索空间要回答的,也是下一章的主题。

章节信息

  • 所属篇目:第二篇 · 一次认知搜索
  • 本章回答的核心问题:它改变了搜索系统哪一部分?——四层模型的第二层:搜索目标(目标定方向,评价函数定尺子,成功标准定完成线)