外观
为什么"让 AI 扮演用户"测不出产品问题?
柏林ACS · 2026-09-14 · 读完约需 8 分钟
方案做完了,评审也过了。还想再稳一点:用户会买账吗?
打开对话框:请你扮演我们的目标用户,看到这项新功能会怎么想?
AI 很快交出一份"用户反馈":有人担心学习成本,有人对其中一处设计眼前一亮,有人问了一个你没想到的问题。语气、顾虑、惊喜的位置,全都像真的。
这份报告只有一个问题:它不是用户反馈。
它是沿着方案的路径继续搜索,得到的一段文本。
书里记录过一个真实的教训。一个产品团队要做积分体系,AI 交出了一份堪称范本的方案:获取规则、消耗场景、等级设计、防刷机制,还有三个行业标杆的对标分析。评审会上没有人提出像样的反对意见。
方案上线,三个月后下线——真正用起来的用户寥寥无几。复盘时最刺耳的一句话是:"方案本身挑不出错。"
问题恰恰在这里。方案是自洽的,沿着同一条路径继续搜索,得到的任何结论都会同样自洽。积分体系做得很漂亮,那么"用户"对它就没有大意见;方案假设了用户需要激励,那么"用户"的反馈就在激励的框架里打转。上一轮搜索形成的框架,会成为下一轮搜索的默认起点——上一篇聊的搜索路径依赖说的正是这件事:连续对话里,AI 会沿着刚走过的路继续走。
所以让 AI 扮演用户,得到的通常不是"用户会怎么想",而是"这个方案认为用户会怎么想"。模拟用户的 AI 和做方案的 AI,共享同一片认知空间,它们可能带着同样的盲区,互相盖章。
书里给这个区分起了个名字:反思,不是验证。
两个词的分工完全不同。反思负责把搜索做得更充分:它能帮你发现没考虑到的场景,逼出几个你没问过的问题,让方案在出门之前多经受几轮压力测试。这些都很有价值。
验证负责判定。判定要来自真实的人和真实的数据——而这恰恰是产品领域最稀缺的东西。代码写错了,有编译器和测试拦着,判定的成本接近于零;产品方案错了,往往没有低成本的东西拦住它,直到真实用户用脚投票,代价是几个月的开发量和用户的信任。
正因为验证昂贵,每一次低成本的验证机会都该省着用。还是那个团队:他们没有把"AI 用户很满意"写进决策依据,而是把改版方案做成可点击原型,找了八位目标用户实测;后来又做了小流量灰度,看十分钟流失率的真实变化。数据显示用户卡在首次使用的第十分钟,卡在一个与激励毫无关系的理解成本上——这个结论,任何角色扮演都给不出来。
所以在验证昂贵的领域,AI 的正确角色是书里那句话:不是裁判,是陪练。陪练负责把每一回合的搜索打充分——反方的檄文、一年后的死因复盘、完全不做积分的替代路径;判定得分,交给人和数据。
这里有一个很实用的自检:下次想让 AI 扮演用户之前,先问自己一句——这一步我要的是反思,还是验证?
要的是反思,就放开用,最好一次多演几个立场:最挑剔的用户、最先流失的用户、你的竞品产品经理。它发现的每个新场景,都是搜索空间的一次扩容。
要的是验证,就停下来。八位真实用户的十分钟,胜过一千次角色扮演。
把这套分工装进日常协作,我把自己项目里沉淀的三个技能开源在了 acs-skills:开工前的四层诊断、完工后的复盘提炼、定期的配置体检,对应的正是"AI 做充分、人来判定"的分工。完整的理论推导在《AI认知搜索理论》第十六章,随连载后续公开。