方法

不是多问几个AI问题,而是控制研究条件。

PersonaSignal 从一个具体的消费者情境开始,控制品牌提示、产品信息、模型、搜索状态与测试条件,再比较这些条件下出现的回答和推荐结果。

可观察边界我们研究可观察的回答、描述与推荐行为,不声称读取 AI 的隐藏推理、内部权重或专有排序规则。

01

研究对象

我们测试的,
不只是“AI知不知道品牌”。

识别一个品牌、复述它的产品信息,与在具体购买问题中选择并推荐它,是不同的可观察现象。PersonaSignal 把重点放在后者,同时保留对回答内容和证据充分程度的记录。

可观察状态 A品牌识别

AI 能说出品牌、产品或网站信息。

可观察状态 B推荐

AI 在一个具体消费者需求中选择该品牌或产品。

统一状态语言

用于描述单次或汇总后的可观察结果;它们不是品牌评分。

已提及
答案提到品牌,但没有把它作为明确推荐。
未入选
测试对象没有进入最终选择,答案推荐了其他选项或没有选择它。
未知 / 证据不足
答案不足以支持清晰分类,需要保留不确定性。

状态记录回答中发生了什么,不自动解释为什么发生。

02

消费者优先

先定义“谁在问”,
再观察AI推荐什么。

研究不是从一个孤立关键词开始,而是先构造多个结构化消费者情境:人物、任务、完整需要、筛选条件与产品匹配信息共同限定问题。

  1. 01

    消费者

    谁在做决定

    生活阶段、经验水平、家庭或个人背景等与购买有关的信息。
  2. 02

    场景 / 任务

    正在完成什么任务

    国家、气候、使用环境、购买时点与实际任务。
  3. 03

    完整需求

    完整需要是什么

    目标、使用方式、预算、偏好、必须满足与不能接受的条件。
  4. 04

    筛选标准

    如何筛选选择

    把完整需要整理为可用于比较产品的明确判断条件。
  5. 05

    产品匹配

    产品如何对应需要

    观察公开产品信息是否足以支持匹配、区分或排除。
  6. 06

    AI 推荐结果

    AI 最终推荐什么

    记录进入候选、被推荐、被提及或未被选择的品牌与产品。

测试设计框架

这六个阶段用于设计测试与整理观察,不代表 AI 内部必然按照同一顺序推理。PersonaSignal 会使用多个结构化消费者情境进行比较,但不声称这些情境代表全部真实消费者。

03

三种测试模式

改变一个关键条件,
看看推荐结果怎么变。

三种模式从同一个消费者情境出发,改变研究对象可获得的品牌或产品信息。它们回答不同问题,也为后续对照提供清楚的输入记录。

A

自然盲测

自然推荐

不主动提供被研究品牌名称,从消费者的需要直接提问。

观察

品牌是否自然进入回答、候选与推荐,以及哪些替代品牌出现。

B

品牌理解

品牌理解

明确提供品牌名称,观察 AI 如何识别和描述品牌与定位。

观察

品牌信息是否被准确理解,以及“知道品牌”是否转化为具体推荐。

C

产品 / 消费者适配

产品 / 消费者匹配

提供与研究相关的产品公开信息,再放回相同消费者需要中比较。

观察

产品信息是否改变匹配判断、推荐状态或替代选择。

04

对照比较

保持消费者不变,
只改变提供给AI的信息。

对照设计让每次差异都有可追溯的输入背景。观察到的变化是进一步检查的线索,不自动构成因果证明。

保持恒定

相同消费者画像+相同购买需求
A

不提供品牌提示

不提供品牌提示

观察自然出现的品牌、产品与推荐状态。
B

提供品牌名称

提供品牌名称

观察品牌理解与推荐结果是否出现差异。
C

提供产品信息

提供产品信息

观察具体匹配与选择是否出现差异。

比较可观察输出

比较品牌出现、描述方式、推荐状态与替代选择,帮助识别值得进一步验证的差异

05

重复运行

一次回答,
不等于稳定结论。

同一个消费者情境可以在相同测试条件下重复运行,观察品牌、产品、竞品和推荐状态是否反复出现,以及结果在哪些位置发生变化。

相同测试条件

消费者画像 P-07 · 自然盲测 · 相同模型
示意运行记录
  1. 运行 01已推荐

    目标产品进入明确推荐。

    替代 · 品牌 A
  2. 运行 02已提及

    目标产品被提及,但没有成为明确选择。

    替代 · 品牌 B
  3. 运行 03已推荐

    目标产品再次进入明确推荐。

    替代 · 品牌 A
  4. 运行 04未入选

    答案选择了另一项产品。

    替代 · 品牌 C

观察

  • 重复出现的状态
  • 运行之间的变化
  • 替代品牌或产品
  • 无法清晰分类的回答

解读边界

重复运行帮助观察结果的重复性与变化,也帮助区分一次性现象和值得继续分析的模式;它不会自动让研究具有统计代表性,也不产生“置信分数”。

06

模型比较

同一个问题,
不同AI可能给出不同答案。

保持消费者情境和主要测试条件一致,再比较不同模型中的推荐、提及、替代和描述差异。

保持恒定

相同消费者画像+相同需求+相同测试模式
模型 A

GPT

示意输出

结果
主要替代
品牌 A
描述说明
回答更强调产品功能与筛选条件的匹配。
模型 B

Gemini

示意输出

结果
已提及
主要替代
品牌 B
描述说明
回答更强调使用情境与公开品牌描述。

比较比较模型特有差异、跨模型反复出现的模式、替代选择与描述方式,不把模型排列成高低榜单。

是否需要单模型或多模型测试,会根据研究目标与范围确认。PersonaSignal 不预设某个模型在所有研究问题中都更好。

07

搜索 / Grounding

打开搜索以后,
研究的不只是推荐结果。

当 AI 可以调用公开网络信息时,PersonaSignal 还可以记录答案中出现的公开来源,并比较开启搜索前后的回答差异。

相同消费者画像 + 相同需求

示意比较
A

未联网

不调用公开网络信息

推荐
记录推荐状态
提及
记录品牌是否出现
替代
记录替代品牌或产品
来源引用
当前条件不适用
B

搜索 / 已联网

允许调用公开网络信息

推荐
记录推荐状态
提及
记录品牌是否出现
替代
记录替代品牌或产品
来源引用
记录答案中出现的公开来源

观察到的来源类型

  • 01官方网站
  • 02零售
  • 03媒体内容
  • 04社区

比较可观察输出

比较推荐、提及、替代选择与来源记录如何变化。来源类型用于整理答案中的公开信息环境,不是来源质量分数。

来源边界

记录某个来源出现在回答中,不等于证明该来源单独导致了推荐结果。PersonaSignal 也不声称知道模型在内部如何为每个来源分配权重。

08

人工核查与可追溯性

模型负责回答,
人负责把证据整理清楚。

自动运行产生原始回答,但最终诊断还需要把 Persona、测试条件、模型、运行记录、推荐状态和来源重新对应起来。

  1. 01

    原始运行

    原始回答

  2. 02

    结构化记录

    结构化记录

  3. 03

    状态分类

    状态分类

  4. 04

    来源与上下文核对

    来源与上下文核对

  5. 05

    人工复核

    人工复核

  6. 06

    报告发现

    报告发现

可追溯的结构化记录

每条发现,可以回到测试记录。

示例字段与示例报告的原始数据结构保持同一逻辑;以下内容仅用于说明记录方式。

运行 IDRUN-024
消费者画像 IDP-07
测试模式自然盲测
模型GPT
Grounding 状态未联网
推荐结果已提及
主要替代品牌 A
来源记录不适用
核查状态已核查

人工复核边界

人工复核的作用是核对分类、上下文和证据记录,处理模糊回答、替代选择与明显信息冲突;它不是把主观判断包装成模型结论,也不是决定 AI “应该”回答什么。

09

证据边界

这些结果能说明什么,
又不能说明什么?

研究价值来自对条件和证据边界的清楚说明。结论应准确描述测试中观察到的行为,而不是把有限观察扩大成普遍事实。

研究可以支持的观察

研究可以支持的观察

可观察的推荐行为
在设定的 Persona、模型和测试条件中,品牌是否被推荐、提及或未被选择。
反复出现的模式
某些结果是否在重复运行或多个相关场景中反复出现。
竞品替代
品牌未被选择时,哪些替代品牌或产品在测试场景中出现。
模型差异
相同测试设计下,不同模型是否表现出不同的推荐或描述行为。
Grounding / 来源环境
开启搜索后,答案中出现或引用了哪些公开来源。
值得核查的信息问题
官网公开信息中是否存在值得进一步澄清、核对或测试的缺失、模糊或冲突。

研究不能自动证明的事项

研究不能自动证明的事项

全市场行为
测试结果不自动代表全部消费者或整个市场。
统计代表性
除非项目另有明确设计与验证,否则不能称为统计代表性样本。
隐藏推理
不能从回答反推出 AI 内部隐藏推理链、模型权重或专有排序规则。
因果归因
某个来源、页面或文案变化与推荐结果同时出现差异,不自动证明单一因果关系。
保证优化效果
不能保证修改网站后推荐率一定提升。
永久模型行为
模型、搜索结果和公开信息环境会变化,研究结果具有测试时间与条件边界。

方法总结

把推荐问题,
变成可以比较和复核的研究。

PersonaSignal 不是试图解释 AI “为什么这样想”,而是通过结构化消费者情境、控制测试条件、重复观察、模型比较和人工复核,把推荐行为整理成可以检查的证据。

结论始终保留 Persona、模型、搜索状态、测试时间和公开信息环境的条件边界。